PDF OCR – स्कैन PDF को सर्च करने लायक बनाएँ
स्कैन की गई PDF और फोटो को 15 भाषाओं में OCR से सर्च करने लायक बनाएँ। सर्च होने वाली PDF या प्लेन टेक्स्ट पाएँ, ब्राउज़र में, बिना अपलोड।
स्कैन की गई PDF पर ऑनलाइन OCR कैसे करें
स्कैन किया हुआ डॉक्यूमेंट असल में पेज की एक फोटो होता है: उसमें न कुछ सर्च कर सकते हैं, न कोई लाइन सिलेक्ट कर सकते हैं, न कोई नंबर कॉपी कर सकते हैं। PDF OCR (ऑप्टिकल कैरेक्टर रिकग्निशन) उस फोटो के अक्षरों को पढ़कर असली टेक्स्ट में बदल देता है। आप ओरिजिनल लुक रखते हुए एक छिपी हुई टेक्स्ट लेयर जोड़ सकते हैं, जिससे सर्च होने वाली PDF बनती है, या सिर्फ़ पहचाना गया टेक्स्ट .txt फ़ाइल में डाउनलोड कर सकते हैं। पहचान का काम आपके ब्राउज़र में ओपन-सोर्स Tesseract इंजन से होता है, इसलिए आपका स्कैन आपके डिवाइस से बाहर नहीं जाता।
PDF पर OCR कैसे करें
- स्कैन की गई PDF या इमेज जोड़ें (PDF, JPG, PNG, WebP या BMP, 100 MB तक)। Ctrl+V से स्क्रीनशॉट भी पेस्ट कर सकते हैं।
- डॉक्यूमेंट की भाषा चुनें; डिफ़ॉल्ट रूप से यह इस पेज की भाषा होती है। दो भाषाओं वाले डॉक्यूमेंट के लिए दूसरी भाषा जोड़ें, जैसे हिन्दी और अंग्रेज़ी।
- आउटपुट चुनें: सर्च होने वाली PDF या प्लेन टेक्स्ट। PDF में आप OCR को कुछ पेजों तक सीमित कर सकते हैं, जैसे 1-3, 7।
- टेक्स्ट पहचानें पर क्लिक करें। पहली बार भाषा का डेटा डाउनलोड होता है, फिर कैश हो जाता है। प्रोग्रेस पेज-दर-पेज दिखती है।
- फ़ाइल-ocr.pdf या फ़ाइल.txt डाउनलोड करें।
सपोर्टेड भाषाएँ
अंग्रेज़ी, फ़्रेंच, स्पैनिश, जर्मन, इटालियन, पुर्तगाली, रूसी, अरबी, हिन्दी, चीनी (सरल और पारंपरिक), जापानी, कोरियन, तुर्की और उर्दू। सही भाषा चुनना बहुत ज़रूरी है, क्योंकि इससे इंजन को पता चलता है कि कौन सी लिपि और कौन से शब्द आएँगे। दूसरी भाषा तभी जोड़ें जब डॉक्यूमेंट में सच में हो, क्योंकि हर अतिरिक्त भाषा प्रोसेस को धीमा करती है।
सर्च होने वाली PDF कैसी दिखती है
आपके पेज बदले या दोबारा कंप्रेस नहीं होते। पहचान के लिए हर पेज 300 DPI तक रेंडर होता है और पहचाने गए शब्द छपे हुए शब्दों के ठीक ऊपर छिपी लेयर में रखे जाते हैं। डॉक्यूमेंट पहले जैसा दिखता है, पर Ctrl+F से शब्द मिलते हैं, आप टेक्स्ट हाइलाइट और कॉपी कर सकते हैं।
OCR कितना सही होता है?
- सबसे अच्छे नतीजे: 300 DPI पर स्कैन किया गया साफ़ छपा टेक्स्ट, सीधे पेज और अच्छा कंट्रास्ट।
- कमज़ोर नतीजे: धुंधली मोबाइल फोटो, बहुत छोटे अक्षर, टेढ़े पेज, रंगीन बैकग्राउंड और सजावटी फ़ॉन्ट।
- उपयुक्त नहीं: हाथ से लिखा टेक्स्ट, जिसे Tesseract भरोसेमंद तरीके से नहीं पढ़ता।
- हिन्दी, अरबी और चीनी जैसी लिपियों के लिए आम तौर पर लैटिन टेक्स्ट से ज़्यादा साफ़ स्कैन चाहिए। ज़रूरी नंबर, नाम और तारीख़ ज़रूर जाँचें।
टिप्स और जुड़े टूल
- कागज़ की फोटो ले रहे हैं? स्कैन से PDF OCR से पहले पेज सीधे और साफ़ करता है।
- स्ट्रक्चर्ड टेक्स्ट चाहिए तो OCR के बाद PDF को PDF से Markdown में बदलें।
- अगर PDF में पहले से सिलेक्ट होने वाला टेक्स्ट है, तो PDF टेक्स्ट एक्सट्रैक्टर तुरंत और सटीक काम करता है।
प्राइवेट और फ्री
पहचान आपके कंप्यूटर या फ़ोन पर होती है, इसलिए कॉन्ट्रैक्ट, ID कार्ड या मेडिकल रिपोर्ट WoowPDF पर कभी अपलोड नहीं होते। सिर्फ़ भाषा मॉडल डाउनलोड होता है। न साइन-अप, न रोज़ की लिमिट, न वॉटरमार्क। स्पीड आपके डिवाइस पर निर्भर है: लैपटॉप पर हर पेज को कुछ सेकंड।
विशेषताएँ
- 15 भाषाओं में OCR, वैकल्पिक दूसरी भाषा
- छिपी टेक्स्ट लेयर वाली सर्च होने वाली PDF
- पेज मार्कर के साथ प्लेन टेक्स्ट (.txt)
- स्कैन PDF और JPG, PNG, WebP, BMP इमेज
- सभी पेज या चुनी हुई पेज रेंज
- ब्राउज़र में प्रोसेसिंग, फ़ाइल अपलोड नहीं
अक्सर पूछे जाने वाले सवाल
PDF OCR क्या है?
OCR स्कैन या फोटो वाले पेज का टेक्स्ट पढ़कर उसे असली अक्षरों में बदलता है, ताकि आप उसे सर्च और कॉपी कर सकें।
क्या मेरा स्कैन अपलोड होता है?
नहीं। पहचान आपके ब्राउज़र में Tesseract से होती है; सिर्फ़ भाषा डेटा एक बार डाउनलोड होता है।
कौन सी भाषाएँ सपोर्ट हैं?
अंग्रेज़ी, फ़्रेंच, स्पैनिश, जर्मन, इटालियन, पुर्तगाली, रूसी, अरबी, हिन्दी, चीनी सरल और पारंपरिक, जापानी, कोरियन, तुर्की और उर्दू; दो भाषाएँ साथ चुन सकते हैं।
सर्च होने वाली PDF और प्लेन टेक्स्ट में क्या फ़र्क है?
सर्च होने वाली PDF आपके पेज वैसे ही रखती है और ऊपर छिपी टेक्स्ट लेयर जोड़ती है। प्लेन टेक्स्ट में सिर्फ़ पहचाने गए शब्द .txt फ़ाइल में मिलते हैं।
क्या यह हाथ की लिखावट पढ़ता है?
भरोसेमंद तरीके से नहीं, क्योंकि इंजन छपे हुए टेक्स्ट पर ट्रेन है।
OCR की सटीकता कैसे बढ़ाएँ?
लगभग 300 DPI का साफ़ स्कैन, सीधे पेज और सही भाषा इस्तेमाल करें, बेवजह दूसरी भाषा न जोड़ें।