स्कैन और फ़ोटो से टेक्स्ट निकालें
स्कैन किया गया दस्तावेज़ असल में टेक्स्ट की तस्वीर होता है, इसलिए उसमें कॉपी करना, सर्च करना और सेलेक्ट करना काम नहीं करता। OCR उन अक्षरों को दोबारा पढ़कर बाहर निकालता है। आपको या तो सादा टेक्स्ट मिलता है, या वही दस्तावेज़ जिसमें एक अदृश्य टेक्स्ट लेयर जोड़ दी जाती है ताकि वह एक सामान्य PDF की तरह काम करे।
- स्कैन किए गए PDF और फ़ोटो, 200 पेज तक
- सात भाषाएँ, जिनमें रूसी, जापानी और चीनी शामिल हैं
- सर्चेबल PDF में पेज बिल्कुल पहले जैसे ही दिखते हैं
- फ़ाइलें अपने आप हटा दी जाती हैं — मुफ़्त में 24 घंटे, पेड प्लान पर 7 दिन
PDF, PNG, JPG, TIFF, BMP, GIF, WebP या HEIC।
वही भाषा चुनें जो असल में पेज पर है। ग़लत भाषा चुनने पर प्रोसेस फ़ेल नहीं होता — नतीजा बेमतलब आता है।
स्कैन से टेक्स्ट कैसे निकालें
- 01
स्कैन या फ़ोटो अपलोड करें
स्कैन किया गया PDF या पेज की इमेज चुनें। कई पेज वाले PDF को क्रम से, एक-एक पेज करके पढ़ा जाता है।
- 02
भाषा चुनें
वही भाषा चुनें जिसमें दस्तावेज़ असल में लिखा है। यह सुनने में जितना मामूली लगता है, उससे कहीं ज़्यादा मायने रखता है: ग़लत भाषा चुनने पर एरर नहीं आता, बल्कि आत्मविश्वास से भरा बेमतलब नतीजा आता है।
- 03
सादा टेक्स्ट या सर्चेबल PDF चुनें
सादा टेक्स्ट आपको कॉपी करने लायक अक्षर देता है। सर्चेबल PDF मूल पेज लौटाता है जिनमें एक छिपी हुई टेक्स्ट लेयर होती है, यानी फ़ाइल दिखने में वैसी ही रहती है लेकिन उसे सर्च और सेलेक्ट किया जा सकता है।
- 04
नतीजा पढ़ें या डाउनलोड करें
टेक्स्ट पेज पर ही कॉपी करने के लिए तैयार दिखता है; सर्चेबल PDF तुरंत डाउनलोड हो जाता है।
सटीकता किन बातों पर निर्भर करती है
रिज़ॉल्यूशन। पढ़ने से पहले पेज 300 DPI पर रेंडर किए जाते हैं, यही स्तर Tesseract के अपने दस्तावेज़ीकरण में सुझाया गया है। दूर से खींची गई फ़ोटो, या 100 DPI पर बनाया गया स्कैन, इंजन को काम करने के लिए कम जानकारी देता है।
सीधापन और फ़ोकस। तिरछे कोण से खींचा गया पेज, या ऐसा पेज जिसमें किताब की सिलाई के पास टेक्स्ट मुड़ जाता है, सपाट स्कैन के मुक़ाबले साफ़ तौर पर ख़राब पढ़ा जाता है।
भाषा। हर भाषा का अपना ट्रेंड मॉडल होता है। सिरिलिक या जापानी टेक्स्ट को अंग्रेज़ी मॉडल से पढ़वाने पर एरर नहीं मिलता, बल्कि देखने में भाषा जैसा लगने वाला कचरा मिलता है — इसीलिए चयन सूची में सिर्फ़ वही भाषाएँ दी जाती हैं जिन्हें सर्वर वाक़ई लोड कर सकता है।
OCR क्या नहीं करता। लेआउट सुरक्षित नहीं रहता: कॉलम, टेबल और हेडर पढ़ने के क्रम में लगातार चलने वाले टेक्स्ट के रूप में वापस आते हैं। अगर मूल PDF में पहले से टेक्स्ट लेयर मौजूद है, तो उसे टेक्स्ट में बदलने पर वही लेयर इस्तेमाल होती है — जो सटीक, तुरंत और किसी भी OCR से बेहतर है।
लोग इसका इस्तेमाल किसलिए करते हैं
अनुबंध और इनवॉइस
स्कैन के रूप में आया कोई हस्ताक्षरित PDF, जिसे सर्चेबल फ़ाइल में बदल दिया जाता है ताकि बाद में कोई रेफ़रेंस नंबर ढूँढा जा सके।
फ़ोन से खींची गई रसीदें
रकम और तारीख़ें दोबारा टाइप करने के बजाय सीधे फ़ोटो से निकालें।
पुराने दस्तावेज़ और अभिलेख
बरसों पहले स्कैन किए गए काग़ज़ी रिकॉर्ड, पेज की दिखावट बदले बिना सर्चेबल बना दिए जाते हैं।
स्क्रीनशॉट और स्लाइड
ऐसी इमेज से टेक्स्ट वापस पाएँ जिसकी मूल फ़ाइल कब की ग़ायब हो चुकी है।
अक्सर पूछे जाने वाले सवाल
सर्चेबल PDF क्या है?
ऐसा PDF जो देखने में बिल्कुल वैसा ही होता है जैसा आपने स्कैन अपलोड किया था, जिसमें शब्दों के ऊपर पहचाने गए टेक्स्ट की एक अदृश्य लेयर सही जगह पर रखी होती है। पेज दिखने में अपरिवर्तित रहते हैं, लेकिन अब आप उन्हें सेलेक्ट, कॉपी और सर्च कर सकते हैं, और दूसरे सॉफ़्टवेयर भी ऐसा कर सकते हैं।
कौन-कौन सी भाषाएँ समर्थित हैं?
अंग्रेज़ी, रूसी, फ़्रेंच, जर्मन, स्पेनिश, जापानी और सरलीकृत चीनी। चयन सूची में ठीक वही दिखता है जिसे सर्वर लोड कर सकता है — ऐसी कोई भाषा कभी नहीं दी जाती जो चुपचाप बेमतलब नतीजा दे।
यह कितने पेज संभाल सकता है?
प्रति फ़ाइल 200 पेज तक। हर पेज को अलग से रेंडर करके पढ़ा जाता है, इसलिए लंबे दस्तावेज़ में उसी अनुपात में ज़्यादा समय लगता है।
क्या OCR इतना सटीक है कि उस पर भरोसा किया जा सके?
छपे हुए टेक्स्ट के साफ़, सीधे स्कैन के लिए यह बहुत सटीक है। हस्तलेख, कम रिज़ॉल्यूशन वाली फ़ोटो, तिरछे पेज और असामान्य फ़ॉन्ट — इन सबमें नतीजा काफ़ी ख़राब रहता है। जो आँकड़े मायने रखते हैं उन्हें हमेशा जाँच लें — OCR की ग़लतियाँ एरर जैसी नहीं, बल्कि भरोसेमंद दिखने वाले टेक्स्ट जैसी लगती हैं।
क्या आप मेरा दस्तावेज़ रखते हैं?
आपके प्लान की अवधारण अवधि से ज़्यादा नहीं: फ़्री पर और बिना अकाउंट वाले विज़िटर के लिए 24 घंटे, पेड प्लान पर 7 दिन। फ़ाइल TLS के ज़रिए भेजी जाती है और आपका नतीजा तैयार करने के अलावा किसी और काम में इस्तेमाल नहीं होती।
मेरे PDF में पहले से सेलेक्ट होने वाला टेक्स्ट है। क्या मुझे OCR चाहिए?
नहीं। अगर PDF में पहले से टेक्स्ट लेयर है, तो उसे टेक्स्ट में बदलने पर सीधे वही लेयर इस्तेमाल होती है, जो सटीक और तुरंत है। OCR तभी चलता है जब निकालने के लिए कुछ होता ही नहीं — यानी जब पेज वाक़ई सिर्फ़ एक इमेज हो।