PDF का OCR कैसे करें (उसे सर्च-योग्य बनाएं)
स्कैन किए गए PDF को OCR से सर्च-योग्य बनाने की चरण-दर-चरण गाइड: दस्तावेज़ की भाषाएं चुनें, टेक्स्ट लेयर ब्राउज़र में ही लोकल जुड़ती है, फ़ाइलें कभी अपलोड नहीं होतीं।
टेक्स्ट पहचानेंस्कैन किया गया PDF टेक्स्ट की तस्वीर जैसा होता है: पढ़ने में साफ़ लगता है, लेकिन किसी भी सर्च बॉक्स, कॉपी-पेस्ट और टेक्स्ट एक्सट्रैक्टर के लिहाज़ से वे पेज खाली होते हैं। OCR (ऑप्टिकल कैरेक्टर रिकग्निशन) अक्षरों को पहचानकर स्कैन के ऊपर एक अदृश्य टेक्स्ट लेयर जोड़कर यह ठीक करता है। यह गाइड बताती है कि AmiPDF के OCR PDF टूल से यह कैसे करें, जो पूरी पहचान आपके ब्राउज़र में ही चलाता है: फ़ाइल कभी आपके डिवाइस से बाहर नहीं जाती, जो कॉन्ट्रैक्ट, मेडिकल रिकॉर्ड और पहचान पत्रों के लिए मायने रखता है। आप एक या अधिक दस्तावेज़ भाषाएं चुनते हैं, टूल हर पेज को पहचानता है, और आउटपुट वही PDF होता है, जो अब सर्च और कॉपी करने योग्य है।
OCR चलाना, चरण दर चरण
OCR टूल खोलें और अपना स्कैन जोड़ें
AmiPDF के OCR PDF टूल पर जाएं और अपना स्कैन किया हुआ PDF अपलोड क्षेत्र पर ड्रॉप करें। टूल की पेज सीमा तक के स्कैन किए गए दस्तावेज़ स्वीकार किए जाते हैं; अगर आपका स्कैन लंबी किताब है, तो पहले split PDF से उसे भागों में बांटें और हर हिस्से को अलग से प्रोसेस करें।

दस्तावेज़ की भाषाएं चुनें
दस्तावेज़ में मौजूद हर भाषा चुनें, प्रति रन सीमा तक। जब टेक्स्ट में सचमुच कई भाषाएं मिली हों, तो दो या तीन भाषाएं चुनने से पहचान बेहतर होती है; जो भाषाएं दस्तावेज़ में नहीं हैं उन्हें जोड़ने से रन सिर्फ़ धीमा होता है। इंजन और भाषा पैक पहली बार इस्तेमाल पर एक बार डाउनलोड होते हैं और उसके बाद कैश में रहते हैं।

पहचान चलाएं
शुरू करें पर क्लिक करें और हर पेज की प्रगति देखें। पहचान आपके डिवाइस पर WebAssembly से होती है; 10 पेज के स्कैन में आम तौर पर आपकी मशीन के हिसाब से कुछ मिनट लगते हैं। रन पूरा होने तक टैब खुला रखें; टूल आउटपुट खुद तैयार कर देता है।

सर्च-योग्य PDF डाउनलोड करें
नतीजा सेव करें; यह वही दिखने वाला दस्तावेज़ है, बस अब उसके नीचे एक अदृश्य टेक्स्ट लेयर है। सर्च किसी भी PDF रीडर में काम करती है, कॉपी-पेस्ट में असली टेक्स्ट मिलता है, और बाद में आप PDF to Markdown से सामग्री बाहर निकाल सकते हैं। एक बटन पहचाने गए कच्चे टेक्स्ट को .txt फ़ाइल के रूप में भी देता है, जिससे जल्दी जांच हो सके।

सबसे अच्छे नतीजे पाने के लिए
साफ़ स्कैन बेहतर पहचाने जाते हैं
सीधे, एक समान रोशनी वाले, 300 DPI पेज सबसे उपयुक्त रहते हैं। तिरछी फ़ोन फ़ोटो के किनारों पर सटीकता घटती है; अगर स्रोत फ़ोन कैमरा है, तो पहले सीधा करें और क्रॉप करें; crop PDF टूल उन गहरे किनारों को काट सकता है जो पहचान में गड़बड़ करते हैं।
टेक्स्ट प्रीव्यू जांचें
OCR सांख्यिकीय है: 100% सटीकता की गारंटी नहीं है, खासकर असामान्य फ़ॉन्ट या कम कंट्रास्ट में। सर्च पर भरोसा करने से पहले निकाले गए टेक्स्ट व्यू में कुछ पैराग्राफ जांचें, और अगर आउटपुट बिगड़ा लगे तो भाषाएं बदलकर दोबारा चलाएं।
टेक्स्ट-आधारित PDF पर OCR छोड़ दें
अगर टूल बताए कि दस्तावेज़ में पहले से टेक्स्ट लेयर है, तो आपको इसकी ज़रूरत नहीं; PDF to Word जैसे एक्सट्रैक्शन टूल सीधे काम करते हैं और सेकंडों में पूरे हो जाते हैं।
अक्सर पूछे जाने वाले सवाल
क्या मेरी फ़ाइल सचमुच कहीं अपलोड नहीं होती?
सही: पहचान आपके ब्राउज़र में WebAssembly से चलती है। नेटवर्क पर सिर्फ़ OCR इंजन और भाषा पैक का एक बार का डाउनलोड होता है, जो आगे के रन के लिए कैश हो जाता है।
मैं कितनी भाषाएं चुन सकता हूं?
पेज पर दिखाई गई प्रति रन सीमा तक। भाषाएं खुलकर मिलाएं, जैसे एक द्विभाषी कॉन्ट्रैक्ट में अंग्रेज़ी और चीनी, लेकिन जो भाषाएं दस्तावेज़ में नहीं हैं उन्हें छोड़ दें; वे सिर्फ़ रन धीमा करती हैं।
क्या OCR से मेरे स्कैन का रूप बदल जाएगा?
नहीं। पेज अपना मूल रूप बनाए रखते हैं; पहचाना गया टेक्स्ट स्कैन के नीचे रखी एक अदृश्य लेयर के रूप में जुड़ता है। आपको वही दस्तावेज़ दिखता है, लेकिन सर्च और कॉपी अब काम करते हैं।