PDF को टेक्स्ट में बदलें

PDF का पूरा टेक्स्ट ऐसी TXT फ़ाइल में निकालिए जिसे आप खोज, संपादित और कहीं भी दोबारा उपयोग कर सकें।

PDF से टेक्स्ट निकालिए — सामग्री, बिना लेआउट के

कभी-कभी बस शब्द ही चाहिए होते हैं। आपको अनुबंध की कोई धारा उद्धृत करनी है, कोई रिपोर्ट किसी स्क्रिप्ट में डालनी है, लंबे दस्तावेज़ में कोई आँकड़ा खोजना है या किसी मैनुअल की सामग्री नए सिस्टम में ले जानी है — और PDF का सुंदर लेआउट बस रास्ते में आता है। सादे टेक्स्ट में निकालने से सामग्री कॉलम, हेडर और सजावट के बिना मिल जाती है, ऐसी फ़ाइल में जिसे दुनिया का हर प्रोग्राम पढ़ सकता है।

अपनी PDF अपलोड कीजिए और टेक्स्ट निकालकर TXT फ़ाइल में लिख दिया जाता है, जो तुरंत डाउनलोड के लिए तैयार होती है। चूँकि सादे टेक्स्ट में कोई फ़ॉर्मैटिंग नहीं होती, परिणाम मूल दस्तावेज़ की तुलना में बहुत छोटा होता है और Notepad, TextEdit, किसी भी कोड एडिटर या किसी भी स्क्रिप्ट में तुरंत खुल जाता है। खोजने, अनुक्रमित करने, दूसरे एप्लिकेशन में कॉपी करने या स्वचालित प्रोसेसिंग में डालने के लिए यह आदर्श है।

एक महत्वपूर्ण सीमा है। यह टूल PDF के भीतर सहेजी टेक्स्ट परत पढ़ता है, इसलिए यह Word, Excel, ब्राउज़र या किसी लेआउट प्रोग्राम से निर्यात दस्तावेज़ों पर काम करता है। कागज़ स्कैन करके बनी PDF में अक्षरों के बजाय पृष्ठ की तस्वीरें होती हैं — वहाँ निकालने को कोई टेक्स्ट परत होती ही नहीं और परिणाम ख़ाली आएगा; उस स्थिति में अक्षर-पहचान चाहिए। अगर आपको फ़ॉर्मैटिंग समेत टेक्स्ट चाहिए तो «PDF से Word» इस्तेमाल कीजिए। सेवा मुफ़्त है और प्रोसेसिंग के बाद आपकी फ़ाइल हटा दी जाती है।

अक्सर पूछे जाने वाले प्रश्न

PDF से टेक्स्ट कैसे निकालें?

दस्तावेज़ इस पृष्ठ पर अपलोड कीजिए और बनी हुई TXT फ़ाइल डाउनलोड कर लीजिए — पूरी प्रक्रिया में आम तौर पर कुछ ही सेकंड लगते हैं।

मेरी आउटपुट फ़ाइल ख़ाली क्यों है?

आपकी PDF लगभग निश्चित रूप से स्कैन है। स्कैन किए पृष्ठ टेक्स्ट की छवियाँ होते हैं, टेक्स्ट नहीं, इसलिए अक्षर-पहचान के बिना निकालने को कुछ होता ही नहीं।

क्या फ़ॉर्मैटिंग बनी रहती है?

नहीं, और यह जानबूझकर है — सादे टेक्स्ट में फ़ॉर्मैटिंग होती ही नहीं। आपको शब्द पढ़ने के क्रम में मिलते हैं, बिना फ़ॉन्ट, कॉलम या शैली के। लेआउट चाहिए तो «PDF से Word» इस्तेमाल कीजिए।

तालिकाओं का क्या?

तालिकाओं की सामग्री टेक्स्ट के रूप में निकल आती है, पर ख़ाके को सादे टेक्स्ट में दिखाया नहीं जा सकता। काम लायक तालिकाओं के लिए दस्तावेज़ को Word में बदलिए।

कौन-सी एन्कोडिंग इस्तेमाल होती है?

टेक्स्ट UTF-8 में लिखा जाता है — वह मानक एन्कोडिंग जो हर लिपि का समर्थन करती है, इसलिए देवनागरी और अन्य ग़ैर-लैटिन लिपियाँ सही निकलती हैं।

क्या यह टूल मुफ़्त है?

हाँ — मुफ़्त, बिना रजिस्ट्रेशन, बिना दैनिक सीमा, और निकालने का काम पूरा होते ही आपकी PDF सर्वर से हटा दी जाती है।

TOOLS