बहुत सारे दस्तावेज़ कभी Word से होकर नहीं गुज़रते। मीटिंग के नोट्स और README फ़ाइलें Markdown में लिखी जाती हैं, ChatGPT या Claude से ड्राफ़्ट Markdown में निकलते हैं, रिपोर्टें HTML पेज के रूप में एक्सपोर्ट होती हैं, और लॉग सादा टेक्स्ट होते हैं। कभी न कभी इनमें से किसी एक को PDF के रूप में जमा करना पड़ता है, और कभी-कभी ऐसे PDF के रूप में जो स्कैनर से निकला हुआ लगे।

Look Scanned पहले भी .md, .html और .txt फ़ाइलें खोल सकता था, लेकिन सिर्फ़ बीटा फ़ॉर्मैट के तौर पर। पूरी फ़ाइल एक लंबे पृष्ठ पर आ जाती थी। लंबी फ़ाइलों के लिए सलाह यही थी कि पहले ब्राउज़र से PDF में प्रिंट करें और फिर उसे स्कैन करें। यह चक्कर अब नहीं रहा। तीनों फ़ॉर्मैट अब आपके ब्राउज़र के अंदर ही A4 पृष्ठों पर सजते हैं, और बीटा का लेबल हट गया है।

सही पृष्ठ, और पृष्ठ विराम वहीं जहाँ आपने रखे

आप जो भी खोलें, नतीजा एक लंबी पट्टी नहीं बल्कि पृष्ठों का ढेर होता है:

  • टेक्स्ट अपने आप अगले पृष्ठ पर चला जाता है।
  • फ़ाइल में आपके जोड़े गए पृष्ठ विराम बने रहते हैं।
  • लंबी तालिका अगले पृष्ठ पर जारी रहती है, और कोई पंक्ति कभी बीच से नहीं कटती।
  • लंबा कोड ब्लॉक अगले पृष्ठ पर जारी रहता है, और लंबी लाइनें किनारे से बाहर निकलने के बजाय अगली लाइन में आ जाती हैं।
  • पृष्ठ से ऊँची छवि छोटी करके फ़िट कर दी जाती है।

Markdown

Markdown फ़ाइलों को वही फ़ॉर्मैटिंग मिलती है जो आप GitHub से जानते हैं: शीर्षक, सूचियाँ, तालिकाएँ, उद्धरण और कोड ब्लॉक। छवियाँ तब दिखती हैं जब वे फ़ाइल में एम्बेड की गई हों या पूरे https:// पते से लिंक की गई हों। images/chart.png जैसे सापेक्ष पथ से संदर्भित छवि नहीं मिल पाती, क्योंकि फ़ाइल अपने फ़ोल्डर के बिना, अकेले खोली जाती है।

पृष्ठ विराम के लिए Markdown का अपना कोई सिंटैक्स नहीं है, इसलिए जहाँ से अगला पृष्ठ शुरू होना चाहिए, वहाँ HTML की एक लाइन डाल दें:

<div style="break-before: page"></div>

पुराना page-break-before: always भी काम करता है।

अगर किसी AI असिस्टेंट ने अपना पूरा जवाब एक कोड ब्लॉक में लपेट दिया है, तो फ़ाइल सहेजने से पहले बाहर के तीन बैकटिक हटा दें, नहीं तो पूरा दस्तावेज़ एक ही कोड ब्लॉक के रूप में निकलेगा।

HTML

HTML फ़ाइल अपने अंदर लिखी स्टाइल के हिसाब से सजती है: उसके <style> ब्लॉक और style एट्रिब्यूट। फ़ॉन्ट, रंग, स्पेसिंग और आपके break-before या page-break-before नियम, सब लागू होते हैं। अलग फ़ाइल में रखी स्टाइलशीट लोड नहीं होती। पूरे https:// पते वाली छवियाँ और वेब फ़ॉन्ट वहीं से लोड होते हैं जहाँ वे रखे हैं, इसलिए उनके लिए इंटरनेट कनेक्शन चाहिए। page_files/photo.jpg जैसा सापेक्ष पथ नहीं मिल पाता, उसी कारण से जो Markdown में है।

पेज को प्रिंट किए जाने वाले दस्तावेज़ की तरह देखा जाता है, चलाए जाने वाले वेब पेज की तरह नहीं। स्क्रिप्ट और एम्बेड किए गए फ़्रेम हटा दिए जाते हैं, और पेज पर कुछ भी न चल सकता है, न सबमिट हो सकता है। ब्राउज़र से .mhtml या .mht के रूप में सहेजे गए वेब पेज भी खुलते हैं, आर्काइव के अंदर सहेजी गई तस्वीरों और स्टाइल के साथ। उनके लिए वेब से कुछ भी लोड नहीं किया जाता।

सादा टेक्स्ट

.txt, .text या .log फ़ाइल में लाइन ब्रेक और इंडेंट बने रहते हैं। पृष्ठ से चौड़ी लाइनें कटने के बजाय अगली लाइन में आ जाती हैं। फ़ाइलें UTF-8 के रूप में पढ़ी जाती हैं, और टेक्स्ट में मौजूद कोई भी टैग या कोड ठीक वैसे ही दिखता है जैसा टाइप किया गया था।

किसी फ़ाइल को स्कैन किए गए PDF में कैसे बदलें

  1. Markdown से स्कैन किया गया PDF, HTML से स्कैन किया गया PDF या TXT से स्कैन किया गया PDF खोलें। इन तीनों में से कोई भी पेज तीनों फ़ॉर्मैट खोल सकता है।
  2. अपनी फ़ाइल चुनें और पृष्ठ सजने तक थोड़ा रुकें।
  3. प्रीव्यू पलटकर देखें। जाँच लें कि पृष्ठ कहाँ टूटते हैं और तालिकाएँ व कोड ब्लॉक ठीक दिख रहे हैं।
  4. स्कैन प्रभाव सेट करें। छोटे अक्षरों या कोड के लिए धुंधलापन और नॉइज़ कम रखें, ताकि टेक्स्ट आसानी से पढ़ा जा सके।
  5. “स्कैन किया गया PDF जनरेट करें” पर क्लिक करें, फिर “स्कैन किया गया PDF डाउनलोड करें” पर।

आप हर पृष्ठ को JPG या PNG छवि के रूप में भी सहेज सकते हैं। हमारी PDF, JPG और PNG की गाइड बताती है कि कब कौन-सा ठीक रहता है। Pro के साथ बल्क स्कैन एक साथ कई फ़ाइलें संभाल लेता है।

आपकी फ़ाइल आपके डिवाइस पर ही रहती है

फ़ाइल आपके डिवाइस पर ही सजती और स्कैन होती है। उसे किसी सर्वर पर अपलोड नहीं किया जाता। एक ही अपवाद है: ऐसी HTML या Markdown फ़ाइल जो वेब पर रखी तस्वीरों या फ़ॉन्ट से लिंक करती है। वे उन्हीं साइटों से लोड होते हैं जहाँ वे रखे हैं, ठीक वैसे ही जैसे पेज को सामान्य तरीके से खोलने पर होता है।

जानने लायक बातें

  • पृष्ठ हमेशा A4 होते हैं, एक इंच के मार्जिन के साथ। फ़ाइल की अपनी CSS में सेट किए गए कागज़ के आकार या मार्जिन को अनदेखा कर दिया जाता है। अगर आपको US Letter चाहिए, तो उसे कागज़ सेटिंग्स में चुनें, और हर पृष्ठ उस पर फ़िट कर दिया जाता है।
  • फ़ॉन्ट आपके डिवाइस से आते हैं। जब तक HTML की अपनी स्टाइल वेब फ़ॉन्ट लोड न करे, टेक्स्ट आपके कंप्यूटर या फ़ोन पर इंस्टॉल फ़ॉन्ट में सजता है, इसलिए दूसरी मशीन पर उसी फ़ाइल के पृष्ठ अलग जगह से टूट सकते हैं।
  • फ़ॉर्मूले और डायग्राम टेक्स्ट ही रहते हैं। डॉलर चिह्नों के बीच लिखा गणित और Mermaid जैसा डायग्राम कोड उसी टेक्स्ट के रूप में दिखते हैं जैसा आपने टाइप किया। अगर आपको वे बने हुए चित्र के रूप में चाहिए, तो किसी ऐसे एडिटर से PDF एक्सपोर्ट करें जो उन्हें रेंडर करता है, और उस PDF को स्कैन करें।
  • बहुत लंबी फ़ाइलों का समय समाप्त हो सकता है। लेआउट लगभग 30 सेकंड में पूरा होना चाहिए, इसलिए बहुत बड़ी लॉग फ़ाइल या किताब जितनी लंबी Markdown फ़ाइल त्रुटि के साथ रुक सकती है। उसे पहले छोटी फ़ाइलों में बाँट लें।
  • आउटपुट तस्वीरों से बना होता है। असली स्कैन की तरह, इसका टेक्स्ट न चुना जा सकता है, न खोजा जा सकता है। संपादन के लिए मूल फ़ाइल संभालकर रखें।

पहले कोई Markdown या HTML फ़ाइल एक लंबे पृष्ठ के रूप में निकली थी? उसे फिर से आज़माएँ।