অনেক নথি কখনও Word-এর ভেতর দিয়ে যায় না। মিটিংয়ের নোট আর README লেখা হয় Markdown-এ, ChatGPT বা Claude থেকে খসড়া বেরোয় Markdown হিসেবে, রিপোর্ট এক্সপোর্ট হয় HTML পেজ হিসেবে, আর লগ থাকে সাধারণ টেক্সটে। আজ না হয় কাল এগুলোর কোনো একটা PDF হিসেবে জমা দিতে হয়, আর কখনও কখনও এমন PDF হিসেবে, যা দেখে মনে হবে স্ক্যানার থেকে বেরিয়েছে।
Look Scanned আগেও .md, .html ও .txt ফাইল খুলতে পারত, তবে শুধু বিটা ফরম্যাট হিসেবে। পুরো ফাইল একটা লম্বা পৃষ্ঠায় চলে আসত। লম্বা কিছু হলে পরামর্শ ছিল, আগে ব্রাউজার থেকে PDF-এ প্রিন্ট করুন, তারপর সেটা স্ক্যান করুন। সেই ঘুরপথ আর নেই। তিনটি ফরম্যাটই এখন আপনার ব্রাউজারের ভেতরে A4 পৃষ্ঠায় সাজানো হয়, আর বিটা লেবেলটি সরে গেছে।
আসল পৃষ্ঠা, বিরতি ঠিক যেখানে আপনি দিয়েছেন
যা-ই খুলুন, ফল হবে একটা লম্বা ফালি নয়, বরং পৃষ্ঠার পর পৃষ্ঠা:
- লেখা নিজে থেকেই পরের পৃষ্ঠায় চলে যায়।
- ফাইলে আপনি যে পৃষ্ঠা বিরতি দিয়েছেন, তা থেকে যায়।
- লম্বা টেবিল পরের পৃষ্ঠায় চলতে থাকে, আর কোনো সারি কখনও মাঝখানে কাটে না।
- লম্বা কোড ব্লক পরের পৃষ্ঠায় চলতে থাকে, আর লম্বা লাইন কিনারা ছাড়িয়ে যাওয়ার বদলে পরের লাইনে নেমে আসে।
- পৃষ্ঠার চেয়ে উঁচু ছবি ছোট করে মাপে আনা হয়।
Markdown
Markdown ফাইলে GitHub-এ যে ফরম্যাটিং দেখেন, সেটাই পাবেন: শিরোনাম, তালিকা, টেবিল, উদ্ধৃতি আর কোড ব্লক। ছবি তখনই দেখা যায়, যখন সেটা ফাইলে এমবেড করা থাকে বা পুরো https:// ঠিকানা দিয়ে লিংক করা থাকে। images/chart.png-এর মতো আপেক্ষিক পাথ দিয়ে উল্লেখ করা ছবি খুঁজে পাওয়া যায় না, কারণ ফাইলটি তার ফোল্ডার ছাড়া একা খোলা হয়।
পৃষ্ঠা বিরতির জন্য Markdown-এর নিজস্ব কোনো সিনট্যাক্স নেই, তাই যেখানে পরের পৃষ্ঠা শুরু হবে, সেখানে এক লাইন HTML বসিয়ে দিন:
<div style="break-before: page"></div>
পুরোনো page-break-before: always-ও কাজ করে।
কোনো AI সহকারী যদি পুরো উত্তরটা একটা কোড ব্লকে মুড়ে দিয়ে থাকে, ফাইল সেভ করার আগে বাইরের তিনটি ব্যাকটিক সরিয়ে দিন, না হলে পুরো নথিটাই একটা কোড ব্লক হিসেবে বেরোবে।
HTML
HTML ফাইল তার ভেতরে লেখা স্টাইল অনুযায়ী সাজানো হয়: তার <style> ব্লক আর style অ্যাট্রিবিউট। ফন্ট, রং, ফাঁক আর আপনার break-before বা page-break-before নিয়ম, সবই কাজ করে। আলাদা ফাইলে রাখা স্টাইলশিট লোড হয় না। পুরো https:// ঠিকানাসহ ছবি আর ওয়েব ফন্ট যেখানে আছে সেখান থেকেই আনা হয়, তাই এর জন্য ইন্টারনেট সংযোগ দরকার। page_files/photo.jpg-এর মতো আপেক্ষিক পাথ খুঁজে পাওয়া যায় না, Markdown-এর মতো একই কারণে।
পেজটিকে চালানোর ওয়েব পেজ নয়, প্রিন্ট করার নথি হিসেবে দেখা হয়। স্ক্রিপ্ট আর এমবেড করা ফ্রেম সরিয়ে দেওয়া হয়, আর পেজের কিছুই চালানো বা সাবমিট করা যায় না। ব্রাউজার থেকে .mhtml বা .mht হিসেবে সেভ করা ওয়েব পেজও খোলে, আর্কাইভের ভেতরে সেভ করা ছবি আর স্টাইল নিয়ে। এগুলোর জন্য ওয়েব থেকে কিছুই আনা হয় না।
সাধারণ টেক্সট
.txt, .text বা .log ফাইলের লাইন বিরতি আর ইনডেন্ট থেকে যায়। পৃষ্ঠার চেয়ে চওড়া লাইন কেটে যাওয়ার বদলে পরের লাইনে নামে। ফাইল UTF-8 হিসেবে পড়া হয়, আর লেখার ভেতরের কোনো ট্যাগ বা কোড ঠিক যেমন টাইপ করা হয়েছে, তেমনই দেখা যায়।
কীভাবে একটি ফাইল থেকে স্ক্যান করা PDF বানাবেন
- Markdown থেকে স্ক্যান করা PDF, HTML থেকে স্ক্যান করা PDF বা TXT থেকে স্ক্যান করা PDF খুলুন। তিনটির যেকোনো পৃষ্ঠাতেই তিনটি ফরম্যাট খোলা যায়।
- ফাইলটি বেছে নিন, পৃষ্ঠাগুলো সাজানো পর্যন্ত একটু অপেক্ষা করুন।
- প্রিভিউতে পাতা উল্টে দেখুন। পৃষ্ঠা কোথায় ভাঙছে আর টেবিল ও কোড ব্লক ঠিক দেখাচ্ছে কি না, দেখে নিন।
- স্ক্যানের ইফেক্ট ঠিক করুন। ছোট লেখা বা কোড হলে ঝাপসা ভাব আর নয়েজ কম রাখুন, যাতে লেখা সহজে পড়া যায়।
- “স্ক্যান করা PDF তৈরি করুন” চাপুন, তারপর “স্ক্যান করা PDF ডাউনলোড করুন”।
চাইলে প্রতিটি পৃষ্ঠা JPG বা PNG ছবি হিসেবেও সেভ করতে পারেন। কখন কোনটা কাজে লাগে, তা আমাদের PDF, JPG ও PNG-এর নির্দেশিকায় বলা আছে। Pro থাকলে বাল্ক স্ক্যান দিয়ে একসঙ্গে অনেক ফাইল স্ক্যান করা যায়।
আপনার ফাইল আপনার ডিভাইসেই থাকে
ফাইলটি আপনার নিজের ডিভাইসেই সাজানো ও স্ক্যান হয়। এটি কোনো সার্ভারে আপলোড হয় না। একটাই ব্যতিক্রম: এমন HTML বা Markdown ফাইল, যা ওয়েবে থাকা ছবি বা ফন্টের লিংক দেয়। সেগুলো যে সাইটে রাখা আছে, সেখান থেকেই আনা হয়, ঠিক যেমনটা পেজটি সাধারণভাবে খুললে হত।
জেনে রাখা ভালো
- পৃষ্ঠা সবসময় A4, এক ইঞ্চি মার্জিনসহ। ফাইলের নিজের CSS-এ দেওয়া কাগজের আকার বা মার্জিন আমলে নেওয়া হয় না। US Letter দরকার হলে কাগজ সেটিংস থেকে বেছে নিন, প্রতিটি পৃষ্ঠা তাতে মাপমতো বসে যাবে।
- ফন্ট আসে আপনার ডিভাইস থেকে। HTML-এর নিজের স্টাইল ওয়েব ফন্ট লোড না করলে লেখা আপনার কম্পিউটার বা ফোনে ইনস্টল করা ফন্টে সাজে, তাই একই ফাইলের পৃষ্ঠা অন্য মেশিনে অন্য জায়গায় ভাঙতে পারে।
- সূত্র ও ডায়াগ্রাম লেখা হিসেবেই থাকে। ডলার চিহ্নের মাঝের গণিত আর Mermaid-এর মতো ডায়াগ্রাম কোড ঠিক যেমন টাইপ করেছেন, তেমন লেখা হিসেবেই দেখা যায়। এগুলো আঁকা অবস্থায় দরকার হলে এমন কোনো এডিটর থেকে PDF এক্সপোর্ট করুন যা এগুলো রেন্ডার করে, তারপর সেই PDF স্ক্যান করুন।
- খুব লম্বা ফাইলের সময় ফুরিয়ে যেতে পারে। সাজানোর কাজ প্রায় 30 সেকেন্ডের মধ্যে শেষ হতে হয়, তাই বিশাল লগ ফাইল বা বইয়ের মতো লম্বা Markdown ফাইল ত্রুটি দেখিয়ে থেমে যেতে পারে। আগে সেটিকে ছোট ছোট ফাইলে ভাগ করে নিন।
- আউটপুট ছবি দিয়ে তৈরি। আসল স্ক্যানের মতোই লেখা সিলেক্ট করা বা খোঁজা যায় না। সম্পাদনার জন্য মূল ফাইলটি রেখে দিন।
আগে কোনো Markdown বা HTML ফাইল একটা লম্বা পৃষ্ঠা হয়ে বেরিয়েছিল? আবার চেষ্টা করে দেখুন।