Многие документы никогда не проходят через Word. Заметки со встреч и файлы README пишут в Markdown, черновики из ChatGPT или Claude приходят в Markdown, отчёты экспортируют как HTML-страницы, а логи — это обычный текст. Рано или поздно какой-нибудь из них нужно сдать в PDF, а иногда — в PDF, который выглядит так, будто его сняли со сканера.
Look Scanned и раньше открывал файлы .md, .html и .txt, но только как бета-форматы. Весь файл выводился одной длинной страницей. Для чего-то длиннее мы советовали сначала распечатать его в PDF из браузера и сканировать уже этот PDF. Этот обходной путь больше не нужен. Все три формата теперь раскладываются на страницы A4 прямо в браузере, а пометка «бета» исчезла.
Настоящие страницы с разрывами там, где вы их поставили
Что бы вы ни открыли, в результате получается стопка страниц, а не одна длинная лента:
- Текст сам переходит на следующую страницу.
- Разрывы страниц, добавленные в файле, сохраняются.
- Длинная таблица продолжается на следующей странице, и строка никогда не разрезается пополам.
- Длинный блок кода продолжается на следующей странице, а длинные строки переносятся, а не уходят за край.
- Изображение выше страницы уменьшается, чтобы поместиться.
Markdown
Файлы Markdown получают знакомое по GitHub оформление: заголовки, списки, таблицы, цитаты и блоки кода в тройных обратных кавычках. Изображения отображаются, если они встроены в файл или указаны по полному адресу https://. Изображение, на которое ссылается относительный путь вроде images/chart.png, найти не удастся, потому что файл открывается сам по себе, без своей папки.
В Markdown нет собственного синтаксиса для разрыва страницы, поэтому там, где должна начаться следующая страница, вставьте строку HTML:
<div style="break-before: page"></div>
Более старое page-break-before: always тоже работает.
Если ИИ-ассистент завернул весь ответ в блок кода, перед сохранением файла удалите внешние тройные обратные кавычки, иначе весь документ превратится в один блок кода.
HTML
Файл HTML раскладывается по стилям, записанным внутри него: блокам <style> и атрибутам style. Шрифты, цвета, отступы и ваши правила break-before или page-break-before — всё применяется. Таблица стилей, вынесенная в отдельный файл, не загружается. Изображения и веб-шрифты с полным адресом https:// скачиваются оттуда, где они размещены, поэтому для них нужно подключение к интернету. Относительный путь вроде page_files/photo.jpg найти не удастся — по той же причине, что и в Markdown.
Страница обрабатывается как документ для печати, а не как работающая веб-страница. Скрипты и встроенные фреймы удаляются, и ничто на странице не может выполняться или отправляться. Веб-страницы, сохранённые браузером как .mhtml или .mht, тоже открываются — с картинками и стилями, сохранёнными внутри архива. Для них из интернета ничего не скачивается.
Обычный текст
Файл .txt, .text или .log сохраняет переносы строк и отступы. Строки шире страницы переносятся, а не обрезаются. Файлы читаются в кодировке UTF-8, а любые теги или код в тексте выглядят ровно так, как набраны.
Как превратить такой файл в отсканированный PDF
- Откройте Markdown в отсканированный PDF, HTML в отсканированный PDF или TXT в отсканированный PDF. Любая из трёх страниц открывает любой из трёх форматов.
- Выберите файл и немного подождите, пока страницы разложатся.
- Пролистайте предпросмотр. Проверьте, где заканчиваются страницы и хорошо ли выглядят таблицы и блоки кода.
- Настройте эффект сканирования. Для мелкого текста или кода оставьте размытие и шум на низком уровне, чтобы текст легко читался.
- Нажмите «Создать отсканированный PDF», а затем «Скачать отсканированный PDF».
Можно также сохранить каждую страницу как JPG или PNG. Когда какой формат лучше, рассказано в нашей статье о PDF, JPG и PNG. А в пакетном сканировании, функции Pro, можно обработать сразу несколько файлов.
Файл остаётся на вашем устройстве
Файл раскладывается по страницам и сканируется на вашем устройстве. На сервер он не загружается. Единственное исключение — файл HTML или Markdown со ссылками на картинки или шрифты в интернете: они скачиваются с сайтов, где размещены, точно так же, как если бы вы открыли страницу обычным способом.
Что стоит знать
- Страницы всегда A4 с полями 2,54 см. Размер бумаги или поля, заданные в CSS самого файла, игнорируются. Если нужен US Letter, выберите его в «Настройках бумаги», и каждая страница будет вписана в этот формат.
- Шрифты берутся с вашего устройства. Если собственные стили HTML не подключают веб-шрифты, текст набирается шрифтами, установленными на вашем компьютере или телефоне, поэтому на другой машине тот же файл может разбиться на страницы иначе.
- Формулы и диаграммы остаются текстом. Математика между знаками доллара и код диаграмм, например Mermaid, выводятся как набранный вами текст. Если их нужно отрисовать, экспортируйте PDF из редактора, который их отображает, и сканируйте уже этот PDF.
- Очень длинные файлы могут не уложиться во время. Раскладка должна завершиться примерно за 30 секунд, поэтому огромный лог-файл или Markdown размером с книгу может остановиться с ошибкой. Сначала разделите его на файлы поменьше.
- Результат состоит из картинок. Как и в настоящем скане, текст нельзя выделить или найти поиском. Сохраните исходный файл для редактирования.
Раньше файл Markdown или HTML превращался в одну длинную страницу? Попробуйте ещё раз.