---
title: "Markdown、HTML、TXT 转扫描版 PDF：按 A4 分页，分页符也不丢"
description: "Markdown、HTML 和纯文本文件的支持已转为稳定。现在它们会在浏览器里排成一页页 A4，分页符、表格和代码块都在该在的位置，不用再绕道打印对话框。"
date: 2026-10-03T01:00:00.000Z
lang: zh-CN
source: https://lookscanned.io/zh-CN/blog/html-markdown-to-scanned-pdf
tags: ["Markdown", "HTML", "PDF", "产品更新"]
---

# Markdown、HTML、TXT 转扫描版 PDF：按 A4 分页，分页符也不丢

很多文档从头到尾都没经过 Word。会议纪要和 README 是用 Markdown 写的，ChatGPT 或 Claude 给出的草稿也是 Markdown，报告导出成 HTML 页面，日志则是纯文本。迟早会有一份要交成 PDF，有时还得是一份看起来像扫描出来的 PDF。

Look Scanned 以前就能打开 `.md`、`.html` 和 `.txt` 文件，但只是测试版支持。整个文件会被排到一张很长的页面上。再长一点的文件，我们的建议是先在浏览器里打印成 PDF，再扫描那份 PDF。现在不用绕这一圈了。三种格式都会在你的浏览器里排成 A4 页面，测试版的标签也摘掉了。

## 真正的分页，分页符放在哪就在哪断

不管打开哪种文件，得到的都是一叠页面，而不是一长条：

- 文字写满一页会自动排到下一页。
- 你在文件里加的分页符会保留。
- 长表格会接着排到下一页，不会把一行切成两半。
- 长代码块会在下一页继续，过长的行会自动换行，而不是超出页边。
- 比页面还高的图片会缩小到能放进去。

## Markdown

Markdown 文件会得到你在 GitHub 上熟悉的那套格式：标题、列表、表格、引用和围栏代码块。图片只要是嵌在文件里，或者用完整的 `https://` 地址链接的，就能显示出来。用 `images/chart.png` 这类相对路径引用的图片找不到，因为文件是单独打开的，它所在的文件夹并没有一起打开。

Markdown 本身没有分页符的语法，所以在想要开始新一页的地方插一行 HTML 就行：

```html
<div style="break-before: page"></div>
```

老一些的写法 `page-break-before: always` 也可以。

如果 AI 助手把整段回答都包在一个代码块里，保存文件前先把最外层的三个反引号删掉，否则整份文档会变成一个代码块。

## HTML

HTML 文件按写在文件内部的样式排版，也就是它的 `<style>` 块和 `style` 属性。字体、颜色、间距，以及你写的 `break-before` 或 `page-break-before` 规则都会生效。放在单独文件里的样式表不会加载。带完整 `https://` 地址的图片和网页字体会从它们所在的地方获取，所以需要联网。`page_files/photo.jpg` 这类相对路径找不到，原因和 Markdown 一样。

页面会被当作要打印的文档来处理，而不是要运行的网页。脚本和内嵌框架会被移除，页面上的任何东西都不能运行，也不能提交。浏览器另存为 `.mhtml` 或 `.mht` 的网页也能打开，图片和样式就用存档里保存的那份。这类文件不会从网上获取任何内容。

## 纯文本

`.txt`、`.text` 或 `.log` 文件会保留原来的换行和缩进。比页面还宽的行会自动换行，而不是被截掉。文件按 UTF-8 读取，文本里的标签或代码会原样显示。

## 怎么把它转成扫描版 PDF？

1. 打开 [Markdown 转扫描版 PDF](https://lookscanned.io/zh-CN/scan/markdown)、[HTML 转扫描版 PDF](https://lookscanned.io/zh-CN/scan/html) 或 [TXT 转扫描版 PDF](https://lookscanned.io/zh-CN/scan/txt)。这三个页面都能打开这三种格式。
2. 选择你的文件，稍等一下，让页面排好版。
3. 翻一翻预览，看看分页的位置对不对，表格和代码块显示是否正常。
4. 调整扫描效果。小字或代码的话，模糊和噪点调低一些，文字才看得清。
5. 点击“生成扫描件 PDF”，再点击“下载扫描件 PDF”。

也可以把每一页存成 JPG 或 PNG 图片，哪种情况用哪种，可以看[扫描件的 PDF、JPG 和 PNG 格式区别](https://lookscanned.io/zh-CN/blog/scanned-document-pdf-jpg-png)。开通专业版后，用[批量扫描](https://lookscanned.io/zh-CN/scan/bulk)可以一次处理一批文件。

## 文件不会离开你的设备

排版和扫描都在你自己的设备上完成，文件不会上传到服务器。唯一的例外是 HTML 或 Markdown 文件里链接了网上的图片或字体：这些会从托管它们的网站获取，和你平时打开这个页面时一样。

## 开始之前，先了解这几点

- **页面固定是 A4，页边距 2.54 厘米。** 文件自己的 CSS 里设置的纸张大小和页边距会被忽略。如果需要美国 Letter，在“纸张设置”里选择它，每一页都会缩放到这个尺寸上。
- **字体来自你的设备。** 除非 HTML 自带的样式加载了网页字体，否则文字会用你电脑或手机上安装的字体来显示，所以同一个文件在另一台机器上的分页位置可能不一样。
- **公式和图表仍然是文字。** 美元符号之间的数学公式，以及 Mermaid 这类图表代码，都会按你输入的文字原样显示。如果需要把它们画出来，先用能渲染它们的编辑器导出 PDF，再扫描那份 PDF。
- **特别长的文件可能会超时。** 排版必须在大约 30 秒内完成，所以超大的日志文件或一本书那么长的 Markdown 文件可能会报错中止。请先把它拆成几个小文件。
- **生成的 PDF 是图片。** 和真正的扫描件一样，里面的文字不能选中，也不能搜索。要编辑的话，请保留原文件。

之前有 Markdown 或 HTML 文件被排成了一长页？[再试一次](https://lookscanned.io/zh-CN/scan/markdown)。
