有些文件只存在于一个浏览器标签页里:从 Chrome 保存下来的收据页面、计费系统只在屏幕上显示却不让导出的发票、一退出登录就没了的确认页面。然后有人要你交一份 PDF,常常还得是“扫描件”,而你手上只有一个什么软件都打不开的 .mhtml 文件,或者一个普通的 .html 文件。
现在,Look Scanned 可以直接打开这两种文件了。选好文件,网页会在浏览器里排到 A4 纸上。加上扫描效果,就能下载一份看起来像从扫描仪里出来的 PDF。
支持哪些文件?
| 类型 | 文件后缀 |
|---|---|
| 网页 | .html、.htm、.xhtml |
| 网页存档 | .mhtml、.mht |
.mhtml(或 .mht)是把整个网页连同图片和样式表打包成的一个文件。Chrome 和 Edge 把网页保存为单个文件时会生成它,有些应用导出报表时也用这种格式。普通的 .html 文件只有网页的文字和版式,图片都存在别的地方。
保存下来的邮件是另一类文件。如果你手上是 .eml 或 Outlook 的 .msg 文件,请看EML、MSG 转 PDF。
从浏览器保存网页
- Chrome 或 Edge:按 Ctrl+S(Mac 上是 Cmd+S),选择“网页,单个文件”,保存出来的是带图片的
.mhtml文件。选“网页,仅 HTML”得到的是不带图片的普通.html文件。 - Firefox:Ctrl+S 保存的是“网页,全部”,也就是一个
.html文件加一个存放图片的文件夹。只有那个.html文件会被打开,所以文件夹里的图片不会显示。如果图片很重要,就在 Firefox 里把网页打印成 PDF,再扫描那个 PDF。 - Safari:默认的“网页归档”格式不支持。把“格式”改成“Page Source”(页面源代码),就能得到 HTML 文件;或者把网页打印成 PDF。
从别处拿到的网页文件,比如邮件附件里的 HTML 发票,或者某个工具导出的报表,用法也完全一样。
页面上会有什么
网页会排到 A4 纸上,四边留一英寸的页边距,长网页会自动接到下一页。标题、表格、图片和写在文件里的样式都会保留。网页通过链接引用或导入的外部样式表不会加载,所以存成“仅 HTML”的文件通常会比网站原来的样子朴素一些。脚本不会运行,页面上要点击后才出现、或者稍后才加载的内容都不会有。
.mhtml 存档按它包含的内容显示,样式表也包括在内。如果浏览器保存网页时没有存下某张图片,原来的位置就会空着。Look Scanned 不会回到原网站去补这张图。
怎么把网页转成扫描版 PDF?
- 打开对应的页面:HTML 或 MHTML。两个页面都能打开这两种格式。
- 选择文件,稍等一下,让内容排好版。
- 翻一翻预览。看看分页的位置,以及需要的图片是否都在。
- 调整扫描效果。模糊和噪点调低一些,订单号这类小字才看得清。
- 点击“生成扫描件 PDF”,完成后点击“下载扫描件 PDF”。
也可以把每一页存成 JPG 或 PNG 图片,区别可以看扫描件的 PDF、JPG 和 PNG 格式区别。开通专业版后,用批量扫描可以一次处理好几个网页。
网页不会离开你的设备
文件在你的浏览器里读取和排版,不会上传到服务器转换。
文件里的脚本不会运行。.mhtml 存档在显示时不会从网上加载任何内容。普通的 .html 文件是唯一的例外:如果它链接了网上的图片或字体,你的浏览器可能会去获取,好让它们显示在页面上。
开始之前,先了解这几点
- 页面不会和网站长得一模一样。为屏幕设计的页面重新排到纸上,分栏、侧边栏和分页都会不一样。结果更接近打印网页,而不是截图。
- 链接和表单都变成了墨迹。按钮、菜单和表单字段会按原来的样子画出来,但在 PDF 里点不了,也填不了。
- 生成的 PDF 是图片。和真正的扫描件一样,文字不能选中、搜索,链接也点不了。以后还需要的话,请保留原文件。
- 页面越长,等得越久。很长的文章或者有很多表格的报表可能变成很多页 A4,尤其在手机上,耐心等一会儿。
有一个要交 PDF 的网页?现在就试试。