有些文件只存在于一个浏览器标签页里:从 Chrome 保存下来的收据页面、计费系统只在屏幕上显示却不让导出的发票、一退出登录就没了的确认页面。然后有人要你交一份 PDF,常常还得是“扫描件”,而你手上只有一个什么软件都打不开的 .mhtml 文件,或者一个普通的 .html 文件。

现在,Look Scanned 可以直接打开这两种文件了。选好文件,网页会在浏览器里排到 A4 纸上。加上扫描效果,就能下载一份看起来像从扫描仪里出来的 PDF。

支持哪些文件?

类型 文件后缀
网页 .html、.htm、.xhtml
网页存档 .mhtml、.mht

.mhtml(或 .mht)是把整个网页连同图片和样式表打包成的一个文件。Chrome 和 Edge 把网页保存为单个文件时会生成它,有些应用导出报表时也用这种格式。普通的 .html 文件只有网页的文字和版式,图片都存在别的地方。

保存下来的邮件是另一类文件。如果你手上是 .eml 或 Outlook 的 .msg 文件,请看EML、MSG 转 PDF。

从浏览器保存网页

  • Chrome 或 Edge:按 Ctrl+S(Mac 上是 Cmd+S),选择“网页,单个文件”,保存出来的是带图片的 .mhtml 文件。选“网页,仅 HTML”得到的是不带图片的普通 .html 文件。
  • Firefox:Ctrl+S 保存的是“网页,全部”,也就是一个 .html 文件加一个存放图片的文件夹。只有那个 .html 文件会被打开,所以文件夹里的图片不会显示。如果图片很重要,就在 Firefox 里把网页打印成 PDF,再扫描那个 PDF。
  • Safari:默认的“网页归档”格式不支持。把“格式”改成“Page Source”(页面源代码),就能得到 HTML 文件;或者把网页打印成 PDF。

从别处拿到的网页文件,比如邮件附件里的 HTML 发票,或者某个工具导出的报表,用法也完全一样。

页面上会有什么

网页会排到 A4 纸上,四边留一英寸的页边距,长网页会自动接到下一页。标题、表格、图片和写在文件里的样式都会保留。网页通过链接引用或导入的外部样式表不会加载,所以存成“仅 HTML”的文件通常会比网站原来的样子朴素一些。脚本不会运行,页面上要点击后才出现、或者稍后才加载的内容都不会有。

.mhtml 存档按它包含的内容显示,样式表也包括在内。如果浏览器保存网页时没有存下某张图片,原来的位置就会空着。Look Scanned 不会回到原网站去补这张图。

怎么把网页转成扫描版 PDF?

  1. 打开对应的页面:HTML 或 MHTML。两个页面都能打开这两种格式。
  2. 选择文件,稍等一下,让内容排好版。
  3. 翻一翻预览。看看分页的位置,以及需要的图片是否都在。
  4. 调整扫描效果。模糊和噪点调低一些,订单号这类小字才看得清。
  5. 点击“生成扫描件 PDF”,完成后点击“下载扫描件 PDF”。

也可以把每一页存成 JPG 或 PNG 图片,区别可以看扫描件的 PDF、JPG 和 PNG 格式区别。开通专业版后,用批量扫描可以一次处理好几个网页。

网页不会离开你的设备

文件在你的浏览器里读取和排版,不会上传到服务器转换。

文件里的脚本不会运行。.mhtml 存档在显示时不会从网上加载任何内容。普通的 .html 文件是唯一的例外:如果它链接了网上的图片或字体,你的浏览器可能会去获取,好让它们显示在页面上。

开始之前,先了解这几点

  • 页面不会和网站长得一模一样。为屏幕设计的页面重新排到纸上,分栏、侧边栏和分页都会不一样。结果更接近打印网页,而不是截图。
  • 链接和表单都变成了墨迹。按钮、菜单和表单字段会按原来的样子画出来,但在 PDF 里点不了,也填不了。
  • 生成的 PDF 是图片。和真正的扫描件一样,文字不能选中、搜索,链接也点不了。以后还需要的话,请保留原文件。
  • 页面越长,等得越久。很长的文章或者有很多表格的报表可能变成很多页 A4,尤其在手机上,耐心等一会儿。

有一个要交 PDF 的网页?现在就试试。