Wordを一度も通らない文書はたくさんあります。会議メモやREADMEはMarkdownで書かれ、ChatGPTやClaudeから出てくる下書きもMarkdownです。レポートはHTMLページとして書き出され、ログはプレーンテキストです。そのうちどれかは、いつかPDFとして提出することになります。ときには、スキャナーで読み取ったように見えるPDFとして。

Look Scannedはこれまでも.md、.html、.txtのファイルを開けましたが、ベータ版の形式としてでした。ファイル全体が1枚の縦長のページに収まり、長いものについては、いったんブラウザからPDFに印刷して、そのPDFをスキャンするようお願いしていました。この回り道はなくなりました。3つの形式はいずれもブラウザの中でA4ページとして組まれ、ベータの表示も外れました。

本物のページ、改ページは指定した位置に

どのファイルを開いても、長い1本の帯ではなく、ページの束になります。

  • 文章は自動で次のページに続きます。
  • ファイルに入れた改ページはそのまま保たれます。
  • 長い表は次のページにまたがり、行が途中で切れることはありません。
  • 長いコードブロックは次のページに続き、長い行は端からはみ出さずに折り返されます。
  • ページより高い画像は、収まるように縮小されます。

Markdown

Markdownファイルには、GitHubでおなじみの書式が適用されます。見出し、リスト、表、引用、フェンス付きコードブロックです。画像は、ファイルに埋め込まれているか、https://で始まる完全なアドレスでリンクされていれば表示されます。images/chart.pngのような相対パスで参照された画像は見つかりません。ファイルはフォルダーごとではなく、単体で開かれるためです。

Markdownには改ページの構文がないので、次のページを始めたい場所にHTMLを1行入れます。

<div style="break-before: page"></div>

古い書き方のpage-break-before: alwaysも使えます。

AIアシスタントが回答全体をコードブロックで囲んでいた場合は、ファイルを保存する前に外側の3つのバッククォートを取り除いてください。そのままだと、文書全体が1つのコードブロックになります。

HTML

HTMLファイルは、ファイルの中に書かれたスタイル、つまり<style>ブロックとstyle属性で組まれます。フォント、色、間隔のほか、break-beforeやpage-break-beforeの指定もすべて反映されます。別ファイルに分けられたスタイルシートは読み込まれません。https://で始まる完全なアドレスを持つ画像やWebフォントは置かれている場所から取得されるため、インターネット接続が必要です。page_files/photo.jpgのような相対パスは、Markdownと同じ理由で見つかりません。

ページは、動かすWebページではなく、印刷する文書として扱われます。スクリプトと埋め込みフレームは取り除かれ、ページ上のものは何も実行や送信ができません。ブラウザで.mhtmlや.mhtとして保存したWebページも開けます。その場合は、アーカイブの中に保存された画像とスタイルが使われ、Webからは何も取得されません。

プレーンテキスト

.txt、.text、.logのファイルは、改行とインデントをそのまま保ちます。ページ幅より長い行は、切れずに折り返されます。ファイルはUTF-8として読み込まれ、本文に含まれるタグやコードは入力したとおりに表示されます。

スキャン風PDFにする手順

  1. Markdownをスキャン風PDFに変換、HTMLをスキャン風PDFに変換、TXTをスキャン風PDFに変換のいずれかを開きます。どのページでも、3つの形式はすべて開けます。
  2. ファイルを選び、ページが組まれるまで少し待ちます。
  3. プレビューをめくって、ページの区切り位置と、表やコードブロックの見た目を確認します。
  4. スキャン効果を調整します。小さな文字やコードなら、ぼかしとノイズを控えめにすると読みやすいままです。
  5. 「スキャンされたPDFを生成」をクリックし、続けて「スキャンされたPDFをダウンロード」をクリックします。

各ページをJPGやPNGの画像として保存することもできます。どれを選べばよいかはPDF・JPG・PNGの比較で説明しています。Pro版なら、一括スキャンで複数のファイルをまとめて処理できます。

ファイルはお使いの端末から出ません

ファイルのレイアウトとスキャンは、お使いの端末の中で行われます。サーバーへアップロードされることはありません。唯一の例外は、Web上の画像やフォントにリンクしているHTMLファイルやMarkdownファイルです。それらは、そのページを普通に開いたときと同じように、置かれているサイトから取得されます。

知っておきたいこと

  • ページは常にA4、余白は2.54 cmです。 ファイルのCSSで指定された用紙サイズや余白は無視されます。USレターが必要な場合は「用紙設定」で選ぶと、各ページがそのサイズに合わせて収められます。
  • フォントは端末のものが使われます。 HTML自身のスタイルがWebフォントを読み込んでいない限り、文字はパソコンやスマートフォンにインストール済みのフォントで組まれます。そのため、同じファイルでも別の端末では改ページの位置が変わることがあります。
  • 数式や図はテキストのままです。 ドル記号で囲んだ数式や、Mermaidなどの図のコードは、入力したテキストとして表示されます。描画した状態が必要なら、それらを描画できるエディターからPDFを書き出し、そのPDFをスキャンしてください。
  • とても長いファイルは時間切れになることがあります。 レイアウトは約30秒以内に終わる必要があるため、巨大なログファイルや本1冊分のMarkdownファイルはエラーで止まることがあります。先に小さなファイルに分割してください。
  • 出力は画像でできています。 本物のスキャンと同じく、文字の選択や検索はできません。編集用に元のファイルを残しておいてください。

以前、MarkdownやHTMLのファイルが1枚の長いページになってしまったことはありませんか?もう一度試してみてください。