PDFからMarkdownへの変換: 構造とレイアウトの復元
PDFは文字の配置座標データのみを保持しており、見出しや表といった構造情報は保持していません。本ツールはレイアウトの視覚的配置から見出しや表の構造を正確に推定・復元します。
23 件の評価で 5 段階中 5.0
ここに PDF または Word をドロップ
またはパソコンからファイルを選択
PDF・Word (.docx) · 最大 50 MB
PDFから見出しや表をどのように復元しますか?
ブラウザ内で各行のフォントサイズとベースライン座標を測定します。本文より明らかに大きい行はH1からH4の見出しに、同じ列位置に揃った文字はGFM形式のパイプテーブルになります。ファイルは端末外に出ません。
ファイルはサーバーにアップロードされますか?
いいえ。解析はブラウザのWeb Worker内で完結し、ファイルのバイト列もテキストもサーバーへ送信されず、モデルの学習にも使われません。登録は不要で、1ファイル50MBまで対応します。
PDFをMarkdownに変換手順
- 1
PDFを選択
画面上のエリアにPDFファイルをドラッグ&ドロップするか、ファイルを選択します。
- 2
構造の自動解析
ブラウザ内でPDF.jsがレイアウト構造と文字配置を高速に解析します。
- 3
Markdownのコピー・保存
生成されたMarkdownテキストをクリップボードにコピーするか、.mdファイルとしてダウンロードします。
復元可能な構造要素
フォントサイズの比率やテキストの配置領域を分析し、最適なMarkdown表記を出力します。
- H1からH4までの段階的見出し構造
- 箇条書きおよび番号付きリストの階層構造
- GFM(GitHub Flavored Markdown)形式のパイプテーブル
- 2段組み(マルチカラム)論文の正しい読取り順序
復元できないもの
PDF内の画像は抽出されず、その周囲の文字だけが残ります。数式はLaTeXへ変換されず、ページ上の文字のまま出力されます。パスワード付きPDFは変換できますが、パスワードは端末内にとどまります。
よくある質問
- スキャンしたPDF画像も変換できますか?
- ブラウザ内では変換できません。スキャンは文字の画像であり、読み取れるテキスト層がページに存在しないためです。別途、サーバー上で文字認識を行うスキャンPDF専用の変換ツールを用意しており、送信前に毎回確認を求めます。