PDFからMarkdownへの変換: 構造とレイアウトの復元

PDFは文字の配置座標データのみを保持しており、見出しや表といった構造情報は保持していません。本ツールはレイアウトの視覚的配置から見出しや表の構造を正確に推定・復元します。

23 件の評価で 5 段階中 5.0

ここに PDF または Word をドロップ

またはパソコンからファイルを選択

PDF・Word (.docx) · 最大 50 MB

PDFから見出しや表をどのように復元しますか?

ブラウザ内で各行のフォントサイズとベースライン座標を測定します。本文より明らかに大きい行はH1からH4の見出しに、同じ列位置に揃った文字はGFM形式のパイプテーブルになります。ファイルは端末外に出ません。

ファイルはサーバーにアップロードされますか?

いいえ。解析はブラウザのWeb Worker内で完結し、ファイルのバイト列もテキストもサーバーへ送信されず、モデルの学習にも使われません。登録は不要で、1ファイル50MBまで対応します。

PDFをMarkdownに変換手順

  1. 1

    PDFを選択

    画面上のエリアにPDFファイルをドラッグ&ドロップするか、ファイルを選択します。

  2. 2

    構造の自動解析

    ブラウザ内でPDF.jsがレイアウト構造と文字配置を高速に解析します。

  3. 3

    Markdownのコピー・保存

    生成されたMarkdownテキストをクリップボードにコピーするか、.mdファイルとしてダウンロードします。

復元可能な構造要素

フォントサイズの比率やテキストの配置領域を分析し、最適なMarkdown表記を出力します。

  • H1からH4までの段階的見出し構造
  • 箇条書きおよび番号付きリストの階層構造
  • GFM(GitHub Flavored Markdown)形式のパイプテーブル
  • 2段組み(マルチカラム)論文の正しい読取り順序

復元できないもの

PDF内の画像は抽出されず、その周囲の文字だけが残ります。数式はLaTeXへ変換されず、ページ上の文字のまま出力されます。パスワード付きPDFは変換できますが、パスワードは端末内にとどまります。

よくある質問

スキャンしたPDF画像も変換できますか?
ブラウザ内では変換できません。スキャンは文字の画像であり、読み取れるテキスト層がページに存在しないためです。別途、サーバー上で文字認識を行うスキャンPDF専用の変換ツールを用意しており、送信前に毎回確認を求めます。

関連コンバーター

Further reading