23 개의 평가 기준 5점 만점에 5.0점

PDF와 Word를 Markdown으로 바꾸는 변환기

아래 변환기는 모두 같은 브라우저 내 엔진을 쓰고, 원본 형식과 결과물이 갈 곳에 따라 설명만 다릅니다. 손에 있는 파일과 쓸 곳에 맞춰 고르면 되며, 어느 것도 파일을 전송하지 않습니다. 예외는 스캔 PDF 변환기 하나로, 저희 서버에서 글자를 인식하며 매번 먼저 동의를 구합니다.

어떤 것을 골라야 하나요?

고민된다면 일반 PDF에서 Markdown으로 바꾸는 변환기를 쓰세요. 가장 흔한 경우이고, 출력은 어디서나 그대로 쓰이는 표준 GFM입니다. 나머지 페이지가 따로 있는 이유는 같은 결과라도 목적지에 따라 신경 쓸 점이 달라지기 때문입니다.

결과가 노트 볼트로 간다면 Obsidian 페이지를 보세요. 달라지는 것은 변환이 아니라 그다음입니다. 파일 이름이 노트 제목이 되고, 제목 단계가 아웃라인을 만들며, 링크가 없는 노트는 그래프에 보이지 않습니다.

Notion 페이지에 붙여넣거나 가져올 생각이라면 Notion 페이지를 보세요. Notion은 Markdown 가져오기를 지원하지만 GitHub보다 좁은 블록 집합만 대응하므로, 무엇이 살아남는지 미리 알아 두면 다시 손볼 일이 줄어듭니다.

변환한 텍스트를 언어 모델에 바로 넣을 생각이라면 ChatGPT용과 Claude용 페이지를 보세요. 두 페이지 모두 토큰을 낭비하지 않는 것과 표와 제목 단계를 온전히 넘기는 것을 다룹니다.

표 자체가 변환하려는 이유라면 표 페이지를 보세요. PDF에서 표를 꺼내는 일에는 병합된 셀, 여러 줄로 감긴 텍스트, 맞지 않는 열처럼 고유한 실패 방식이 있고 그 페이지가 다루는 것이 바로 그 인식과 수리입니다.

가진 파일이 PDF가 아니라 .docx라면 Word 변환기를 고르세요. 여기서 원본이 PDF가 아닌 유일한 페이지이고, 변환도 더 정확합니다. Word는 제목과 목록 수준, 표의 칸을 스스로 저장하므로 지면 모양에서 추측할 것이 없습니다.

보통 변환기가 아무것도 내놓지 못했을 때에만 스캔 PDF 변환기를 쓰세요. 그것이 바로 스캔의 특징입니다. 읽어 낼 선택 가능한 글자가 문서에 없는 것입니다.

모두가 공유하는 것

모든 페이지 뒤에는 변환 엔진이 하나뿐입니다. 브라우저의 Web Worker에서 PDF.js가 PDF를 읽고 글자의 배치를 측정해 구조를 추론합니다. 본문보다 큰 글자는 제목이 되고, 가까이 붙은 줄은 문단이 되며, 같은 열 위치에 맞춰진 줄은 표가 됩니다.

Word 경로는 입구만 다른 같은 엔진입니다. .docx는 브라우저에서 압축을 풀어 그대로 읽고, 스타일 이름이 제목을, 번호 매기기 정의가 목록을 알려 줍니다. 그다음은 동일한 Markdown 생성기를 거치므로 같은 문서를 두 형식으로 저장해도 결과가 같습니다.

모두 무료이고 계정이 필요 없으며 50MB까지의 파일을 받습니다. 굵게, 기울임, 인라인 코드, 삽입된 링크는 유지됩니다. 이미지는 추출되지 않고 수식은 LaTeX로 바뀌지 않습니다.

업로드하는 하나, 그리고 왜 따로 두는가

스캔한 쪽은 사진입니다. 글자가 아예 없으므로 파서가 아무리 좋아도 브라우저 안에서는 읽을 수 없습니다. 인식하려면 문자 인식이 필요하고, 이는 브라우저 탭이 가진 것보다 훨씬 많은 연산을 요구합니다.

그래서 스캔 PDF는 다른 페이지의 선택 항목이 아니라 자기 변환기를 가집니다. 그렇게 떼어 놓았기 때문에 이 사이트의 나머지 모든 페이지가 파일이 기기를 떠나지 않는다고 단서 없이 말할 수 있습니다. 어느 한 페이지라도 업로드할 수 있었다면 모든 페이지에서 그 말에 단서를 달아야 했을 것입니다.

실제로 쓸 때는 먼저 묻습니다. 몇 쪽이 전송되는지, 어디로 가는지, 얼마나 보관되는지 대화 상자가 알려 주며 확인하기 전에는 아무것도 전송되지 않습니다. 파일은 작업 동안 메모리에 있다가 끝나면 사라집니다.