PDF를 제대로 변환하는 안내서
PDF를 변환하는 일 자체는 쉽습니다. 믿고 쓸 결과를 얻으려면 이 형식이 무엇을 기록하고 무엇을 기록하지 않는지, 모든 변환기가 어디서 추론할 수밖에 없는지, 그리고 결과를 믿기 전에 무엇을 확인해야 하는지 알아야 합니다. 여기서는 가장 자주 나오는 물음을 다루며, 어느 글도 “그러니 저희 변환기를 쓰세요”로 끝나지 않습니다.
PDF를 변환하면 구조가 사라지는 이유와 대처법
PDF는 배치된 글자를 저장할 뿐 구조를 저장하지 않습니다. 이 사실 하나가 앞으로 마주칠 모든 변환 오류를 설명합니다.
읽는 데 6분
돌려받는 Markdown과 그것을 정리하는 법
변환기가 무엇을 내놓는지, Markdown의 어떤 기능이 이 여정을 견디는지, 그리고 매번 해 둘 값어치가 있는 몇 안 되는 정리 작업.
읽는 데 5분
PDF를 Obsidian 보관함에 어지럽히지 않고 가져오기
PDF가 든 폴더를, Obsidian의 개요와 검색과 그래프가 실제로 활용할 수 있는 노트로 바꾸기.
읽는 데 5분
LLM과 검색 파이프라인을 위한 PDF 준비
검색 파이프라인에서 Markdown이 날것으로 추출한 텍스트보다 나은 이유와, 그 이점을 깨뜨리지 않고 쪼개는 법.
읽는 데 7분
네 편에 공통된 하나의 생각
PDF에는 제목도 문단도 목록도 표도 없습니다. 좌표에 놓인 글자꼴만 있습니다. 그 지면을 만든 구조는 좌표를 계산하는 데 쓰이고 버려졌습니다. 그러므로 PDF를 Markdown으로 바꾸는 일은 추출이 아니라 추론입니다. 기하 정보를 되읽어, 어떤 구조라야 그것을 만들었을지 이끌어 내는 일입니다.
모든 변환기가 이렇게 하고 저희 것도 마찬가지이며, 추론보다 잘할 수 있는 변환기는 없습니다. 답이 정말로 파일 안에 없기 때문입니다. 그 점이 분명해지면 오류가 제멋대로로 보이지 않습니다. 문단으로 나온 제목은 크기가 아니라 굵기로 표시돼 있었고, 무너진 표에는 병합된 칸이 있었으며, 헛소리로 읽히는 쪽은 2단이었습니다. 모든 실패가 어떤 규칙으로 거슬러 올라가고, 아는 규칙은 피해 갈 수 있는 규칙입니다.
이 안내서들이 그 일을 합니다. 첫 글은 그 추론과 실패의 형태를 온전히 설명합니다. 둘째 글은 돌려받는 파일과, 보관하기 전에 해 둘 값어치가 있는 몇 가지 편집을 다룹니다. 셋째와 넷째는 같은 Markdown에 사뭇 다른 요구를 하는 두 목적지 — 노트 보관함과 검색 파이프라인 — 를 다룹니다.