스캔한 PDF를 Markdown으로 변환
스캔한 쪽은 글자의 사진이라 보통의 변환기는 변환할 것을 찾지 못합니다. 이 도구는 대신 이미지 안의 낱말을 인식합니다. 이 사이트의 다른 모든 것과 달리 페이지를 저희 서버로 보내 동작하며, 무엇을 보내는지 정확히 알려 드리고 확인을 받은 뒤에야 무언가가 기기를 떠납니다.
여기에 PDF 또는 Word 파일을 놓으세요
또는 컴퓨터에서 파일을 선택하세요
PDF 또는 Word (.docx) · 최대 50 MB
스캔한 PDF를 Markdown으로 어떻게 변환하나요?
스캔 파일을 이 페이지에 올립니다. 먼저 브라우저에서 검사하고 텍스트 층이 없을 때에만 인식을 제안합니다. 확인하시면 페이지를 저희 서버에서 읽어 Markdown으로 돌려드립니다.
스캔한 파일이 업로드되나요?
예, 그리고 이 도구만 그렇게 합니다. 페이지는 저희 서버로 가서 읽는 동안만 메모리에 있다가 작업이 끝나면 사라집니다. 디스크에 쓰지 않고 다른 회사에 넘기지 않습니다.
스캔한 PDF를 Markdown으로 바꾸는 방법
- 1
스캔 PDF 추가
파일을 위 상자에 끌어다 놓거나 기기에서 고릅니다. 먼저 브라우저에서 검사하므로 이미 텍스트 층이 있는 PDF는 아무 데도 보내지 않고 여기서 변환됩니다.
- 2
언어 선택
문서가 쓰인 언어를 고릅니다. 인식 정확도가 여기에 크게 좌우되며 잘못 고르는 것이 결과가 나쁜 가장 흔한 원인입니다.
- 3
전송 확인
무엇을 보내는지, 어디로 가는지, 얼마나 남는지 보여 드립니다. 버튼을 누르기 전에는 아무것도 전송되지 않으며 거절해도 상태는 그대로입니다.
- 4
결과 확인
Markdown이 편집기에 나타나고 인식 신뢰도가 함께 표시됩니다. 이름과 숫자, 날짜는 원본과 맞춰 본 뒤에 쓰세요.
스캔한 PDF란 무엇인가
PDF에는 화면에서 똑같아 보이는 두 종류가 있습니다. 하나는 글자를 저장해 선택과 검색과 복사가 됩니다. 다른 하나는 평판 스캐너나 휴대폰 카메라, 팩스에서 온 쪽 사진을 저장하며 글자가 아예 없습니다.
저희 보통 변환기는 첫 번째를 브라우저에서 바로 읽고 파일을 어디로도 보내지 않습니다. 두 번째 앞에서는 당연히 아무것도 찾지 못합니다. 그래서 스캔에는 같은 도구의 개선판이 아니라 다른 도구가 필요합니다.
소프트웨어 없이도 구별할 수 있습니다. PDF를 열고 커서로 한 줄을 선택해 보세요. 아무것도 선택되지 않으면 스캔입니다.
왜 이 페이지만 업로드하는가
문자 인식은 모든 쪽을 높은 해상도로 이미지화한 뒤 그 이미지에 인식 엔진을 돌려야 합니다. 브라우저에서도 가능하지만 느리고 메모리를 많이 쓰며 정확도가 눈에 띄게 낮습니다. 찍은 문서 대부분이 나오는 중급 휴대폰에서는 현실적인 선택이 아닙니다.
그래서 이 도구 하나만 페이지를 서버로 보냅니다. 만들 때 원래의 약속을 최대한 지켰습니다. 인식은 저희 하드웨어에서 저희 엔진으로 돌아가므로 제3자가 문서를 받지 않으며, 이 서비스에는 데이터베이스도 오브젝트 스토리지도 쓰기 가능한 디스크도 없어 보관할 곳 자체가 없습니다. 페이지는 작업 동안만 메모리에 있다가 사라집니다.
동의는 파일마다 매번 따로 받으며 기억하지 않습니다. 거절하시면 아무것도 전송되지 않고 사이트의 나머지는 늘 하던 대로 동작합니다.
인식이 잘하는 것과 못하는 것
인쇄된 글자를 300 DPI로 깨끗하게 스캔하면 매우 정확하게 인식됩니다. 비스듬히 찍었거나 어두운 데서 찍었거나 색이 바랜 팩스는 눈에 띄게 나쁩니다. 인식은 옮겨 적기가 아니라 통계적 추정입니다.
결과만 봐서는 알 수 없는 두 가지 실패 방식을 알아 두시면 좋습니다. 하나는 글자를 잘못 읽는 것으로, 앞뒤 낱말로 바로잡을 수 없는 이름과 참조 번호, 긴 숫자에서 가장 자주 일어납니다. 다른 하나는 엔진이 아예 읽지 못한 낱말이 빠지는 것이라 글자가 틀린 게 아니라 없을 수 있습니다. 결과에는 신뢰도와 점수가 낮은 쪽이 표시됩니다.
- 지원 언어의 인쇄된 글자 — 깨끗한 스캔에서 믿을 만합니다
- 제목과 문단, 목록 — 인식된 낱말의 위치와 크기로 다시 세웁니다
- 표 — 대체로 살아나지만 열 정렬을 확인하세요
- 손글씨 — 지원하지 않습니다
- 수식 — 지원하지 않습니다
- 이미지와 도표 — 추출하지 않습니다
더 나은 결과를 얻으려면
고를 수 있다면 150이 아니라 300 DPI로 스캔하세요. 좋은 결과와 그저 그런 결과를 가르는 가장 큰 한 가지입니다. 찍을 때는 비스듬히가 아니라 평평하게, 고른 빛에서 찍으세요. 그리고 언어를 정확히 지정하세요. 영어 엔진으로 독일어 문서를 읽히면 자신 있게 틀린 결과가 나옵니다.
자주 묻는 질문
- 제 스캔 문서가 서버에 저장되나요?
- 아니요. 읽는 동안 메모리에 있다가 작업이 끝나거나 실패하면 없어집니다. 인식 서비스에는 데이터베이스도 파일 저장소도 없어 남길 곳이 없습니다.
- 문서를 Google이나 다른 OCR 서비스로 보내나요?
- 아니요. 인식은 저희 서버에서 저희 엔진으로 돌아갑니다. 이 도구를 쓴다고 해서 개인정보 처리방침의 수탁자 목록에 회사가 추가되지 않습니다.
- 어떤 언어를 인식할 수 있나요?
- 영어, 독일어, 스페인어, 프랑스어, 포르투갈어, 힌디어, 일본어, 한국어, 중국어 간체, 아랍어입니다. 정확도가 좌우되므로 확인 전에 문서의 언어를 고르세요.
- 손글씨도 읽을 수 있나요?
- 아니요. 엔진은 인쇄된 글자로 학습했습니다. 손으로 쓴 메모와 서명, 주석은 인식되지 않으며, 결과를 보고 알게 되기보다 미리 말씀드리는 편이 낫다고 생각합니다.
- 무료로 몇 쪽까지 인식할 수 있나요?
- 하루 쪽 수 한도와 문서당 한도가 있으며 둘 다 확인 전에 표시됩니다. 브라우저 변환기와 달리 인식에는 실제 처리 시간이 들기 때문입니다.
- 업로드하지 않고 스캔을 변환할 방법이 있나요?
- 웹에서는 없습니다. PDF에 사실은 텍스트 층이 있다면 보통 변환기가 브라우저에서 처리하지만, 진짜 스캔은 서버 인식을 거쳐야 합니다.