본문으로 건너뛰기
PPDF123

스캔한 PDF를 OCR로 Markdown 만들기

OCR → Markdown은 스캔본이나 이미지로 된 PDF를 읽어 그 글을 Markdown 파일로 돌려줍니다. PDF에 텍스트 층을 되쓰지 않으며 원본 파일은 바뀌지 않습니다.

여기에 파일을 끌어다 놓거나, 클릭해 고릅니다

PDF 지원 · 파일당 최대 500.0 MB · 한 번에 최대 20개 파일

Ctrl/Cmd+V 또는 클립보드 메뉴로 파일을 붙여넣을 수도 있습니다.

OCR은 스캔본이나 이미지만 있는 PDF를 읽어 Markdown(`text/markdown`, 파일명 `.md`)을 반환합니다. 숨은 텍스트 층을 PDF에 다시 쓰지 않으며, 스캔을 정리·교정·다시 쓰지도 않습니다.

서버는 PDF에 이미 있는 네이티브 텍스트와 이미지 페이지의 광학 인식 결과를 합칩니다. Force OCR(`ocrType=force-ocr`, 사이트 기본)은 모든 페이지를 다시 인식합니다. Normal(`force-ocr`가 아닐 때)은 네이티브 텍스트가 있으면 그것을 쓰고, 이미지만 있는 페이지만 OCR합니다. 깨끗한 전자 PDF에서는 Auto가 OCR 런타임을 불러오지 않습니다.

정확도는 스캔 품질, 대비, 기울기에 달립니다. 현재 엔진에 언어 매개변수는 없습니다. 클라이언트가 옛 Java OCRmyPDF 필드(`languages`, `deskew`, `clean`, `sidecar`)를 보내도 무시됩니다.

PDF를 Word로 또는 PDF를 텍스트로의 선행 단계가 아닙니다. 그 도구들은 여전히 PDF 안의 텍스트가 필요합니다. 여기 OCR은 병렬 추출입니다. Markdown을 받고 원본 PDF는 그대로입니다.

디지털화하거나 재배포할 권한이 없는 파일에는 OCR하지 마세요. 뽑힌 글도 저작권과 직장 규칙의 적용을 받습니다.

검색 가능한 PDF를 원하는 사람에게는 여기가 답이 아닙니다. 검색 가능한 산출물은 Markdown 파일입니다. 편집기에서 열어 정확해야 할 이름과 숫자를 점검하세요.

휴대폰 사진은 올리기 전에 자르고 바르게 맞추세요. 사다리꼴로 찍힌 페이지는 배경에 인식을 낭비합니다. OCR은 번역이 아닙니다. 문자를 인식할 뿐 다른 언어로 다시 쓰지 않습니다.

작업은 서버에서 돌아갑니다. 제때 내려받으세요. 파일을 OCR 보관함으로 만들지 않습니다. 비밀번호로 보호된 파일은 이 페이지에서 비밀번호를 입력하면 자동으로 해제됩니다. API 호출자는 먼저 비밀번호 해제를 실행하세요.

기능

  • OCR 층이 있는 PDF가 아니라 Markdown을 반환
  • Force OCR은 모든 페이지를 다시 읽음. Normal/Auto는 네이티브 텍스트가 있으면 그대로 사용
  • 원본 PDF는 변하지 않음
  • 익명 API: /api/v1/misc/ocr-pdf

이런 경우에

  • 아카이브 스캔에서 조항 글을 뽑음
  • Markdown이 필요한 에이전트나 파이프라인에 스캔을 넘김
  • 텍스트 층이 없는 이미지 PDF에서 글을 되찾음

스캔한 PDF에 OCR을 적용하려면?

  1. 스캔본이나 휴대폰으로 찍은 PDF를 업로드합니다.
  2. Force OCR(기본) 또는 Normal/Auto를 선택합니다.
  3. 처리를 누르고 `.md` 파일을 내려받습니다.
  4. Markdown에서 이름과 숫자를 점검한 뒤 사용합니다.

제한과 경계

  • 정확도는 이미지 품질에 따라 달라짐
  • 페이지가 많으면 시간이 더 걸림
  • 현재 엔진에 언어 매개변수 없음
  • 로컬 OCR 라이브러리도, 오프라인 SDK도 아님
  • 이 사이트의 업로드 한도는 파일당 500MB이며, 약 95MB를 넘으면 나누어 전송합니다. API 직접 요청 한 건의 본문은 100MB까지입니다.

예시

  • 20페이지 그레이스케일 계약 스캔이 조항 글 Markdown 파일이 됨
  • 기울어진 휴대폰 사진은 다시 찍어야 OCR이 쓸모 있을 수 있음

이 도구의 개인정보 안내

파일은 HTTPS로 업로드되며, 서버 메모리 또는 수명이 짧은 임시 디렉터리에서 처리되고, 결과가 준비되면 삭제됩니다. 이후 열람·학습·광고 프로필용 사본은 보관하지 않습니다. 보관 기간과 AdSense 쿠키 고지는 개인정보 처리방침을 참고하세요.

자주 묻는 질문

OCR이 페이지 모양을 바꾸나요?
PDF를 반환하지 않습니다. 원본은 그대로이고 Markdown 다운로드가 따로 옵니다.
임베드할 수 있는 OCR 라이브러리인가요?
아닙니다. /api/v1/misc/ocr-pdf에 호스팅된 HTTP 작업입니다. /developers를 보세요. 링크 가능한 SDK가 아닙니다.
OCR 후에 Word로 바꿀 수 있나요?
PDF 파이프라인으로 이어 붙일 수 없습니다. OCR 출력은 Markdown입니다. PDF를 Word로는 여전히 텍스트 층이 있는 PDF가 필요합니다.
전자 PDF에도 Force OCR이 필요한가요?
보통은 아닙니다. Normal/Auto는 기존 글을 쓰고 OCR 런타임을 건너뜁니다. 텍스트 층이 깨졌거나 믿을 수 없을 때만 Force를 쓰세요.

최종 업데이트:

코드에서 호출하기

이 사이트의 도구는 모두 일반 REST 엔드포인트입니다. 익명 사용에는 계정이나 API 키가 필요 없습니다. 브라우저뿐 아니라 개발자와 AI 에이전트도 그대로 쓸 수 있습니다.

curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
  -F "[email protected]" \
  -F "ocrType=force-ocr" \
  -o output.pdf

Model Context Protocol을 쓰는 에이전트 클라이언트용 MCP 도구로도 제공합니다(JSON-RPC 2.0, POST /mcp). 전체 API 문서

AI 에이전트에서 사용하기

스킬

이 스킬을 설치하면 Claude Code, Codex, Cursor 등 AI 에이전트가 'OCR → Markdown' 작업을 대신 실행합니다: /skills/pdf123-ocr.md

전체 에이전트 스킬

파일은 이번 처리에만 쓰이며, 끝나면 자동으로 삭제됩니다.