PDF의 표를 Excel로 변환하기
PDF를 Excel로는 PDF의 글에서 열이 맞춰진 표 행을 찾아 표마다 .xlsx 통합 문서의 별도 시트에 씁니다. 텍스트 층이 필요하며 산문이나 스캔한 페이지에는 아무것도 돌려주지 않습니다.
여기에 파일을 끌어다 놓거나, 클릭해 고릅니다
PDF 지원 · 파일당 최대 500.0 MB · 한 번에 최대 20개 파일
Ctrl/Cmd+V 또는 클립보드 메뉴로 파일을 붙여넣을 수도 있습니다.
PDF를 Excel로는 `pdftotext -layout`을 실행해 연속 공백이 둘 이상인 줄을 찾고, 그 줄을 `.xlsx` 통합 문서에 씁니다. 감지된 표마다 `Page N` 또는 `Page N Table M` 이름의 시트가 됩니다. 뽑힌 글에서 열이 이미 맞춰진 전자 PDF에 맞습니다.
표로 인정하려면 표처럼 보이는 연속 두 줄 이상이 필요합니다. 산문, 한 줄짜리 머리글, 텍스트 층이 없는 스캔은 `no_content`가 되어 통합 문서가 없습니다. 빈 결과는 의도된 동작이며 조용한 실패가 아닙니다.
이 도구는 요청 매개변수를 무시합니다. 이 페이지에 페이지 범위 필드가 없습니다. 열은 연속 공백 둘 이상으로 자르며, 셀 안의 단일 공백은 셀에 남습니다.
OCR이 아닙니다. 이미지만 있는 스캔에는 `pdftotext`가 읽을 내용이 없습니다. 이 사이트 OCR은 Markdown을 반환하며 PDF를 Excel로에 다시 넣을 수 없습니다. 글이 픽셀에만 있으면 여기서 스프레드시트를 만들지 못합니다.
PDF를 CSV로는 같은 판면 휴리스틱을 씁니다. 표 하나는 CSV 하나, 여러 표는 CSV ZIP입니다. Excel은 그 표들을 같은 통합 문서의 각 시트에 둡니다. 둘 다 PDF에서 병합 셀·색 머리글·숨은 시트를 복원하지 않습니다.
Excel이나 LibreOffice Calc로 다운로드를 열어 몇 행의 열 분할을 점검하세요. 이중 공백 간격이 없는 촘촘한 표는 한 열로 떨어지는 경우가 많습니다. 비밀번호로 보호된 파일은 이 페이지에서 비밀번호를 입력하면 자동으로 해제됩니다. API 호출자는 먼저 비밀번호 해제를 실행하세요.
이중 공백 규칙이 감지 방식의 전부이므로, 통합 문서의 품질은 전적으로 PDF가 어떻게 조판되었는지에 달려 있습니다. 각 셀을 고정 너비로 채우는 보고서 생성기가 만든 표는 깔끔하게 추출됩니다. 열 사이에 공백이 하나뿐이거나, 비례 글꼴로 열이 거의 붙어 있는 표는 아예 표로 인식되지 않아 통합 문서가 나오지 않을 수 있습니다. 도구를 탓하기 전에 PDF에서 한 줄을 선택해 텍스트가 선택 가능한지부터 확인하세요.
시트 이름은 내용이 아니라 위치를 따릅니다. 감지된 각 블록은 페이지를 훑는 순서대로 `Page N` 또는 `Page N Table M`이 됩니다. 페이지마다 표가 하나인 보고서는 페이지마다 시트 하나를 만듭니다. 표 세 개가 쌓인 페이지는 번호가 붙은 시트 세 개가 됩니다. 머리글 셀로 시트 이름을 짓는 옵션은 없고, 하나의 시트로 합치는 출력도 없습니다.
값은 레이아웃을 보존한 추출에 나타난 그대로 텍스트로 기록됩니다. 숫자는 숫자 셀로 변환되지 않아 앞의 0이 유지되고 통화 기호와 천 단위 구분 기호도 문자열에 그대로 남습니다. 계좌 번호와 우편번호에는 대개 바람직하고, 합계를 낼 금액 열에는 조금 성가십니다. 스프레드시트에서 형식을 변환하거나, 열을 복사해 대상 프로그램의 텍스트 나누기나 값 변환을 사용하세요.
행은 중복 제거되지 않고 반복되는 머리글도 제거되지 않습니다. 표가 페이지 경계에서 끊기면 머리글 행이 다음 페이지에 자주 반복되고 이어지는 부분이 별도 시트가 됩니다. 병합 셀은 복원되지 않습니다. PDF에서 두 열에 걸쳐 있던 셀은 텍스트가 맨 왼쪽 열에만 들어가고 오른쪽 열은 비어 있습니다. 여러 줄 셀은 줄바꿈된 값 하나가 아니라 별도 행이 됩니다.
업로드는 일시적입니다. 통합 문서 보관함을 남기지 않습니다.
기능
- `pdftotext -layout`과 이중 공백 열 분할 휴리스틱
- 감지된 표마다 시트 하나. 감지 실패 시 파일 없음
- OCR 아님. OCR Markdown을 여기로 보낼 수 없음
- 텍스트 형식 셀. 형식 추론이나 병합 셀 복원 없음
- 익명 API: /api/v1/convert/pdf/xlsx
이런 경우에
- 뽑힌 표를 Excel이나 LibreOffice Calc에서 바로 염
- 전자 송장 표를 통합 문서로 가져옴
- 여러 페이지의 표를 CSV가 아니라 각 시트로 둠
- 고정 너비 재무제표를 추출해 추가 분석에 활용
PDF 표를 Excel로 변환하려면?
- 선택 가능한 글이 있고 표처럼 열이 나뉜 PDF를 업로드합니다.
- 처리를 누릅니다. 이 도구에 페이지 범위나 OCR 옵션은 없습니다.
- 표를 찾으면 `.xlsx`를 내려받습니다. 없으면 빈 성공입니다. 텍스트 층이 있는 원본으로 바꾸세요.
- 통합 문서를 열어 분할을 확인합니다. 순수 산문 PDF는 시트가 생기지 않습니다.
제한과 경계
- 선택 가능한 글과 이중 공백 열 간격이 필요
- OCR 없음, 페이지 범위 조작 없음
- 병합 셀과 스타일을 복원하지 않음
- 모든 값이 텍스트. 숫자·날짜 형식 없음
- 페이지를 넘는 표는 별도 시트가 됨
- 이 사이트의 업로드 한도는 파일당 500MB이며, 약 95MB를 넘으면 나누어 전송합니다. API 직접 요청 한 건의 본문은 100MB까지입니다.
예시
- 세 열 가격표가 있는 글 PDF는 종종 그 열의 시트가 됨
- 텍스트 층이 없는 스캔 은행 거래명세서는 통합 문서를 반환하지 않음
- 페이지마다 표가 하나인 10쪽 보고서는 Page 1부터 Page 10까지 열 개 시트가 됨
이 도구의 개인정보 안내
파일은 HTTPS로 업로드되며, 서버 메모리 또는 수명이 짧은 임시 디렉터리에서 처리되고, 결과가 준비되면 삭제됩니다. 이후 열람·학습·광고 프로필용 사본은 보관하지 않습니다. 보관 기간과 AdSense 쿠키 고지는 개인정보 처리방침을 참고하세요.
자주 묻는 질문
- 스프레드시트를 받지 못한 이유는요?
- 연속 두 줄 이상의 표 행 묶음을 찾지 못했습니다. 스캔, 산문, 이중 공백 간격이 없는 표는 이 휴리스틱이 실패합니다.
- 먼저 OCR한 뒤 Excel로 변환할 수 있나요?
- 없습니다. OCR은 Markdown을 반환합니다. 이 도구는 pdftotext로만 PDF를 읽습니다.
- PDF를 CSV로와 무엇이 다른가요?
- 감지는 같습니다. Excel은 각 표를 같은 통합 문서의 각 시트에 씁니다. CSV는 표마다 파일 하나(하나면 CSV, 여러 개면 ZIP)입니다.
- 모든 페이지를 읽나요?
- 읽습니다. pdftotext는 페이지 나누기 문자로 나눕니다. 모든 페이지에서 표 블록을 스캔합니다. 페이지 범위 매개변수는 없습니다.
- 숫자가 텍스트로 저장되는 이유는요?
- 값은 추출된 그대로 기록되어 앞의 0과 서식이 유지됩니다. 계산에 쓰려면 스프레드시트에서 그 열을 숫자로 변환하세요.
- 병합 셀이 복원되나요?
- 아니요. 병합 셀의 텍스트는 맨 왼쪽 열에 들어가고 나머지 열은 비어 있습니다. 여러 줄 셀은 줄바꿈된 값 하나가 아니라 별도 행이 됩니다.
- 표 하나인데 시트가 여러 개인 이유는요?
- 새 페이지로 이어지는 표는 그 페이지에서 다시 감지되어 또 다른 시트가 됩니다. 머리글 행이 자주 반복되며, 도구는 조각을 합치지 않습니다.
최종 업데이트:
코드에서 호출하기
이 사이트의 도구는 모두 일반 REST 엔드포인트입니다. 익명 사용에는 계정이나 API 키가 필요 없습니다. 브라우저뿐 아니라 개발자와 AI 에이전트도 그대로 쓸 수 있습니다.
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/xlsx" \
-F "[email protected]" \
-o output.pdfModel Context Protocol을 쓰는 에이전트 클라이언트용 MCP 도구로도 제공합니다(JSON-RPC 2.0, POST /mcp). 전체 API 문서
AI 에이전트에서 사용하기
스킬이 스킬을 설치하면 Claude Code, Codex, Cursor 등 AI 에이전트가 'PDF를 Excel로' 작업을 대신 실행합니다: /skills/pdf123-pdf-to-xlsx.md
파일은 이번 처리에만 쓰이며, 끝나면 자동으로 삭제됩니다.