Ves al contingut principal
PPDF123

Fes OCR d'un PDF escanejat a Markdown

OCR a Markdown llegeix un PDF escanejat o basat en imatges i en retorna el text en un fitxer Markdown. No afegeix capa de text al PDF, i el fitxer original no canvia.

Arrossega arxius aquí, o fes clic per triar-los

Admet PDF · fins a 500.0 MB per arxiu · fins a 20 arxius alhora

També pots enganxar un fitxer amb Ctrl/Cmd+V o des del menú del porta-retalls.

OCR a Markdown llegeix escaneigs o PDF només imatge i torna Markdown (`text/markdown`, nom `.md`). No escriu una capa de text amagada al PDF, ni neteja, ni redreça, ni reescriu l'escaneig.

El servidor combina el text natiu ja present al PDF amb el reconeixement òptic de les pàgines imatge. Force OCR (`ocrType=force-ocr`, valor per defecte del web) torna a reconèixer cada pàgina. Normal (qualsevol valor que no sigui `force-ocr`) usa el text natiu si n'hi ha i només fa OCR a les pàgines només imatge. En un PDF electrònic net, Auto no carrega el motor d'OCR.

La precisió depèn de la qualitat de l'escaneig, el contrast i la inclinació. El motor actual no té paràmetre d'idioma. Si el client encara envia camps antics d'OCRmyPDF de Java (`languages`, `deskew`, `clean`, `sidecar`), s'ignoren.

Això no és un pas previ de «PDF a Word» ni de «PDF a text». Aquelles eines encara necessiten text ja present dins del PDF. L'OCR d'aquí és una extracció paral·lela: obteniu Markdown; l'original no canvia.

No feu OCR de fitxers que no teniu dret a digitalitzar o redistribuir. El text extret també està subjecte a drets d'autor i a normes laborals.

Qui vulgui un PDF cercable aquí no el trobarà. El producte cercable és el fitxer Markdown. Obriu-lo a l'editor i contrastueu noms i xifres que han de ser exactes.

Les fotos de mòbil, retalleu-les i redreceu-les abans de pujar. Una pàgina en perspectiva malgasta el reconeixement en el fons. L'OCR no tradueix: reconeix caràcters, no reescriu el document en una altra llengua.

La feina corre al servidor. Baixeu a temps. No convertim els vostres fitxers en una biblioteca d'OCR. Els fitxers protegits amb contrasenya es desbloquegen per vosaltres en aquesta pàgina un cop n'escriviu la clau; els clients d'API executen primer «Treu la contrasenya».

Funcions

  • Torna Markdown, no un PDF amb capa OCR
  • Force OCR rellegeix cada pàgina; Normal/Auto usa el text natiu si n'hi ha
  • El PDF original no canvia
  • API anònima: /api/v1/misc/ocr-pdf

Quan fer-la servir

  • Extreure el text de clàusules d'un escaneig d'arxiu
  • Passar un escaneig a un agent o canonada que espera Markdown
  • Recuperar paraules d'un PDF només imatge sense capa de text

Com faig OCR d'un PDF escanejat?

  1. Pugeu un escaneig o un PDF fet amb el mòbil.
  2. Trieu Force OCR (per defecte) o Normal/Auto.
  3. Feu clic a Processar i baixeu el fitxer `.md`.
  4. Contrastueu noms i xifres al Markdown abans d'usar-lo.

Límits i casos límit

  • La precisió varia amb la qualitat de la imatge
  • Moltes pàgines allarguen el temps
  • El motor actual no té paràmetre d'idioma
  • No és una biblioteca OCR local ni un SDK fora de línia
  • Límit de pujada en aquest web: 500 MB per fitxer, enviat per parts a partir d'uns 95 MB. El cos d'una sola petició directa a l'API està limitat a 100 MB.

Exemples

  • Un contracte escanejat en escala de grisos de 20 pàgines esdevé un Markdown amb el text de les clàusules
  • Una foto de mòbil inclinada pot caldre refer-la perquè l'OCR sigui útil

Privadesa d'aquesta eina

Els fitxers pugen per HTTPS, es processen a la memòria del servidor o en un directori temporal de curta vida, i s'esborren quan el resultat és a punt. No en guardem còpies per consultar-les després, per entrenar models ni per a perfils publicitaris. Els terminis de retenció i les galetes d'AdSense consten a la Política de privacitat.

Preguntes freqüents

L'OCR canvia l'aspecte de les pàgines?
No torna un PDF. L'original queda igual; rebeu una baixada Markdown a part.
És una biblioteca OCR que puc incrustar?
No. És una feina HTTP allotjada a /api/v1/misc/ocr-pdf. Vegeu /developers. No és un SDK enllaçable.
Després de l'OCR puc passar a Word?
No com a canonada PDF. La sortida de l'OCR és Markdown. «PDF a Word» encara necessita un PDF amb capa de text.
Un PDF electrònic necessita Force OCR?
Normalment no. Normal/Auto usa el text existent i salta el motor d'OCR. Useu Force quan la capa de text estigui malmesa o no sigui fiable.

Darrera actualització:

Crida-ho des del codi

Cada eina del lloc és una interfície REST normal. Per a ús anònim no cal compte ni clau API. Pensat per a agents d'IA i desenvolupadors, igual que per al navegador.

curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
  -F "[email protected]" \
  -F "ocrType=force-ocr" \
  -o output.pdf

També hi ha una eina MCP per a clients d'agents que parlen Model Context Protocol (JSON-RPC 2.0 amb POST /mcp). Referència completa de l'API

Fes-lo servir des d'un agent d'IA

Skill

Amb aquest skill, Claude Code, Codex, Cursor i altres agents d'IA poden executar «OCR a Markdown» per tu: /skills/pdf123-ocr.md

Tots els skills per a agents

Els arxius només serveixen per a aquest processament i s'esborren sols després.