Vai al contenuto principale
PPDF123

OCR di un PDF scansionato in Markdown

OCR in Markdown legge un PDF scansionato o fatto di immagini e restituisce il suo testo come file Markdown. Non aggiunge un livello di testo al PDF e il file originale non cambia.

Trascina i file qui, o clicca per sceglierli

Accetta PDF · fino a 500.0 MB per file · fino a 20 file alla volta

Puoi anche incollare un file con Ctrl/Cmd+V o dal menu degli appunti.

OCR in Markdown legge un PDF scansionato o fatto di immagini e restituisce Markdown (`text/markdown`, file `.md`). Non scrive un livello di testo nascosto nel PDF, e non pulisce, raddrizza né riscrive la scansione.

Il server fonde il testo nativo del PDF con il riconoscimento ottico sulle pagine immagine. Force OCR (`ocrType=force-ocr`, il valore predefinito del portale) riconosce di nuovo ogni pagina. In Normal (qualsiasi valore diverso da `force-ocr`) si usa il testo che il file ha già e si applica l'OCR solo alle pagine solo-immagine. Su un PDF digitale pulito, Auto non carica il motore OCR.

La precisione segue la qualità della scansione, il contrasto e l'inclinazione. Il motore non ha un parametro di lingua. I campi residui di Java OCRmyPDF (`languages`, `deskew`, `clean`, `sidecar`) vengono ignorati se un client li invia ancora.

Non è un pre-processore di PDF in Word né di PDF in RTF (testo). Quegli strumenti hanno ancora bisogno di testo dentro il PDF. L'OCR qui è un'estrazione parallela: ottieni Markdown; il PDF originale non cambia.

Non fare OCR di documenti che non hai il diritto di digitalizzare o ridistribuire. Il diritto d'autore e le regole sul lavoro valgono anche per il testo estratto.

Chi cerca un PDF ricercabile qui non lo trova. L'artefatto ricercabile è il Markdown. Aprilo in un editor e controlla nomi e numeri che devono essere esatti.

Ritaglia e raddrizza le foto da telefono prima del caricamento, se puoi. Una foto a trapezio spreca riconoscimento sullo sfondo. L'OCR non è traduzione: riconosce caratteri; non riscrive il documento in un'altra lingua.

I job girano sul server. Scarica appena è pronto. Non teniamo una biblioteca OCR dei tuoi file. I file protetti da password vengono sbloccati per te su questa pagina una volta inserita la password; chi usa l'API deve prima passare da Rimuovi password.

Funzioni

  • Restituisce Markdown, non un PDF con OCR
  • Force OCR rilegge ogni pagina; Normal/Auto usa il testo nativo se c'è
  • Il PDF originale non cambia
  • API anonima: /api/v1/misc/ocr-pdf

Quando usarlo

  • Estrarre il testo di clausole da scansioni d'archivio
  • Dare scansioni ad agenti o pipeline che vogliono Markdown
  • Recuperare testo quando il PDF è solo immagine

Come fare l'OCR di un PDF scansionato?

  1. Carica un PDF scansionato o fotografato col telefono.
  2. Scegli Force OCR (predefinito) o Normal/Auto.
  3. Fai clic su Elabora e scarica il file `.md`.
  4. Controlla nomi e numeri nel Markdown prima di fidartene.

Limiti e casi limite

  • La precisione varia con la qualità dell'immagine
  • Tante pagine impiegano di più
  • Il motore attuale non ha parametro di lingua
  • Non è una libreria OCR locale né un SDK offline
  • Limite di caricamento su questo sito: 500 MB per file, inviati a blocchi oltre circa 95 MB. Il corpo di una singola richiesta API diretta è limitato a 100 MB.

Esempi

  • Un contratto di 20 pagine in scala di grigi diventa un Markdown con il testo delle clausole
  • Una foto storta dal telefono spesso va rifatta prima che l'OCR serva

Privacy di questo strumento

I file vengono caricati su HTTPS, elaborati in memoria o in una directory temporanea di breve durata sui nostri server, e cancellati quando il risultato è pronto. Non conserviamo copie per consultarle in seguito, per addestrare modelli o per profili pubblicitari. Consulta l'Informativa sulla privacy per i tempi di conservazione e i cookie AdSense.

Domande frequenti

L'OCR cambia l'aspetto delle pagine?
Non restituisce un PDF. Il file originale resta uguale; scarichi un Markdown a parte.
È una libreria OCR che posso incorporare?
No. È un job HTTP ospitato su /api/v1/misc/ocr-pdf. Vedi /developers. Non è un SDK collegabile.
Posso convertire in Word dopo l'OCR?
Non come catena PDF. L'uscita OCR è Markdown. PDF in Word ha ancora bisogno di un PDF con livello di testo.
Serve Force OCR su un PDF nato digitale?
Di solito no. Normal/Auto usa il testo esistente e non carica il motore OCR. Usa Force se quel livello è rotto o non ti fidi.

Ultimo aggiornamento:

Chiamalo dal codice

Ogni strumento del sito è un'interfaccia REST. Per l'uso anonimo non servono account né chiave API. Va bene per browser, sviluppatori e agenti IA.

curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
  -F "[email protected]" \
  -F "ocrType=force-ocr" \
  -o output.pdf

Disponibile anche come strumento MCP per i client che parlano Model Context Protocol (JSON-RPC 2.0 su POST /mcp). Riferimento API completo

Usalo da un agente IA

Skill

Con questa skill, Claude Code, Codex, Cursor e altri agenti IA possono eseguire «OCR in Markdown» al posto tuo: /skills/pdf123-ocr.md

Tutte le skill per agenti

I file servono solo a questa elaborazione e poi vengono cancellati.