OCR di un PDF scansionato in Markdown
OCR in Markdown legge un PDF scansionato o fatto di immagini e restituisce il suo testo come file Markdown. Non aggiunge un livello di testo al PDF e il file originale non cambia.
Trascina i file qui, o clicca per sceglierli
Accetta PDF · fino a 500.0 MB per file · fino a 20 file alla volta
Puoi anche incollare un file con Ctrl/Cmd+V o dal menu degli appunti.
OCR in Markdown legge un PDF scansionato o fatto di immagini e restituisce Markdown (`text/markdown`, file `.md`). Non scrive un livello di testo nascosto nel PDF, e non pulisce, raddrizza né riscrive la scansione.
Il server fonde il testo nativo del PDF con il riconoscimento ottico sulle pagine immagine. Force OCR (`ocrType=force-ocr`, il valore predefinito del portale) riconosce di nuovo ogni pagina. In Normal (qualsiasi valore diverso da `force-ocr`) si usa il testo che il file ha già e si applica l'OCR solo alle pagine solo-immagine. Su un PDF digitale pulito, Auto non carica il motore OCR.
La precisione segue la qualità della scansione, il contrasto e l'inclinazione. Il motore non ha un parametro di lingua. I campi residui di Java OCRmyPDF (`languages`, `deskew`, `clean`, `sidecar`) vengono ignorati se un client li invia ancora.
Non è un pre-processore di PDF in Word né di PDF in RTF (testo). Quegli strumenti hanno ancora bisogno di testo dentro il PDF. L'OCR qui è un'estrazione parallela: ottieni Markdown; il PDF originale non cambia.
Non fare OCR di documenti che non hai il diritto di digitalizzare o ridistribuire. Il diritto d'autore e le regole sul lavoro valgono anche per il testo estratto.
Chi cerca un PDF ricercabile qui non lo trova. L'artefatto ricercabile è il Markdown. Aprilo in un editor e controlla nomi e numeri che devono essere esatti.
Ritaglia e raddrizza le foto da telefono prima del caricamento, se puoi. Una foto a trapezio spreca riconoscimento sullo sfondo. L'OCR non è traduzione: riconosce caratteri; non riscrive il documento in un'altra lingua.
I job girano sul server. Scarica appena è pronto. Non teniamo una biblioteca OCR dei tuoi file. I file protetti da password vengono sbloccati per te su questa pagina una volta inserita la password; chi usa l'API deve prima passare da Rimuovi password.
Funzioni
- Restituisce Markdown, non un PDF con OCR
- Force OCR rilegge ogni pagina; Normal/Auto usa il testo nativo se c'è
- Il PDF originale non cambia
- API anonima: /api/v1/misc/ocr-pdf
Quando usarlo
- Estrarre il testo di clausole da scansioni d'archivio
- Dare scansioni ad agenti o pipeline che vogliono Markdown
- Recuperare testo quando il PDF è solo immagine
Come fare l'OCR di un PDF scansionato?
- Carica un PDF scansionato o fotografato col telefono.
- Scegli Force OCR (predefinito) o Normal/Auto.
- Fai clic su Elabora e scarica il file `.md`.
- Controlla nomi e numeri nel Markdown prima di fidartene.
Limiti e casi limite
- La precisione varia con la qualità dell'immagine
- Tante pagine impiegano di più
- Il motore attuale non ha parametro di lingua
- Non è una libreria OCR locale né un SDK offline
- Limite di caricamento su questo sito: 500 MB per file, inviati a blocchi oltre circa 95 MB. Il corpo di una singola richiesta API diretta è limitato a 100 MB.
Esempi
- Un contratto di 20 pagine in scala di grigi diventa un Markdown con il testo delle clausole
- Una foto storta dal telefono spesso va rifatta prima che l'OCR serva
Privacy di questo strumento
I file vengono caricati su HTTPS, elaborati in memoria o in una directory temporanea di breve durata sui nostri server, e cancellati quando il risultato è pronto. Non conserviamo copie per consultarle in seguito, per addestrare modelli o per profili pubblicitari. Consulta l'Informativa sulla privacy per i tempi di conservazione e i cookie AdSense.
Domande frequenti
- L'OCR cambia l'aspetto delle pagine?
- Non restituisce un PDF. Il file originale resta uguale; scarichi un Markdown a parte.
- È una libreria OCR che posso incorporare?
- No. È un job HTTP ospitato su /api/v1/misc/ocr-pdf. Vedi /developers. Non è un SDK collegabile.
- Posso convertire in Word dopo l'OCR?
- Non come catena PDF. L'uscita OCR è Markdown. PDF in Word ha ancora bisogno di un PDF con livello di testo.
- Serve Force OCR su un PDF nato digitale?
- Di solito no. Normal/Auto usa il testo esistente e non carica il motore OCR. Usa Force se quel livello è rotto o non ti fidi.
Ultimo aggiornamento:
Chiamalo dal codice
Ogni strumento del sito è un'interfaccia REST. Per l'uso anonimo non servono account né chiave API. Va bene per browser, sviluppatori e agenti IA.
curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
-F "[email protected]" \
-F "ocrType=force-ocr" \
-o output.pdfDisponibile anche come strumento MCP per i client che parlano Model Context Protocol (JSON-RPC 2.0 su POST /mcp). Riferimento API completo
Usalo da un agente IA
SkillCon questa skill, Claude Code, Codex, Cursor e altri agenti IA possono eseguire «OCR in Markdown» al posto tuo: /skills/pdf123-ocr.md
I file servono solo a questa elaborazione e poi vengono cancellati.