Een gescande PDF met OCR naar Markdown
OCR naar Markdown leest een gescande of beeldgebaseerde PDF en geeft de tekst terug als Markdown-bestand. Het voegt geen tekstlaag aan de PDF toe en het oorspronkelijke bestand blijft ongewijzigd.
Sleep bestanden hierheen, of klik om te kiezen
Accepteert PDF · tot 500.0 MB per bestand · maximaal 20 bestanden tegelijk
Je kunt een bestand ook plakken met Ctrl/Cmd+V of via het klembordmenu.
OCR naar Markdown leest een gescande of beeldgebaseerde PDF en geeft Markdown terug (`text/markdown`, bestandsnaam `.md`). Het schrijft geen verborgen tekstlaag terug in de PDF, en het maakt de scan niet schoon, recht of herschreven.
De server voegt native PDF-tekst samen met optische herkenning op beeldpagina’s. Force OCR (`ocrType=force-ocr`, de portaalstandaard) herkent elke pagina opnieuw. Normal (alles behalve `force-ocr`) gebruikt bestaande tekst waar het bestand die al heeft en herkent alleen beeldpagina’s. Op een schone, elektronisch gemaakte PDF laadt Auto de OCR-runtime niet.
Nauwkeurigheid volgt scankwaliteit, contrast en scheefstand. De huidige engine heeft geen taalparameter. Overgebleven Java-OCRmyPDF-velden (`languages`, `deskew`, `clean`, `sidecar`) worden genegeerd als een client ze nog meestuurt.
Dit is geen voorverwerking voor PDF naar Word of PDF naar RTF. Die tools hebben nog steeds tekst in een PDF nodig. OCR hier is een parallelle extractie: u krijgt Markdown, de oorspronkelijke PDF blijft ongewijzigd.
Voer geen OCR uit op documenten die u niet mag digitaliseren of herverdelen. Auteursrecht en werkplekregels gelden ook voor de geëxtraheerde tekst.
Wie een doorzoekbare PDF verwacht, krijgt die hier niet. Het doorzoekbare artefact is het Markdown-bestand. Open het in een editor en controleer namen en cijfers die exact moeten kloppen.
Snijd en recht telefoonopnames vóór het uploaden als dat kan. Een trapeziumfoto van een pagina verspilt herkenning aan de achtergrond. OCR is geen vertaling: het herkent tekens, het herschrijft het document niet in een andere taal.
Opdrachten draaien op de server. Haal tijdig. Wij houden geen OCR-bibliotheek van uw bestanden bij. Wachtwoordbeveiligde bestanden worden op deze pagina voor u ontgrendeld zodra u het wachtwoord invoert; API-gebruikers voeren eerst Wachtwoord verwijderen uit.
Functies
- Geeft Markdown terug, geen OCR-PDF
- Force OCR leest elke pagina opnieuw; Normal/Auto gebruikt native tekst indien aanwezig
- De oorspronkelijke PDF blijft ongewijzigd
- Anonieme API: /api/v1/misc/ocr-pdf
Wanneer je dit gebruikt
- Clausuletekst uit archiefscans halen
- Scans voeden aan agenten of pijplijnen die Markdown willen
- Tekst terughalen wanneer een PDF alleen beeld is
Hoe voer ik OCR uit op een gescande PDF?
- Voeg een gescande of met de camera vastgelegde PDF toe.
- Kies Force OCR (standaard) of Normal/Auto.
- Klik op Verwerken en haal het `.md`-bestand.
- Controleer namen en cijfers in de Markdown voordat u erop vertrouwt.
Beperkingen en randgevallen
- Nauwkeurigheid varieert met de beeldkwaliteit
- Zeer grote paginatellingen duren langer
- Geen taalparameter op de huidige engine
- Geen lokale OCR-bibliotheek of offline SDK
- Uploadlimiet op deze website: 500 MB per bestand, in delen verzonden boven ongeveer 95 MB. Eén directe API-aanvraag is beperkt tot 100 MB.
Voorbeelden
- Een 20 pagina’s tellende grijswaardenscan van een contract wordt een Markdown-bestand met clausuletekst.
- Een scheve telefoonfoto moet vaak opnieuw worden gemaakt voordat OCR nuttig is
Privacy bij deze tool
Bestanden gaan via HTTPS naar de server, worden in het geheugen of een kortlevende tijdelijke map verwerkt, en gewist zodra uw resultaat klaar is. Wij bewaren geen kopieën voor later bladeren, training of advertentieprofielen. Bewaartermijnen en AdSense-cookiemeldingen staan in het privacybeleid.
Veelgestelde vragen
- Verandert OCR hoe pagina’s eruitzien?
- Het geeft geen PDF terug. Het oorspronkelijke bestand blijft ongewijzigd; u krijgt een aparte Markdown-download.
- Is dit een OCR-bibliotheek die ik kan inbedden?
- Nee. Het is een gehoste HTTP-opdracht op /api/v1/misc/ocr-pdf. Zie /developers. Het is geen koppelbaar SDK.
- Kan ik na OCR naar Word converteren?
- Niet als PDF-pijplijn. OCR-uitvoer is Markdown. PDF naar Word heeft nog steeds een PDF met tekstlaag nodig.
- Heb ik Force OCR nodig op een elektronisch gemaakte PDF?
- Meestal niet. Normal/Auto gebruikt de bestaande tekst en slaat de OCR-runtime over. Gebruik Force als die laag kapot is of u er niet op vertrouwt.
Laatst bijgewerkt:
Aanroepen vanuit code
Elke tool op deze site is een gewoon REST-eindpunt. Voor anoniem gebruik heb je geen account of API-sleutel nodig. Net zo goed voor AI-agenten en ontwikkelaars als voor de browser.
curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
-F "[email protected]" \
-F "ocrType=force-ocr" \
-o output.pdfOok beschikbaar als MCP-tool voor clients die Model Context Protocol spreken (JSON-RPC 2.0 via POST /mcp). Volledige API-documentatie
Gebruik het vanuit een AI-agent
SkillMet deze skill kunnen Claude Code, Codex, Cursor en andere AI-agents ‘OCR naar Markdown’ voor je uitvoeren: /skills/pdf123-ocr.md
Bestanden dienen alleen voor deze verwerking en worden daarna automatisch verwijderd.