Till huvudinnehållet
PPDF123

OCR:a en skannad PDF till Markdown

OCR till Markdown läser en skannad eller bildbaserad PDF och returnerar texten som en Markdown-fil. Den lägger inte till något textlager i PDF:en, och originalfilen ändras inte.

Dra filer hit, eller klicka för att välja

Tar emot PDF · upp till 500.0 MB per fil · upp till 20 filer åt gången

Du kan också klistra in en fil med Ctrl/Cmd+V eller via urklippsmenyn.

OCR läser en skannad eller bildbaserad PDF och returnerar Markdown (`text/markdown`, filnamn `.md`). Den skriver inte tillbaka ett dolt textlager i PDF:en och rensar, rätar eller skriver inte om skanningen.

Servern fogar ihop befintlig inbyggd text i PDF:en med optisk igenkänning på bildsidor. Force OCR (`ocrType=force-ocr`, webbplatsens standard) läser om varje sida. Normal (allt som inte är `force-ocr`) använder inbyggd text när den finns och kör OCR bara på rena bildsidor. På rena digitala PDF:er laddar Auto inte OCR-motorn.

Noggrannheten beror på skanningskvalitet, kontrast och snedhet. Motorn har just nu ingen språkparameter. Skickar klienten fortfarande gamla Java OCRmyPDF-fält (`languages`, `deskew`, `clean`, `sidecar`) ignoreras de.

Det här är inte ett försteg till PDF till Word eller PDF till RTF. De verktygen kräver fortfarande text inne i PDF:en. OCR här är parallell utvinning: du får Markdown, original-PDF:en ändras inte.

Kör inte OCR på filer du saknar rätt att digitalisera eller vidareförmedla. Utdragen text lyder under samma upphovsrätt och arbetsplatsregler.

Vill du ha en sökbar PDF ger den här sidan dig den inte. Resultatet är Markdown-filen. Öppna den i en editor och stickprovsgranska namn och siffror som måste stämma.

Beskär och räta mobilfoton innan uppladdning när det går. Trapetsformade sidor slösar igenkänning på bakgrund. OCR är ingen översättning: den läser tecken, den skriver inte om dokumentet till ett annat språk.

Jobbet körs på servern. Ladda ner i tid. Vi bygger inget OCR-bibliotek av dina filer. Lösenordsskyddade filer låses upp åt dig på den här sidan när du anger lösenordet; API-anropare kör Ta bort lösenord först.

Funktioner

  • Returnerar Markdown, inte en PDF med OCR-lager
  • Force OCR läser om varje sida; Normal/Auto använder inbyggd text när den finns
  • Original-PDF:en ändras inte
  • Anonym API: /api/v1/misc/ocr-pdf

När du ska använda det här verktyget

  • Dra ut klausultext från arkivskanningar
  • Ge skanningar till agenter eller flöden som vill ha Markdown
  • Få tillbaka text när en ren bild-PDF saknar textlager

Hur OCR:ar jag en skannad PDF?

  1. Ladda upp en skannad eller fotograferad PDF.
  2. Välj Force OCR (standard) eller Normal/Auto.
  3. Klicka på Bearbeta och ladda ner `.md`-filen.
  4. Stickprovsgranska namn och siffror i Markdown innan du använder den.

Gränser och specialfall

  • Noggrannheten följer bildkvaliteten
  • Många sidor tar längre tid
  • Motorn har just nu ingen språkparameter
  • Varken lokalt OCR-bibliotek eller offline-SDK
  • Uppladdningsgräns på webbplatsen: 500 MB per fil, som skickas i delar över cirka 95 MB. Innehållet i en enskild direkt API-förfrågan är begränsat till 100 MB.

Exempel

  • En 20-sidig gråskaleavtalsskanning blir en Markdown-fil med klausultext
  • Sneda mobilfoton kan behöva fotas om innan OCR blir användbar

Integritet för det här verktyget

Filer laddas upp via HTTPS, bearbetas i serverns minne eller en kortlivad tillfällig katalog och raderas när resultatet är klart. Vi behåller inga kopior för senare bläddring, träning eller annonsprofiler. Se integritetspolicyn för lagringstider och AdSense-cookieupplysningar.

Vanliga frågor

Ändrar OCR sidornas utseende?
Den returnerar ingen PDF. Originalfilen är oförändrad; du får en separat Markdown-nedladdning.
Är det här ett inbäddningsbart OCR-bibliotek?
Nej. Det är ett HTTP-jobb på /api/v1/misc/ocr-pdf. Se /developers. Det är inget länkbar SDK.
Kan jag köra PDF till Word efter OCR?
Inte som en PDF-kedja. OCR-utdata är Markdown. PDF till Word behöver fortfarande en PDF med textlager.
Behöver digitala PDF:er Force OCR?
Vanligtvis inte. Normal/Auto använder befintlig text och hoppar över OCR-motorn. Använd Force när textlagret är trasigt eller opålitligt.

Senast uppdaterad:

Anropa från kod

Varje verktyg på webbplatsen är ett vanligt REST-anrop. För anonym användning behövs varken konto eller API-nyckel. Lika mycket för AI-agenter och utvecklare som för webbläsaren.

curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
  -F "[email protected]" \
  -F "ocrType=force-ocr" \
  -o output.pdf

Finns också som MCP-verktyg för klienter som talar Model Context Protocol (JSON-RPC 2.0 via POST /mcp). Fullständig API-referens

Använd den från en AI-agent

Skill

Med den här skillen kan Claude Code, Codex, Cursor och andra AI-agenter köra ”OCR till Markdown” åt dig: /skills/pdf123-ocr.md

Alla agent-skills

Filerna används bara för den här körningen och raderas automatiskt efteråt.