Konvertera PDF till XML
PDF till XML importerar en PDF via LibreOffice och returnerar en XML-fil i Office-stil. Det är en text- och layoutexport så gott det går, inte en kopia av PDF:ens struktur eller taggar.
Dra filer hit, eller klicka för att välja
Tar emot PDF · upp till 500.0 MB per fil · upp till 20 filer åt gången
Du kan också klistra in en fil med Ctrl/Cmd+V eller via urklippsmenyn.
PDF till XML skickar filen till LibreOffice `writer_pdf_import` med `outputFormat=xml`. Nedladdningen är Office-liknande XML (`octet-stream`), inte återställning av PDF-innehållsströmmar eller tagged-PDF-struktur.
Det är samma LibreOffice-importfamilj som PDF till Word, men målet är XML. Layout, tabeller och typsnitt är så gott det går. Skanningar utan textlager blir bilder eller tomma stycken.
Sidan har inga alternativ. Lösenordsskyddade filer låses upp åt dig på den här sidan när du anger lösenordet; API-anropare kör Ta bort lösenord först. OCR-Markdown kan inte skickas hit.
Vill du ha rader ur tabeller, använd PDF till CSV. Vill du bara ha ord, använd PDF till RTF.
Uppladdningar är tillfälliga. Vi sparar ingen XML-katalog.
Funktioner
- LibreOffice `writer_pdf_import` till XML
- Varken PDF-strukturexport eller OCR
- Inga sidintervall- eller schemaalternativ
- Anonym API: /api/v1/convert/pdf/xml
När du ska använda det här verktyget
- Mata ett flöde som redan tar Office-XML
- Se hur LibreOffice delar upp dokumentet
- Få XML-utkast när nästa steg inte är DOCX
Hur konverterar jag en PDF till XML?
- Ladda upp PDF med text.
- Klicka på Bearbeta. Inga formatalternativ på den här sidan.
- Ladda ner `.xml`.
- Öppna i LibreOffice eller en editor och behandla det som utkast.
Gränser och specialfall
- Varken tagged-PDF eller XFDF/XFA-utdrag
- Ingen OCR
- Tabeller och paginering matchar inte PDF:en
- Uppladdningsgräns på webbplatsen: 500 MB per fil, som skickas i delar över cirka 95 MB. Innehållet i en enskild direkt API-förfrågan är begränsat till 100 MB.
Exempel
- En textpromemoria blir ofta stor Office-XML med styckeruns
- Ren skannings-PDF blir ofta XML som mest packar bilder
Integritet för det här verktyget
Filer laddas upp via HTTPS, bearbetas i serverns minne eller en kortlivad tillfällig katalog och raderas när resultatet är klart. Vi behåller inga kopior för senare bläddring, träning eller annonsprofiler. Se integritetspolicyn för lagringstider och AdSense-cookieupplysningar.
Vanliga frågor
- Är det PDF:ens interna XML?
- Nej. Det är LibreOffice som exporterar det importerade dokumentet som XML, inte PDF-objektträdet.
- Varför är skanningen nästan tom?
- LibreOffice hade ingen text att importera. Text i pixlar: OCR till Markdown.
- Kan jag välja annan XML-dialekt?
- Nej. Vägen låser outputFormat till xml och tillåter bara det värdet.
- Vad skiljer mot PDF till Word?
- Samma importör, annan utdata. PDF till Word ger docx, doc eller odt. Den här vägen ger xml.
Senast uppdaterad:
Anropa från kod
Varje verktyg på webbplatsen är ett vanligt REST-anrop. För anonym användning behövs varken konto eller API-nyckel. Lika mycket för AI-agenter och utvecklare som för webbläsaren.
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/xml" \
-F "[email protected]" \
-o output.pdfFinns också som MCP-verktyg för klienter som talar Model Context Protocol (JSON-RPC 2.0 via POST /mcp). Fullständig API-referens
Använd den från en AI-agent
SkillMed den här skillen kan Claude Code, Codex, Cursor och andra AI-agenter köra ”PDF till XML” åt dig: /skills/pdf123-pdf-to-xml.md
Filerna används bara för den här körningen och raderas automatiskt efteråt.