Convertir un PDF en XML
PDF vers XML importe un PDF via LibreOffice et renvoie un fichier XML de type Office. C’est un export approximatif du texte et de la mise en page, pas une copie de la structure ou des balises du PDF.
Déposez des fichiers ici, ou cliquez pour les choisir
Formats acceptés : PDF · jusqu'à 500.0 MB par fichier · jusqu'à 20 fichiers à la fois
Vous pouvez aussi coller un fichier avec Ctrl/Cmd+V ou depuis le menu du presse-papiers.
PDF vers XML envoie le fichier dans LibreOffice `writer_pdf_import`, `outputFormat=xml`. Le téléchargement est du XML de style Office (`octet-stream`), pas une restauration du flux de contenu PDF ni de la structure d'un PDF balisé.
C'est la même famille d'import LibreOffice que PDF vers Word, avec XML comme cible. Mise en page, tableaux et polices sont reconstruits dans la mesure du possible. Un scan sans couche de texte devient des images ou des paragraphes vides.
Cette page n'a pas d'options. Les fichiers protégés par mot de passe sont déverrouillés pour vous sur cette page une fois le mot de passe saisi ; via l'API, passez d'abord par Retirer le mot de passe. Le Markdown de l'OCR ne peut pas être envoyé ici.
Pour des lignes de tableau, utilisez PDF vers CSV. Pour du texte seul, utilisez PDF vers RTF (texte).
L'envoi est temporaire. Nous ne conservons pas votre bibliothèque XML.
Fonctions
- LibreOffice `writer_pdf_import` vers XML
- Ni export de structure PDF, ni OCR
- Pas de plage de pages ni d'options de schéma
- API anonyme : /api/v1/convert/pdf/xml
Quand utiliser cet outil
- Livrer un PDF électronique à un pipeline qui accepte déjà du XML Office
- Voir comment LibreOffice découpe ce document
- Obtenir un brouillon XML quand l'étape suivante n'est pas du DOCX
Comment convertir un PDF en XML ?
- Téléversez un PDF avec du texte.
- Cliquez sur Traiter. Cette page n'a pas d'options de format.
- Téléchargez le `.xml`.
- Ouvrez-le dans LibreOffice ou un éditeur et traitez-le comme un brouillon.
Limites et cas limites
- Ni PDF balisé, ni extraction XFDF/XFA
- Pas d'OCR
- Tableaux et pagination ne colleront pas au PDF
- Limite d’envoi sur ce site : 500 Mo par fichier, envoyé par morceaux au-delà d’environ 95 Mo. Le corps d’une requête API directe est limité à 100 Mo.
Exemples
- Un mémo texte devient souvent un grand XML Office avec des runs de paragraphes
- Un PDF purement scanné devient souvent du XML qui emballe surtout des images
Confidentialité de cet outil
Les fichiers sont envoyés en HTTPS, traités en mémoire ou dans un répertoire temporaire de courte durée sur nos serveurs, puis supprimés dès que le résultat est prêt. Nous ne conservons pas de copies pour une consultation ultérieure, un entraînement de modèles ou des profils publicitaires. Consultez la politique de confidentialité pour la durée de conservation et les cookies AdSense.
Questions fréquentes
- Est-ce le XML interne du PDF ?
- Non. C'est LibreOffice qui exporte le document importé en XML, pas l'arbre d'objets PDF.
- Pourquoi un scan est-il quasi vide ?
- LibreOffice n'a pas de texte à importer. Pour les mots dans les pixels, utilisez OCR vers Markdown.
- Puis-je choisir un autre dialecte XML ?
- Non. Ce chemin fixe outputFormat à xml et n'autorise que cette valeur.
- Quelle différence avec PDF vers Word ?
- L'importeur est le même, la sortie diffère. PDF vers Word donne docx, doc ou odt. Ce chemin donne xml.
Dernière mise à jour:
Appeler depuis le code
Chaque outil du site est un endpoint REST. L'usage anonyme n'exige ni compte ni clé API. Pour le navigateur, les développeurs et les agents IA.
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/xml" \
-F "[email protected]" \
-o output.pdfAussi disponible comme outil MCP pour les clients agents qui parlent le Model Context Protocol (JSON-RPC 2.0 via POST /mcp). Référence API complète
L'utiliser depuis un agent IA
SkillAvec ce skill, Claude Code, Codex, Cursor et d'autres agents IA peuvent exécuter « PDF vers XML » pour vous : /skills/pdf123-pdf-to-xml.md
Les fichiers ne servent qu'à ce traitement, puis sont supprimés automatiquement.