Convertir un PDF en HTML
PDF vers HTML convertit un PDF avec pdftohtml de Poppler et livre un ZIP contenant les pages HTML et leurs images. C’est un export de mise en page plutôt qu’un balisage web propre, et il ne fait pas d’OCR.
Déposez des fichiers ici, ou cliquez pour les choisir
Formats acceptés : PDF · jusqu'à 500.0 MB par fichier · jusqu'à 20 fichiers à la fois
Vous pouvez aussi coller un fichier avec Ctrl/Cmd+V ou depuis le menu du presse-papiers.
PDF vers HTML exécute Poppler `pdftohtml -c` et regroupe dans un ZIP ce que l'outil écrit dans le répertoire de sortie. Le nom du téléchargement est `{base}ToHtml.zip`, pas un seul `.html`. L'objectif n'est pas du CSS niveau navigateur, mais l'export HTML et images de Poppler.
Cette page n'a pas de champs de formulaire. Chaque page est convertie. Si `pdftohtml` n'écrit rien, l'interface renvoie une erreur interne, pas un ZIP vide.
Ce n'est pas de l'OCR. Un scan purement image devient des images dans le paquet HTML, pas du texte sélectionnable. Les fichiers protégés par mot de passe sont déverrouillés pour vous sur cette page une fois le mot de passe saisi ; via l'API, passez d'abord par Retirer le mot de passe.
Pour du texte seul, utilisez PDF vers RTF (texte). Pour un article adapté à un CMS, utilisez PDF vers Markdown.
L'envoi est temporaire. Nous ne conservons pas votre bibliothèque HTML.
Fonctions
- Poppler `pdftohtml -c`, ZIP avec HTML et ressources
- Pas de plage de pages ni d'options de thème
- Pas d'OCR ; les scans restent des images dans le paquet
- API anonyme : /api/v1/convert/pdf/html
Quand utiliser cet outil
- Obtenir un HTML approximatif depuis un PDF à couche de texte
- Récupérer les images de pages extraites par pdftohtml
- Voir comment Poppler lit le fichier avant un pipeline maison
Comment convertir un PDF en HTML ?
- Téléversez le PDF. Cette page n'a pas d'options de conversion.
- Cliquez sur Traiter et téléchargez `{name}ToHtml.zip`.
- Décompressez puis ouvrez le HTML dans un navigateur.
- Vérifiez images et texte. Les scans ne deviennent pas de vrai texte HTML.
Limites et cas limites
- La sortie est un ZIP, pas un HTML unique
- Ni impression Chromium, ni export HTML de PDF balisé
- Une sortie pdftohtml vide est une erreur, pas un 204
- Limite d’envoi sur ce site : 500 Mo par fichier, envoyé par morceaux au-delà d’environ 95 Mo. Le corps d’une requête API directe est limité à 100 Mo.
Exemples
- Un mémo texte simple se décompresse souvent en un HTML plus quelques images
- Un PDF purement scanné donne surtout un HTML qui emballe les images de pages
Confidentialité de cet outil
Les fichiers sont envoyés en HTTPS, traités en mémoire ou dans un répertoire temporaire de courte durée sur nos serveurs, puis supprimés dès que le résultat est prêt. Nous ne conservons pas de copies pour une consultation ultérieure, un entraînement de modèles ou des profils publicitaires. Consultez la politique de confidentialité pour la durée de conservation et les cookies AdSense.
Questions fréquentes
- Pourquoi le résultat est-il un ZIP ?
- pdftohtml écrit le HTML et les images extraites dans un dossier. Le serveur archive ce dossier.
- Le HTML collera-t-il à la mise en page du PDF ?
- Seulement dans la mesure du possible avec le mode `-c` de Poppler. Magazines multi-colonnes et vecteurs denses se décalent souvent.
- Puis-je transformer un scan en texte HTML ?
- Non. Ce chemin ne fait pas d'OCR. Pour du texte, utilisez OCR vers Markdown.
- La conversion se fait-elle dans le navigateur ?
- Non. Le serveur appelle pdftohtml.
Dernière mise à jour:
Appeler depuis le code
Chaque outil du site est un endpoint REST. L'usage anonyme n'exige ni compte ni clé API. Pour le navigateur, les développeurs et les agents IA.
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/html" \
-F "[email protected]" \
-o output.pdfAussi disponible comme outil MCP pour les clients agents qui parlent le Model Context Protocol (JSON-RPC 2.0 via POST /mcp). Référence API complète
L'utiliser depuis un agent IA
SkillAvec ce skill, Claude Code, Codex, Cursor et d'autres agents IA peuvent exécuter « PDF vers HTML » pour vous : /skills/pdf123-pdf-to-html.md
Les fichiers ne servent qu'à ce traitement, puis sont supprimés automatiquement.