Aller au contenu principal
PPDF123

Passer un PDF scanné à l’OCR en Markdown

OCR vers Markdown lit un PDF scanné ou composé d’images et renvoie son texte dans un fichier Markdown. Il n’ajoute pas de couche de texte au PDF, et le fichier d’origine reste inchangé.

Déposez des fichiers ici, ou cliquez pour les choisir

Formats acceptés : PDF · jusqu'à 500.0 MB par fichier · jusqu'à 20 fichiers à la fois

Vous pouvez aussi coller un fichier avec Ctrl/Cmd+V ou depuis le menu du presse-papiers.

OCR vers Markdown lit un PDF scanné ou purement image et renvoie du Markdown (`text/markdown`, extension `.md`). Il n’écrit pas de couche texte cachée dans le PDF, et ne nettoie, ne redresse ni ne réécrit le scan.

Le serveur combine le texte natif déjà présent dans le PDF avec la reconnaissance optique des pages image. Force OCR (`ocrType=force-ocr`, défaut du site) réidentifie chaque page. Normal (tout sauf `force-ocr`) utilise le texte natif quand il existe et n’applique l’OCR qu’aux pages purement graphiques. Sur un PDF électronique propre, Auto ne charge pas le moteur OCR.

La précision dépend de la qualité du scan, du contraste et de l’inclinaison. Le moteur actuel n’accepte pas de paramètre de langue. Si le client envoie encore d’anciens champs Java OCRmyPDF (`languages`, `deskew`, `clean`, `sidecar`), ils sont ignorés.

Ce n’est pas une étape préalable à PDF vers Word ni à PDF vers RTF (texte). Ces outils exigent encore du texte déjà présent dans le PDF. Ici, l’OCR est une extraction parallèle : vous obtenez du Markdown, le PDF d’origine reste inchangé.

N’appliquez l’OCR qu’à des fichiers que vous avez le droit de numériser ou de redistribuer. Le texte extrait reste soumis au droit d’auteur et aux règles du lieu de travail.

Ceux qui veulent un PDF searchable n’en obtiendront pas ici. Le livrable est un fichier Markdown. Ouvrez-le dans un éditeur et vérifiez les noms et chiffres qui doivent être exacts.

Pour les photos de téléphone, recadrez et redressez avant de téléverser. Une page en trapèze gaspille la reconnaissance sur l’arrière-plan. L’OCR n’est pas une traduction : il reconnaît des caractères, sans reformuler le document dans une autre langue.

La tâche s’exécute sur le serveur. Téléchargez rapidement. Nous ne constituons pas de bibliothèque OCR de vos fichiers. Les fichiers protégés par mot de passe sont déverrouillés pour vous sur cette page une fois le mot de passe saisi ; via l'API, passez d'abord par Retirer le mot de passe.

Fonctions

  • Renvoie du Markdown, pas un PDF avec couche OCR
  • Force OCR relit chaque page ; Normal/Auto utilise le texte natif quand il existe
  • Le PDF d’origine reste inchangé
  • API anonyme : /api/v1/misc/ocr-pdf

Quand utiliser cet outil

  • Extraire le texte de clauses depuis des scans d’archives
  • Fournir un scan à un agent ou un pipeline qui attend du Markdown
  • Récupérer le texte d’un PDF purement image sans couche texte

Comment faire l’OCR d’un PDF scanné ?

  1. Téléversez un PDF scanné ou photographié au téléphone.
  2. Choisissez Force OCR (défaut) ou Normal/Auto.
  3. Cliquez sur Traiter, puis téléchargez le fichier `.md`.
  4. Dans le Markdown, vérifiez noms et chiffres avant utilisation.

Limites et cas limites

  • La précision varie avec la qualité de l’image
  • Beaucoup de pages allongent le temps de traitement
  • Le moteur actuel n’a pas de paramètre de langue
  • Ce n’est ni une bibliothèque OCR locale ni un SDK hors ligne
  • Limite d’envoi sur ce site : 500 Mo par fichier, envoyé par morceaux au-delà d’environ 95 Mo. Le corps d’une requête API directe est limité à 100 Mo.

Exemples

  • Un contrat scanné en niveaux de gris de 20 pages devient un fichier Markdown de clauses
  • Une photo de page penchée peut nécessiter une reprise avant que l’OCR soit utile

Confidentialité de cet outil

Les fichiers sont envoyés en HTTPS, traités en mémoire ou dans un répertoire temporaire de courte durée sur nos serveurs, puis supprimés dès que le résultat est prêt. Nous ne conservons pas de copies pour une consultation ultérieure, un entraînement de modèles ou des profils publicitaires. Consultez la politique de confidentialité pour la durée de conservation et les cookies AdSense.

Questions fréquentes

L’OCR modifie-t-il l’apparence des pages ?
Il ne renvoie pas de PDF. Le fichier d’origine reste intact ; vous obtenez un téléchargement Markdown séparé.
Est-ce une bibliothèque OCR intégrable ?
Non. C’est une tâche HTTP hébergée sur /api/v1/misc/ocr-pdf. Voir /developers. Ce n’est pas un SDK linkable.
Peut-on enchaîner ensuite vers PDF vers Word ?
Pas comme une chaîne PDF. L’OCR produit du Markdown. PDF vers Word exige encore un PDF avec couche texte.
Un PDF électronique a-t-il besoin de Force OCR ?
En général non. Normal/Auto utilise le texte existant et évite le moteur OCR. Réservez Force si la couche texte est corrompue ou peu fiable.

Dernière mise à jour:

Appeler depuis le code

Chaque outil du site est un endpoint REST. L'usage anonyme n'exige ni compte ni clé API. Pour le navigateur, les développeurs et les agents IA.

curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
  -F "[email protected]" \
  -F "ocrType=force-ocr" \
  -o output.pdf

Aussi disponible comme outil MCP pour les clients agents qui parlent le Model Context Protocol (JSON-RPC 2.0 via POST /mcp). Référence API complète

L'utiliser depuis un agent IA

Skill

Avec ce skill, Claude Code, Codex, Cursor et d'autres agents IA peuvent exécuter « OCR vers Markdown » pour vous : /skills/pdf123-ocr.md

Tous les skills pour agents

Les fichiers ne servent qu'à ce traitement, puis sont supprimés automatiquement.