Ves al contingut principal
PPDF123

Converteix un PDF en text

PDF a text extreu el text que ja existeix en un PDF i el torna com a fitxer .txt pla o com a RTF. No executa OCR, així que els escaneigs només d'imatge surten buits.

Arrossega arxius aquí, o fes clic per triar-los

Admet PDF · fins a 500.0 MB per arxiu · fins a 20 arxius alhora

També pots enganxar un fitxer amb Ctrl/Cmd+V o des del menú del porta-retalls.

PDF a text extreu les paraules que ja existeixen com a objectes de text. La ruta per defecte `txt` usa el mateix extractor local que altres operacions de pdf-core (`pdfio::extract_text`) i torna `text/plain`. No executa OCR ni crida LibreOffice en aquest mode.

Si demaneu `rtf`, la conversió pot passar per LibreOffice (`writer_pdf_import`, `soffice`) i tornar un `.rtf`. El mode `txt` és l'extracció directa.

Un escaneig només imatge no té text seleccionable: la sortida serà buida o gairebé. Per a escaneigs useu «OCR a Markdown».

Això no és «PDF a Markdown» ni «PDF a CSV». Cada eina té un objectiu diferent (prosa estructurada, taules, text pla).

Els fitxers protegits amb contrasenya es desbloquegen per vosaltres en aquesta pàgina un cop n'escriviu la clau; els clients d'API executen primer «Treu la contrasenya».

Les pujades són temporals. No desem el vostre corpus de text.

Funcions

  • Extracció de text pla via pdfio::extract_text (mode txt)
  • Opció rtf via LibreOffice quan es demana
  • No és OCR
  • API anònima: /api/v1/convert/pdf/text

Quan fer-la servir

  • Treure el cos d'un contracte electrònic a .txt
  • Alimentar un pipeline que espera text pla
  • Obtenir un RTF editable quan el flux ho exigeix

Com extrec el text d'un PDF?

  1. Pugeu un PDF amb capa de text.
  2. Trieu txt (per defecte) o rtf si el flux ho demana.
  3. Feu clic a Processar i baixeu el resultat.
  4. Obriu el fitxer i confirmeu que el text esperat hi és.

Límits i casos límit

  • Sense OCR
  • La maquetació es perd al text pla
  • Els fitxers protegits amb contrasenya en necessiten la clau; els clients d'API executen primer «Treu la contrasenya»
  • Límit de pujada en aquest web: 500 MB per fitxer, enviat per parts a partir d'uns 95 MB. El cos d'una sola petició directa a l'API està limitat a 100 MB.

Exemples

  • Un memoràndum electrònic de 3 pàgines dóna un .txt amb els paràgrafs
  • Un escaneig de rebut dóna poc o cap text al mode txt

Privadesa d'aquesta eina

Els fitxers pugen per HTTPS, es processen a la memòria del servidor o en un directori temporal de curta vida, i s'esborren quan el resultat és a punt. No en guardem còpies per consultar-les després, per entrenar models ni per a perfils publicitaris. Els terminis de retenció i les galetes d'AdSense consten a la Política de privacitat.

Preguntes freqüents

Per què la sortida és buida?
El PDF probablement és només imatge. Useu «OCR a Markdown» per a escaneigs.
Usa pdftotext?
El mode txt usa l'extractor local pdfio::extract_text, no necessàriament el binari pdftotext.
És el mateix que «PDF a Markdown»?
No. Markdown busca estructura; aquí obteniu text pla o RTF.
Cal treure la contrasenya abans?
No al web: la pàgina us demana la clau i desbloqueja el fitxer per vosaltres. Els clients d'API executen primer «Treu la contrasenya».

Darrera actualització:

Crida-ho des del codi

Cada eina del lloc és una interfície REST normal. Per a ús anònim no cal compte ni clau API. Pensat per a agents d'IA i desenvolupadors, igual que per al navegador.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/text" \
  -F "[email protected]" \
  -F "outputFormat=txt" \
  -o output.pdf

També hi ha una eina MCP per a clients d'agents que parlen Model Context Protocol (JSON-RPC 2.0 amb POST /mcp). Referència completa de l'API

Fes-lo servir des d'un agent d'IA

Skill

Amb aquest skill, Claude Code, Codex, Cursor i altres agents d'IA poden executar «PDF a text» per tu: /skills/pdf123-pdf-to-text.md

Tots els skills per a agents

Els arxius només serveixen per a aquest processament i s'esborren sols després.