Converteix un PDF en text
PDF a text extreu el text que ja existeix en un PDF i el torna com a fitxer .txt pla o com a RTF. No executa OCR, així que els escaneigs només d'imatge surten buits.
Arrossega arxius aquí, o fes clic per triar-los
Admet PDF · fins a 500.0 MB per arxiu · fins a 20 arxius alhora
També pots enganxar un fitxer amb Ctrl/Cmd+V o des del menú del porta-retalls.
PDF a text extreu les paraules que ja existeixen com a objectes de text. La ruta per defecte `txt` usa el mateix extractor local que altres operacions de pdf-core (`pdfio::extract_text`) i torna `text/plain`. No executa OCR ni crida LibreOffice en aquest mode.
Si demaneu `rtf`, la conversió pot passar per LibreOffice (`writer_pdf_import`, `soffice`) i tornar un `.rtf`. El mode `txt` és l'extracció directa.
Un escaneig només imatge no té text seleccionable: la sortida serà buida o gairebé. Per a escaneigs useu «OCR a Markdown».
Això no és «PDF a Markdown» ni «PDF a CSV». Cada eina té un objectiu diferent (prosa estructurada, taules, text pla).
Els fitxers protegits amb contrasenya es desbloquegen per vosaltres en aquesta pàgina un cop n'escriviu la clau; els clients d'API executen primer «Treu la contrasenya».
Les pujades són temporals. No desem el vostre corpus de text.
Funcions
- Extracció de text pla via pdfio::extract_text (mode txt)
- Opció rtf via LibreOffice quan es demana
- No és OCR
- API anònima: /api/v1/convert/pdf/text
Quan fer-la servir
- Treure el cos d'un contracte electrònic a .txt
- Alimentar un pipeline que espera text pla
- Obtenir un RTF editable quan el flux ho exigeix
Com extrec el text d'un PDF?
- Pugeu un PDF amb capa de text.
- Trieu txt (per defecte) o rtf si el flux ho demana.
- Feu clic a Processar i baixeu el resultat.
- Obriu el fitxer i confirmeu que el text esperat hi és.
Límits i casos límit
- Sense OCR
- La maquetació es perd al text pla
- Els fitxers protegits amb contrasenya en necessiten la clau; els clients d'API executen primer «Treu la contrasenya»
- Límit de pujada en aquest web: 500 MB per fitxer, enviat per parts a partir d'uns 95 MB. El cos d'una sola petició directa a l'API està limitat a 100 MB.
Exemples
- Un memoràndum electrònic de 3 pàgines dóna un .txt amb els paràgrafs
- Un escaneig de rebut dóna poc o cap text al mode txt
Privadesa d'aquesta eina
Els fitxers pugen per HTTPS, es processen a la memòria del servidor o en un directori temporal de curta vida, i s'esborren quan el resultat és a punt. No en guardem còpies per consultar-les després, per entrenar models ni per a perfils publicitaris. Els terminis de retenció i les galetes d'AdSense consten a la Política de privacitat.
Preguntes freqüents
- Per què la sortida és buida?
- El PDF probablement és només imatge. Useu «OCR a Markdown» per a escaneigs.
- Usa pdftotext?
- El mode txt usa l'extractor local pdfio::extract_text, no necessàriament el binari pdftotext.
- És el mateix que «PDF a Markdown»?
- No. Markdown busca estructura; aquí obteniu text pla o RTF.
- Cal treure la contrasenya abans?
- No al web: la pàgina us demana la clau i desbloqueja el fitxer per vosaltres. Els clients d'API executen primer «Treu la contrasenya».
Darrera actualització:
Crida-ho des del codi
Cada eina del lloc és una interfície REST normal. Per a ús anònim no cal compte ni clau API. Pensat per a agents d'IA i desenvolupadors, igual que per al navegador.
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/text" \
-F "[email protected]" \
-F "outputFormat=txt" \
-o output.pdfTambé hi ha una eina MCP per a clients d'agents que parlen Model Context Protocol (JSON-RPC 2.0 amb POST /mcp). Referència completa de l'API
Fes-lo servir des d'un agent d'IA
SkillAmb aquest skill, Claude Code, Codex, Cursor i altres agents d'IA poden executar «PDF a text» per tu: /skills/pdf123-pdf-to-text.md
Els arxius només serveixen per a aquest processament i s'esborren sols després.