Перейти к основному содержимому
PPDF123

Преобразование PDF в текст

«PDF в RTF (текст)» извлекает текст, который уже есть в PDF, и возвращает его простым файлом .txt или в формате RTF. OCR не выполняется, поэтому сканы из одних изображений получаются пустыми.

Перетащите файлы сюда или нажмите, чтобы выбрать

Форматы: PDF · до 500.0 MB на файл · до 20 файлов за раз

Файл можно также вставить через Ctrl/Cmd+V или из меню буфера обмена.

PDF в RTF (текст) извлекает слова, которые уже есть как текстовые объекты. Путь `txt` по умолчанию использует тот же локальный экстрактор, что и другие операции pdf-core (`pdfio::extract_text`), и возвращает `text/plain`. OCR не запускается, LibreOffice не вызывается.

При выборе `rtf` файл идёт через LibreOffice `writer_pdf_import`. Этому пути нужен `soffice` на сервере; получается грубый черновик форматированного текста. Подмена шрифтов и съехавшие таблицы — обычное дело. Считайте RTF черновиком.

Чисто графические сканы дают пустой или почти пустой `.txt`. OCR на этом сайте возвращает Markdown, а не PDF с поиском, который можно снова отправить сюда.

Поля диапазона страниц нет. Читается каждая страница. Файлы, защищённые паролем, снимаются с защиты прямо на этой странице, как только вы введёте пароль; при работе через API сначала запустите «Снять пароль».

Если нужны заголовки и списки, а не сплошной текст, ближе PDF в Markdown. Если таблицы строками — PDF в CSV или PDF в Excel.

Загрузки временные. Библиотеку ваших текстовых файлов мы не храним.

Функции

  • TXT по умолчанию через локальное извлечение текста, не pdftotext и не OCR
  • Необязательный RTF через LibreOffice `writer_pdf_import`
  • Читает все страницы; параметра диапазона нет
  • Анонимный API: /api/v1/convert/pdf/text

Когда применять

  • Сбросить отчёт с текстовым слоем в grep или скрипт
  • Получить грубый RTF-черновик из цифровой служебной записки
  • Проверить, есть ли у PDF текстовый слой

Как извлечь текст из PDF?

  1. Загрузите PDF, в котором уже есть выделяемый текст.
  2. Оставьте TXT или выберите RTF, если нужен черновик LibreOffice.
  3. Нажмите «Обработать» и скачайте `.txt` или `.rtf`.
  4. Проверьте несколько абзацев. Сканы без текстового слоя будут выглядеть пустыми.

Ограничения и особые случаи

  • Не OCR; со сканов почти ничего не извлекается
  • Нет контроля диапазона страниц
  • Визуальный порядок колонок для TXT не восстанавливается
  • Лимит загрузки на сайте: 500 МБ на файл, файлы крупнее примерно 95 МБ отправляются частями. Тело одного прямого запроса к API ограничено 100 МБ.

Примеры

  • Выделяемый годовой отчёт обычно даёт длинный .txt
  • Сфотографированная доска обычно даёт пустой или крошечный файл

Конфиденциальность этого инструмента

Файлы загружаются по HTTPS, обрабатываются в памяти или в короткоживущем временном каталоге на наших серверах и удаляются, когда результат готов. Копии для последующего просмотра, обучения моделей или рекламных профилей мы не храним. Сроки хранения и сведения о cookie AdSense указаны в Политике конфиденциальности.

Частые вопросы

Почему текстовый файл пустой?
В PDF нет текстовых объектов для экстрактора. Сканам нужен OCR в Markdown; этот Markdown сюда обратно не отправить.
TXT — это то же, что копировать из просмотрщика?
Близко, но не то же. Порядок следует тому, как текст лежит в потоке содержимого страницы; в многоколоночной вёрстке он может отличаться от визуального чтения.
Когда выбирать RTF?
Только если хотите, чтобы LibreOffice собрал документ заново. TXT — прямое извлечение и не нуждается в soffice.
Сохраняются ли шрифты и вёрстка?
TXT — простой текст. RTF — реконструкция по возможности, не совпадение пиксель в пиксель.

Последнее обновление:

Вызов из кода

Каждый инструмент на сайте: обычный REST. Анонимно не нужны ни аккаунт, ни ключ API. И для браузера, и для разработчиков, и для ИИ-агентов.

curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/text" \
  -F "[email protected]" \
  -F "outputFormat=txt" \
  -o output.pdf

Есть и как MCP-инструмент для клиентов на Model Context Protocol (JSON-RPC 2.0, POST /mcp). Полное описание API

Использовать через ИИ-агента

Скилл

С этим скиллом Claude Code, Codex, Cursor и другие ИИ-агенты смогут выполнить «PDF в RTF (текст)» за вас: /skills/pdf123-pdf-to-text.md

Все скиллы для агентов

Файлы нужны только для этой обработки и потом удаляются.