Преобразование PDF в текст
«PDF в RTF (текст)» извлекает текст, который уже есть в PDF, и возвращает его простым файлом .txt или в формате RTF. OCR не выполняется, поэтому сканы из одних изображений получаются пустыми.
Перетащите файлы сюда или нажмите, чтобы выбрать
Форматы: PDF · до 500.0 MB на файл · до 20 файлов за раз
Файл можно также вставить через Ctrl/Cmd+V или из меню буфера обмена.
PDF в RTF (текст) извлекает слова, которые уже есть как текстовые объекты. Путь `txt` по умолчанию использует тот же локальный экстрактор, что и другие операции pdf-core (`pdfio::extract_text`), и возвращает `text/plain`. OCR не запускается, LibreOffice не вызывается.
При выборе `rtf` файл идёт через LibreOffice `writer_pdf_import`. Этому пути нужен `soffice` на сервере; получается грубый черновик форматированного текста. Подмена шрифтов и съехавшие таблицы — обычное дело. Считайте RTF черновиком.
Чисто графические сканы дают пустой или почти пустой `.txt`. OCR на этом сайте возвращает Markdown, а не PDF с поиском, который можно снова отправить сюда.
Поля диапазона страниц нет. Читается каждая страница. Файлы, защищённые паролем, снимаются с защиты прямо на этой странице, как только вы введёте пароль; при работе через API сначала запустите «Снять пароль».
Если нужны заголовки и списки, а не сплошной текст, ближе PDF в Markdown. Если таблицы строками — PDF в CSV или PDF в Excel.
Загрузки временные. Библиотеку ваших текстовых файлов мы не храним.
Функции
- TXT по умолчанию через локальное извлечение текста, не pdftotext и не OCR
- Необязательный RTF через LibreOffice `writer_pdf_import`
- Читает все страницы; параметра диапазона нет
- Анонимный API: /api/v1/convert/pdf/text
Когда применять
- Сбросить отчёт с текстовым слоем в grep или скрипт
- Получить грубый RTF-черновик из цифровой служебной записки
- Проверить, есть ли у PDF текстовый слой
Как извлечь текст из PDF?
- Загрузите PDF, в котором уже есть выделяемый текст.
- Оставьте TXT или выберите RTF, если нужен черновик LibreOffice.
- Нажмите «Обработать» и скачайте `.txt` или `.rtf`.
- Проверьте несколько абзацев. Сканы без текстового слоя будут выглядеть пустыми.
Ограничения и особые случаи
- Не OCR; со сканов почти ничего не извлекается
- Нет контроля диапазона страниц
- Визуальный порядок колонок для TXT не восстанавливается
- Лимит загрузки на сайте: 500 МБ на файл, файлы крупнее примерно 95 МБ отправляются частями. Тело одного прямого запроса к API ограничено 100 МБ.
Примеры
- Выделяемый годовой отчёт обычно даёт длинный .txt
- Сфотографированная доска обычно даёт пустой или крошечный файл
Конфиденциальность этого инструмента
Файлы загружаются по HTTPS, обрабатываются в памяти или в короткоживущем временном каталоге на наших серверах и удаляются, когда результат готов. Копии для последующего просмотра, обучения моделей или рекламных профилей мы не храним. Сроки хранения и сведения о cookie AdSense указаны в Политике конфиденциальности.
Частые вопросы
- Почему текстовый файл пустой?
- В PDF нет текстовых объектов для экстрактора. Сканам нужен OCR в Markdown; этот Markdown сюда обратно не отправить.
- TXT — это то же, что копировать из просмотрщика?
- Близко, но не то же. Порядок следует тому, как текст лежит в потоке содержимого страницы; в многоколоночной вёрстке он может отличаться от визуального чтения.
- Когда выбирать RTF?
- Только если хотите, чтобы LibreOffice собрал документ заново. TXT — прямое извлечение и не нуждается в soffice.
- Сохраняются ли шрифты и вёрстка?
- TXT — простой текст. RTF — реконструкция по возможности, не совпадение пиксель в пиксель.
Последнее обновление:
Вызов из кода
Каждый инструмент на сайте: обычный REST. Анонимно не нужны ни аккаунт, ни ключ API. И для браузера, и для разработчиков, и для ИИ-агентов.
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/text" \
-F "[email protected]" \
-F "outputFormat=txt" \
-o output.pdfЕсть и как MCP-инструмент для клиентов на Model Context Protocol (JSON-RPC 2.0, POST /mcp). Полное описание API
Использовать через ИИ-агента
СкиллС этим скиллом Claude Code, Codex, Cursor и другие ИИ-агенты смогут выполнить «PDF в RTF (текст)» за вас: /skills/pdf123-pdf-to-text.md
Файлы нужны только для этой обработки и потом удаляются.