PDF123とは何か:無料で使えて、セルフホストもできる PDF ツールキット
PDF123 はブラウザで使える無料の PDF ツールキットで、結合や圧縮から OCR、暗号化まで 56 のツールをすべてアカウントなしで実行できる。同じ操作は REST、MCP、pdfx CLI からも呼び出せ、スタックをセルフホストすればファイルを自分のネットワーク内に置いたままにできる。

PDF の作業はたいてい小さい。いくつかのファイルを1つに結合する、スキャンをメールに収まるまで圧縮する、スキャンから文字を取り出す、契約書にパスワードをかける。小さいながら年に何度も繰り返し発生し、そのたびにツールを選び直すことになる。見つかるサイトはたいてい2つの点でつまずく。処理回数に上限がある、アカウントを求められる、あるいはファイルがどこへ渡るのか説明できない場所に送られる。
PDF123 は、こうした繰り返し発生する小さな作業のために作られている。無料のサイトで、アカウントは不要、処理が終わればダウンロードできる。同じツールキットにはもう2つの入口があり、一括処理が必要な人や、ファイルを自分のネットワークの外に出せない人に向いている。
5つのグループ、56の操作
サイト上の 56 のツールは用途別に5つのグループに分かれ、その名前はホームページのナビゲーションと同じだ。ページ整理、形式変換、コンテンツ編集、セキュリティと暗号化、高度なツール。どのグループも具体的な操作なので、PDF の内部構造を知っていることは前提にならない。
| グループ | 含まれる操作 | 数 |
|---|---|---|
| ページ整理 | 結合、分割、回転、並べ替え、切り抜き、空白ページの削除、ページ番号の追加 | 15 |
| 形式変換 | PDF と Word、Excel、Markdown、画像、HTML の相互変換、電子書籍と Office 文書の取り込み | 16 |
| コンテンツ編集 | 圧縮、修復、フォームの平坦化、メタデータの編集、画像の抽出、ストリームの展開 | 14 |
| セキュリティと暗号化 | パスワードの追加、パスワードの削除、透かしとスタンプ、テキストの墨消し、能動的な内容の除去、署名の検証 | 8 |
| 高度なツール | OCR(Markdown)、文書情報の読み取り、埋め込み JavaScript の一覧表示 | 3 |
上表:用途別の5つのツールグループ、合計 56。グループ分けと数はサイト自身のツールカタログによるもので、ホームページと一致する。
よく使うものにはホームページに直接の入口がある。整理ではPDFの結合とPDFの分割が最もよくクリックされ、コンテンツ編集ではPDFの圧縮とPDFの修復、暗号化にはパスワード設定、スキャンにはOCR(Markdown)がある。
3つの呼び出し方、1つの処理経路
ブラウザは最短の経路だ。アップロードし、パラメータを設定し、処理し、ダウンロードする。アカウントは要らない。1つか2つのファイルを処理するなら、余分な手順はすべて純粋なコストになる。
一括処理は API か CLI を通す。同じ操作は REST エンドポイント、MCP エンドポイント、pdfx コマンドラインとして提供されるので、ブラウザで調整したパラメータをそのままコードに移せ、操作ごとにドキュメントを読み直すことなく数百のファイルを一度に処理できる。匿名の呼び出しにアカウントも API Key も要らない。説明と例は開発者ページにあり、4種類のクライアントの比較は同じ操作、四つのクライアントで読める。
セルフホストはバックエンドとポータルを自分のサーバーに配備するので、ファイルが自分のネットワークから出ることはない。ホスト版のサイトと自分のインスタンスは同じ実装で動いており、変わるのは誰が運用するかだ。アップグレード、バックアップ、容量は自分で管理することになり、そのコストはセルフホストが実際にもたらすもの(と、そのコスト)に書かれている。配備方法はセルフホストで扱っている。
判断は一行に圧縮できる。1つのファイルならブラウザ、毎週同じ種類のファイルを処理するならスクリプト、社内ネットワークから出せないファイルならセルフホストしたインスタンスを使う。
なぜ無料で成り立つのか
すべてのツールはサインインなしで使え、有料と表示された操作はなく、料金ページも存在しない。本当の制限は利用枠の壁ではなく匿名レート制限だ。速すぎるリクエストはしばらく抑えられ、クールダウンが明ければまた通る。「本日の処理回数を使い切りました」と扉を閉ざされることはない。
この制限がかかるのはリクエストの頻度であり、ファイル数やページ数ではない。解除のために先に登録する必要もない。代償は、混雑時には少し待って再試行が必要になることだ。
意図的にやらないこと
OCR(Markdown)が返すのは Markdown のテキストであり、隠しテキスト層を持つ検索可能な PDF ではない。レイアウトの再現もしない。ツール名がそう言っている通りで、全文検索できる PDF が返ってくると期待すると裏切られる。
透かしとスタンプが対応するのは Helvetica と WinAnsi エンコーディングだけで、非ラテン文字は正しく描画されない。最もよく誤解される境界を以下にまとめる。ツールページと API ドキュメントでも同じ表現を使っている。
| よくある誤解 | 実際の動作 |
|---|---|
| OCR は検索可能な PDF を返す | Markdown テキストを返し、レイアウトを再現せず、隠しテキスト層も追加しない |
| 透かしとスタンプは任意の文字に対応する | Helvetica と WinAnsi エンコーディングのみで、非ラテン文字は正しく描画されない |
| 証明書署名を削除すると署名が消える | 現在このエンドポイントはアップロードされたファイルをそのまま返し、署名も残る |
| 無料枠と有料プランがある | 料金ページはなく、制限は匿名レート制限によるもので、処理ごとの課金ではない |
上表:よくある4つの誤解と実際の動作の対照。最初の2つは対応するツールページにも同じ注記がある。
また、フォレンジックツール群、印刷用 RIP、認証済みのアーカイブワークフローの代わりにはならない。出力はベストエフォートの変換と編集なので、元のファイルは自分で保管しておくこと。暗号化、クリーンアップ、署名の削除は、すでに変更する権利を持つ文書のためのセキュリティ向けツールであり、他人のアクセス制御を回避する手段ではない。
どこから始めるか
pdf123.xyz を開き、やりたいことに合わせてツールを選ぶ。誰が運営しているか、アップロードされたファイルがどう扱われるか、連絡方法は概要ページにある。
自分のパイプラインに組み込むなら、次に読むべき記事が3つある。同じ操作、四つのクライアントはブラウザのフォーム、curl、MCP、pdfx を並べて比較し、pdfx CLI:一つのカタログをターミナルから呼ぶはコマンドラインの使い方を扱い、セルフホストが実際にもたらすもの(と、そのコスト)はスタック全体を自分のネットワークに移すコストを扱っている。