Product2026-08-233 Min. Lesezeit

Für KI-Agenten gebaut, nicht nur für Browser: So funktioniert die API

Alle Werkzeuge sind REST-Endpunkte unter /api/v1/, dazu MCP unter /mcp. Anonyme Aufrufe brauchen kein Konto und keinen API-Schlüssel. Fehler liefern RFC 7807.

PDF123 · Updated 2026-09-20

Ein Browser-Tab funktioniert weiterhin: Werkzeug auswählen, Datei hochladen, Ergebnis herunterladen. Agenten und Skripte rufen dieselben Operationen auf, ohne eine Oberfläche zu öffnen. Beide Wege landen im selben Katalog.

Diagramm: Ein Klick im Browser und der Aufruf eines Agenten oder Skripts erreichen dieselben API-Endpunkte und liefern dasselbe Ergebnis

Jede Werkzeugseite ist zugleich ein Endpunkt

Zusammenführen, Teilen, Komprimieren, OCR, Konvertieren: Jedes Werkzeug im Katalog entspricht einem Pfad unter /api/v1/…. Öffne eine Werkzeugseite und scrolle zu Call this from code; dort steht ein curl-Beispiel, das aus den echten Parametern dieses Werkzeugs erzeugt wird und keine allgemeine Vorlage ist. Anonyme Aufrufe brauchen auf der öffentlichen Website weder Konto noch API-Schlüssel; die anonymen Präfixe sind /api/v1/general/, /api/v1/misc/, /api/v1/security/, /api/v1/convert/ und /api/v1/filter/.

Das Beispiel für das Zusammenführen ist konkret:

curl -fsS -X POST "$API_BASE/api/v1/general/merge-pdfs" \
  -F "[email protected]" \
  -F "[email protected]" \
  -o merged.pdf

OpenAPI liegt unter /v1/openapi.json. Mehrstufige Abläufe nutzen POST /api/v1/pipeline mit einer geordneten Liste steps. Setze Idempotency-Key, wenn ein Wiederholungsversuch eine verändernde Aufgabe nicht zweimal ausführen darf. Antworten der gehosteten Variante enthalten X-RateLimit-Limit, X-RateLimit-Remaining und X-RateLimit-Reset; bei HTTP 429 lies Retry-After (anonyme Ratenbegrenzung).

OCR über denselben Katalog liefert Markdown (text/markdown) von /api/v1/misc/ocr-pdf, kein PDF mit versteckter Textebene. Agenten, die von diesem Endpunkt ein durchsuchbares PDF erwarten, verarbeiten den Download falsch; der Vertrag ist Textextraktion für Pipelines, kein Umschreiben im Stil von OCRmyPDF.

MCP für Clients, die es sprechen

MCP (Model Context Protocol) lässt Agenten-Clients Werkzeuge als Funktionen entdecken und aufrufen, statt Dokumentation zu scrapen. Diese Website stellt neben der REST-API einen MCP-Server unter /mcp bereit. Ein kompatibler Client verbindet sich einmal und erhält den vollständigen Katalog.

MCP und REST teilen dieselben Erwartungen an die Authentifizierung: anonym, wo die Präfixe der Werkzeuge es zulassen, API-Schlüssel für stabile Automatisierung und für abgeschottete selbst gehostete Server. Einen Agenten auf /mcp zu richten ist kein anderes Produkt, als curl auf /api/v1/… zu richten. Dokumentation: Entwickler: MCP.

Fehler sind strukturiert, nicht Prosa

Fehler liefern application/problem+json (im Stil von RFC 7807), keine nackte 500-Antwort und kein „etwas ist schiefgelaufen“. Jede Antwort trägt einen stabilen Code (rate_limited, bad_request, invalid_document, missing_dependency und Verwandte), einen lesbaren Hinweis und oft einen nächsten Schritt. Menschen können ihn überfliegen; Agenten entscheiden, ob sie wiederholen, die Datei austauschen oder aufhören, ohne dass jemand einen Stacktrace lesen muss.

Diese Struktur zählt mehr als eine freundliche HTML-Fehlerseite, wenn der Aufrufer ein Skript ist. Referenz: Entwickler: Fehler.

llms.txt ist für Werkzeuge da, nicht für Rankings

/llms.txt ist ein Klartextindex aller Werkzeuge (Name, Kurzbeschreibung, URL), erzeugt aus demselben Katalog, der die Website speist. Coding-Agenten und Dokumentationswerkzeuge können ihn wie eine README lesen. Er ist kein Hebel für Google-Rankings: Die Suche ignoriert /llms.txt (Quellen: Googles Leitfaden zur Optimierung für KI). Weil die Datei erzeugt wird, kann sie nicht stillschweigend veralten wie eine von Hand gepflegte Datei.

CLI und Skill nutzen dieselben Formen

pdfx kann pdf-core lokal ausführen oder mit --cloud gegen eine Basis-URL arbeiten. Der Skill für Coding-Agenten unter dist/skills/pdf-toolbox/SKILL.md dokumentiert die curl-Formen für Zusammenführen und Pipelines, damit Agenten keinen zweiten Vertrag erfinden. Vier Clients, ein Katalog: Dieselbe Operation, vier Clients.

Der Weg über den Browser bleibt unverändert

Eine Datei in einem Tab abzulegen funktioniert weiterhin gleich. Die zusätzliche Oberfläche sind dieselben Endpunkte für einen Agenten, ein Skript oder CI: dieselbe Verarbeitung, ohne Menschen dazwischen. Selbst hosten hält diese Oberfläche in deinem Netz (Selbst hosten); die gehostete Variante bleibt der anonyme Testweg.

API-Referenz: Swagger. Grundlagen für beide Wege: Hilfe und Entwickler.

Open tool
Process in the browser — no watermark, files removed after the job.
Open tool