Ghép PDF mà không làm phẳng mọi thứ thành ảnh
Merge PDF đúng cách là nối các luồng trang: font, vector và bookmark vẫn nguyên vẹn. Raster hóa mọi trang thành ảnh là một việc khác và mất mát hơn nhiều.

“Ghép năm PDF này lại” có thể ám chỉ hai quy trình khác nhau. Một cách nối các đối tượng trang sẵn có thành một tệp duy nhất. Cách kia in từng trang ra bitmap rồi đóng gói các ảnh đó vào một PDF mới. Cả hai đều ra một tệp đính kèm. Chỉ cách đầu giữ được chữ chọn được và vector sắc nét.
Merge cấu trúc làm gì
Trên PDF123, Merge kết hợp hai hay nhiều PDF bằng cách nối các đối tượng trang của từng tệp. Đường server chạy qpdf với base rỗng và --pages trên các đầu vào: luồng trang di chuyển như trang, không phải ảnh chụp. Font nhúng, vector và bookmark sẵn có đi kèm những trang đó. Không bước nào trên đường này raster hóa trang thành ảnh, nên một hợp đồng born-digital vẫn tìm kiếm và sao chép được sau khi nối.
Thứ tự tải lên mặc định là thứ tự đầu ra. Form HTTP nhận nhiều phần fileInput lặp lại trong một yêu cầu; kích thước batch bị chặn bởi hạn mức tải lên, không phải trần cứng hai tệp. sortType=byFileName tùy chọn sắp lại đầu vào theo tên tệp trước khi nối. Bookmark từ mỗi nguồn có thể sống sót; merge không tạo ra một cây outline hoàn hảo nếu đầu vào chưa từng có.
Tải lên một tệp duy nhất là một lượt pass-through. Hai tệp trở lên thành một merged.pdf với các trang là phần nối của đầu vào theo thứ tự đã chọn. Cùng op id đó là thứ OpenAPI, MCP và pdfx merge mở ra, nên script và cú click trên trình duyệt không âm thầm bất đồng về “merge”.
Khi người ta vô tình raster hóa
Một số quy trình “kết hợp” xuất ra ảnh trước (cổng fax, ứng dụng scan, in-ra-PDF ở độ phân giải màn hình) hoặc làm phẳng annotation thành bitmap trước khi nối. Kích thước tệp tăng vọt, có thể phải OCR lại, và khi phóng to sẽ thấy cạnh pixel.
Hãy ưu tiên merge theo luồng khi nguồn đã là PDF số. Chỉ ưu tiên OCR khi đầu vào là bản scan không có chữ dùng được, và nhớ rằng OCR ở đây trả Markdown (text/markdown), không phải PDF được gắn lại lớp chữ ẩn. Raster hóa rồi OCR là một đường sản phẩm khác với ghép các tệp born-digital.
Nếu cần ảnh của các trang, đó là việc chuyển đổi (PDF sang ảnh), không phải merge. Trộn lẫn hai ý định đó là cách các tệp “đã ghép” biến thành album ảnh nặng vài megabyte. Nén sau một merge cấu trúc vẫn thu nhỏ được luồng (Compress); nó không hoàn tác một lần làm phẳng raster bạn đã nướng sẵn vào tệp.
Merge không hứa điều gì
Merge không chuẩn hóa kích thước trang, không thống nhất font giữa các tệp, cũng không dựng lại mục lục từ đầu. Nó không giải mã giúp bạn các đầu vào bị mã hóa; hãy unlock trước nếu nguồn có mật khẩu. Nó không thay thế định dạng container portfolio/package mà một số cổng tòa án kỳ vọng; nó tạo ra một PDF nhiều trang thông thường.
Những giới hạn đó giống nhau dù bạn dùng trình duyệt, REST, MCP hay pdfx. Thao tác được cố ý thu hẹp để đầu ra dự đoán được cho tự động hóa. Nếu cần công việc nhiều bước có thứ tự (merge, rồi watermark, rồi compress), hãy dùng POST /api/v1/pipeline với danh sách steps có thứ tự, thay vì tự đặt ra một cờ “smart merge” thứ hai.
Cách chạy
Merge PDFs trên trình duyệt, hoặc POST /api/v1/general/merge-pdfs với nhiều phần fileInput (Nhà phát triển). Từ shell:
pdfx merge a.pdf b.pdf -o merged.pdf
Hoặc hướng tới một base hosted hay self-host:
pdfx --cloud --api-base "$API_BASE" --api-key "$KEY" merge a.pdf b.pdf -o merged.pdf
Gọi ẩn danh vào danh mục không cần key trên site công khai; key quan trọng cho danh tính tự động hóa ổn định và server self-host có kiểm soát. Muốn cùng thao tác đó qua curl và MCP, xem Cùng thao tác, bốn client.