Πακέτο σάρωσης σε κείμενο: OCR και μετά συμπίεση του PDF που κρατάτε
Ένα πακέτο σάρωσης θέλει δύο βήματα: το OCR στο PDF123 επιστρέφει Markdown, ενώ η Συμπίεση μικραίνει το αρχικό PDF με επανασυμπίεση ροών. Δύο ξεχωριστές έξοδοι.

Ένα «πακέτο σάρωσης» είναι συνήθως μια στοίβα εικόνων σελίδας συρραμμένη σε ένα PDF: βαρύ στον δίσκο, κενό για αναζήτηση και αντιγραφή. Δύο εργαλεία που οι άνθρωποι αλυσοδένουν δεν παράγουν ένα μαγικό αναζητήσιμο PDF σε αυτόν τον ιστότοπο. Το OCR επιστρέφει Markdown. Η Συμπίεση ξαναγράφει το PDF που κρατάτε ακόμη.
Αυτός ο διαχωρισμός είναι όλη η ροή εργασίας.
Τι σας δίνει στην πραγματικότητα το OCR εδώ
Το POST /api/v1/misc/ocr-pdf εκτελεί αναγνώριση και κατεβάζει αρχείο .md (text/markdown): κείμενο από το ίδιο το PDF, συνενωμένο με το αποτέλεσμα του OCR για τις σελίδες που είναι εικόνες. Δεν γράφει κρυφό στρώμα κειμένου πίσω στο PDF. Αν περιμένατε επιλογή και αναζήτηση μέσα στο ίδιο αρχείο, αυτό είναι διαφορετικό σχήμα προϊόντος (κλασική έξοδος τύπου OCRmyPDF). Αυτό το σημείο API προορίζεται για κείμενο που μπορεί να διαβάσει ένας πράκτορας ή ένας αγωγός επεξεργασίας.
Auto ή Force OCR:
- Οτιδήποτε εκτός από
ocrType=force-ocr(μαζί με την ετικέτα «Normal» της πύλης) αντιστοιχεί σε Auto: χρησιμοποιεί το υπάρχον κείμενο όπου υπάρχει και εκτελεί OCR στις σελίδες που είναι μόνο εικόνα. - Το
force-ocrξαναδιαβάζει κάθε σελίδα, ακόμη και σελίδες που έχουν ήδη στρώμα κειμένου.
Δεν υπάρχει επιλογέας γλώσσας στη φόρμα της πύλης. Τα υπολειμματικά πεδία τύπου tessdata από παλαιότερες διαδρομές (languages, deskew, σημαίες καθαρισμού και παρόμοια) αγνοούνται από τη διαδρομή Rust ocr_pdf. Το Auto έναντι Force και οι λόγοι που η αναγνώριση αποτυγχάνει σε κακές σαρώσεις καλύπτονται στο Πώς το OCR διαβάζει ένα σαρωμένο PDF.
Το OCR δεν μικραίνει το PDF. Η λήψη Markdown είναι δεύτερο παραδοτέο δίπλα στο αρχικό πακέτο σάρωσης.
Πού χωρά η Συμπίεση
Η Συμπίεση (POST /api/v1/misc/compress-pdf) εκτελεί συμπίεση ροών με qpdf: --compress-streams=y, επανασυμπίεση flate και παραγόμενες ροές αντικειμένων. Δεν επινοεί στρώμα κειμένου, δεν υποσυνολοποιεί γραμματοσειρές και δεν υπόσχεται φωτογραφική υποδειγματοληψία. Σε αρχείο με πολλές σαρώσεις μπορεί να μικρύνει ακόμη τον χώρο, πακετάροντας τις ροές πιο σφιχτά· σε ήδη σφιχτό αρχείο το κέρδος μπορεί να είναι μικρό. Υπόβαθρο για τους μοχλούς ροών έναντι εικόνων: Τι συμβαίνει πραγματικά όταν συμπιέζετε ένα PDF.
Χρησιμοποιήστε τη Συμπίεση στο PDF που θα αρχειοθετήσετε ή θα στείλετε με email. Χρησιμοποιήστε την έξοδο OCR σε Markdown όταν χρειάζεστε τις λέξεις. Η συμπίεση πρώτα δεν κάνει το OCR πιο ακριβές· το OCR πρώτα δεν κάνει το PDF μικρότερο.
Μια πρακτική σειρά
- Αν το πρόγραμμα προβολής δεν ανοίγει το πακέτο, πρώτα Επισκευή ή Get Info.
- Περάστε το πακέτο σάρωσης από OCR σε Markdown και ελέγξτε δειγματοληπτικά μερικές σελίδες κειμένου.
- Χωριστά, συμπιέστε ένα αντίγραφο του PDF αν το μέγεθος είναι το υπόλοιπο πρόβλημα.
- Κρατήστε το ανέγγιχτο πρωτότυπο όταν το απαιτεί η πολιτική σας.
Ένα κρυπτογραφημένο αρχείο χρειάζεται ακόμη εξουσιοδοτημένο Ξεκλείδωμα πριν από οποιοδήποτε βήμα. Τα μυστικά χρειάζονται Καθαρισμό / Auto Redact, όχι OCR. Εξαγωγή πίνακα που επιστρέφει 204 μετά από σάρωση σημαίνει ότι δεν βρέθηκαν στήλες κειμένου· πρώτα OCR σε Markdown και μετά αποφασίστε αν έχει καν νόημα ένα εργαλείο υπολογιστικών φύλλων (Κενή εξαγωγή πίνακα (204)).
Παραδοτέα που πρέπει να παρακολουθείτε
Μετά από μια τυπική εκτέλεση μπορεί να κρατάτε τρία παραδοτέα: το αρχικό πακέτο σάρωσης, μια λήψη OCR σε .md και (προαιρετικά) ένα συμπιεσμένο αντίγραφο PDF. Επισημάνετέ τα. Η αποστολή μόνο του Markdown χάνει τις εικόνες των σελίδων· η αποστολή μόνο του συμπιεσμένου PDF δεν έχει ακόμη στρώμα επιλογής και αναζήτησης από αυτή τη διαδρομή OCR. Οι αγωγοί που χρειάζονται και τις λέξεις και μικρότερο PDF πρέπει να αποθηκεύουν και τις δύο εξόδους ή να ξανατρέξουν τη μία πλευρά αργότερα.
Το Force OCR σε ένα ψηφιακά γεννημένο πακέτο με σπασμένο στρώμα κειμένου μπορεί να είναι χρήσιμο· το Auto σε ένα καθαρό ψηφιακά γεννημένο πακέτο μπορεί να παραλείψει εντελώς το περιβάλλον εκτέλεσης του OCR. Καμία λειτουργία δεν γράφει κείμενο πίσω στο PDF.
Τι δεν είναι αυτή η ροή εργασίας
Τα πακέτα σάρωσης αποτυγχάνουν όταν οι ομάδες υποθέτουν ότι ένα κουμπί και εξάγει κείμενο και μικραίνει τα εικονοστοιχεία, όπως θα έκανε ένας αγωγός OCRmyPDF σε υπολογιστή. Εδώ το κείμενο φεύγει ως Markdown· το PDF μένει PDF αν δεν το συμπιέσετε επίτηδες. Δεν υπάρχει βήμα σε αυτόν τον ιστότοπο που να επιστρέφει «το ίδιο PDF, τώρα αναζητήσιμο και μικρότερο» από μία κλήση.
Για αυτοματοποίηση των ίδιων λειτουργιών μέσω HTTP, δείτε τους Προγραμματιστές.