Μετάβαση στο κύριο περιεχόμενο
PPDF123

OCR σαρωμένου PDF σε Markdown

Το OCR σε Markdown διαβάζει ένα σαρωμένο PDF ή PDF που αποτελείται από εικόνες και επιστρέφει το κείμενό του ως αρχείο Markdown. Δεν προσθέτει επίπεδο κειμένου στο PDF και το αρχικό αρχείο δεν αλλάζει.

Σύρετε και αφήστε αρχεία εδώ ή κάντε κλικ για επιλογή

Δέχεται PDF · έως 500.0 MB ανά αρχείο · έως 20 αρχεία τη φορά

Μπορείτε επίσης να επικολλήσετε ένα αρχείο με Ctrl/Cmd+V ή από το μενού του προχείρου.

OCR σε Markdown διαβάζει σαρωμένο ή αμιγώς εικονογραφημένο PDF και επιστρέφει Markdown (`text/markdown`, όνομα `.md`). Δεν γράφει κρυφό επίπεδο κειμένου πίσω στο PDF ούτε καθαρίζει, ισιώνει ή ξαναγράφει τη σάρωση.

Ο διακομιστής συνδυάζει εγγενές κείμενο που υπάρχει ήδη στο PDF με οπτική αναγνώριση από σελίδες-εικόνες. Force OCR (`ocrType=force-ocr`, προεπιλογή ιστότοπου) ξαναδιαβάζει κάθε σελίδα. Normal (ό,τι δεν είναι `force-ocr`) χρησιμοποιεί εγγενές κείμενο όπου υπάρχει και κάνει OCR μόνο σε αμιγώς εικονογραφημένες σελίδες. Σε καθαρό ηλεκτρονικό PDF το Auto δεν φορτώνει το runtime OCR.

Η ακρίβεια εξαρτάται από ποιότητα σάρωσης, αντίθεση και κλίση. Ο τρέχων κινητήρας δεν έχει παράμετρο γλώσσας. Παλιά πεδία Java OCRmyPDF (`languages`, `deskew`, `clean`, `sidecar`) αγνοούνται αν σταλούν ακόμη.

Δεν είναι προπαρασκευή για PDF σε Word ή PDF σε RTF (κείμενο). Εκείνα χρειάζονται κείμενο μέσα στο PDF. Εδώ το OCR είναι παράλληλη εξαγωγή: παίρνετε Markdown· το πρωτότυπο μένει άθικτο.

Μην κάνετε OCR σε αρχεία που δεν δικαιούστε να ψηφιοποιήσετε ή να αναδιανείμετε. Το εξαγόμενο κείμενο υπόκειται στους ίδιους κανόνες πνευματικών δικαιωμάτων και χώρου εργασίας.

Αν θέλετε αναζητήσιμο PDF, εδώ δεν το παίρνετε. Το προϊόν είναι αρχείο Markdown. Ανοίξτε το και ελέγξτε ονόματα και αριθμούς που πρέπει να είναι σωστοί.

Φωτογραφίες κινητού καλύτερα να περικοπούν και να ισιωθούν πριν το ανέβασμα. Τραπεζοειδείς σελίδες σπαταλούν αναγνώριση στο φόντο. Το OCR δεν είναι μετάφραση: αναγνωρίζει χαρακτήρες, δεν ξαναγράφει σε άλλη γλώσσα.

Η εργασία τρέχει στον διακομιστή. Κατεβάστε εγκαίρως. Δεν κρατάμε βιβλιοθήκη OCR. Τα αρχεία με κωδικό ξεκλειδώνονται για εσάς σε αυτή τη σελίδα μόλις εισαγάγετε τον κωδικό· οι χρήστες API εκτελούν πρώτα «Αφαίρεση κωδικού».

Λειτουργίες

  • Επιστρέφει Markdown, όχι PDF με επίπεδο OCR
  • Force OCR ξαναδιαβάζει κάθε σελίδα· Normal/Auto χρησιμοποιεί εγγενές κείμενο όπου υπάρχει
  • Το πρωτότυπο PDF μένει άθικτο
  • Ανώνυμο API: /api/v1/misc/ocr-pdf

Πότε το χρησιμοποιείτε

  • Εξαγωγή κειμένου όρων από αρχειακή σάρωση
  • Παράδοση σάρωσης σε πράκτορα ή ροή που θέλει Markdown
  • Ανάκτηση λέξεων από αμιγώς εικονογραφημένο PDF χωρίς επίπεδο κειμένου

Πώς κάνω OCR σε ένα σαρωμένο PDF;

  1. Ανεβάστε σαρωμένο PDF ή PDF από φωτογραφία κινητού.
  2. Επιλέξτε Force OCR (προεπιλογή) ή Normal/Auto.
  3. Πατήστε «Εκτέλεση» και κατεβάστε το `.md`.
  4. Ελέγξτε ονόματα και αριθμούς στο Markdown πριν τη χρήση.

Όρια και ειδικές περιπτώσεις

  • Η ακρίβεια μεταβάλλεται με την ποιότητα εικόνας
  • Πολλές σελίδες χρειάζονται περισσότερο χρόνο
  • Ο τρέχων κινητήρας δεν έχει παράμετρο γλώσσας
  • Δεν είναι τοπική βιβλιοθήκη OCR ούτε offline SDK
  • Όριο ανεβάσματος σε αυτόν τον ιστότοπο: 500 MB ανά αρχείο, με αποστολή σε τμήματα πάνω από περίπου 95 MB. Το σώμα ενός μεμονωμένου άμεσου αιτήματος API περιορίζεται στα 100 MB.

Παραδείγματα

  • Σύμβαση 20 σελίδων σε γκρι κλίμακα γίνεται Markdown με το κείμενο των όρων
  • Κεκλιμένη φωτογραφία κινητού μπορεί να χρειαστεί επαναλήψη πριν το OCR είναι χρήσιμο

Απόρρητο για αυτό το εργαλείο

Τα αρχεία ανεβαίνουν μέσω HTTPS, επεξεργάζονται στη μνήμη ή σε βραχύβιο προσωρινό κατάλογο στους διακομιστές μας και διαγράφονται όταν το αποτέλεσμα είναι έτοιμο. Δεν κρατάμε αντίγραφα για μετέπειτα περιήγηση, εκπαίδευση μοντέλων ή διαφημιστικά προφίλ. Οι λεπτομέρειες διατήρησης και οι γνωστοποιήσεις για cookie του AdSense βρίσκονται στην Πολιτική απορρήτου.

Συχνές ερωτήσεις

Το OCR αλλάζει την όψη των σελίδων;
Δεν επιστρέφει PDF. Το πρωτότυπο μένει άθικτο· παίρνετε χωριστή λήψη Markdown.
Είναι ενσωματώσιμη βιβλιοθήκη OCR;
Όχι. Είναι φιλοξενούμενη εργασία HTTP στο /api/v1/misc/ocr-pdf. Δείτε /developers. Δεν είναι SDK προς σύνδεση.
Μετά το OCR μπορώ να πάω σε Word;
Όχι ως αλυσίδα PDF. Η έξοδος είναι Markdown. PDF σε Word εξακολουθεί να χρειάζεται PDF με επίπεδο κειμένου.
Χρειάζεται Force OCR σε ηλεκτρονικό PDF;
Συνήθως όχι. Normal/Auto χρησιμοποιεί υπάρχον κείμενο και παραλείπει το runtime OCR. Χρησιμοποιήστε Force όταν το επίπεδο κειμένου είναι χαλασμένο ή αναξιόπιστο.

Τελευταία ενημέρωση:

Κλήση από κώδικα

Κάθε εργαλείο στον ιστότοπο είναι ένα απλό REST API. Για ανώνυμη χρήση δεν χρειάζεται λογαριασμός ούτε κλειδί API. Ίδιο για πρόγραμμα περιήγησης, προγραμματιστές και πράκτορες AI.

curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
  -F "[email protected]" \
  -F "ocrType=force-ocr" \
  -o output.pdf

Διατίθεται και ως εργαλείο MCP, για πελάτες που μιλούν Model Context Protocol (JSON-RPC 2.0 μέσω POST /mcp). Πλήρης αναφορά API

Χρήση από πράκτορα AI

Skill

Με αυτό το skill, τα Claude Code, Codex, Cursor και άλλοι πράκτορες AI μπορούν να εκτελέσουν το «OCR σε Markdown» για εσάς: /skills/pdf123-ocr.md

Όλα τα skills για πράκτορες

Τα αρχεία χρησιμοποιούνται μόνο για αυτή την εργασία και διαγράφονται αυτόματα μετά.