Εξαγωγή πινάκων από PDF σε CSV
Το PDF σε CSV βρίσκει ευθυγραμμισμένες γραμμές πίνακα στο κείμενο ενός PDF και γράφει κάθε εντοπισμένο πίνακα ως αρχείο CSV· πολλοί πίνακες επιστρέφονται σε ZIP. Χρειάζεται επίπεδο κειμένου και δεν δίνει τίποτα για συνεχές κείμενο ή σαρώσεις.
Σύρετε και αφήστε αρχεία εδώ ή κάντε κλικ για επιλογή
Δέχεται PDF · έως 500.0 MB ανά αρχείο · έως 20 αρχεία τη φορά
Μπορείτε επίσης να επικολλήσετε ένα αρχείο με Ctrl/Cmd+V ή από το μενού του προχείρου.
PDF σε CSV τρέχει `pdftotext -layout`, ψάχνει γραμμές με δύο ή περισσότερα συνεχόμενα κενά και γράφει αυτές τις γραμμές ως CSV. Κάθε ανιχνευμένος πίνακας γίνεται αρχείο με όνομα `{base}_pN_tM.csv`. Είναι για ηλεκτρονικά PDF όπου οι στήλες ήδη στοιχίζονται στο εξαγόμενο κείμενο.
Ένας πίνακας χρειάζεται τουλάχιστον δύο συνεχόμενες γραμμές που μοιάζουν με πίνακα. Πεζός λόγος, μία μόνο γραμμή επικεφαλίδας ή σάρωση χωρίς επίπεδο κειμένου δίνουν `no_content`: HTTP 204, χωρίς αρχείο. Το κενό αποτέλεσμα είναι σκόπιμο, όχι σιωπηλή αποτυχία.
Το εργαλείο αγνοεί παραμέτρους αιτήματος. Το πεδίο εύρους σελίδων σε αυτή τη σελίδα δεν διαβάζεται· σαρώνονται όλες οι σελίδες. Ένας πίνακας γίνεται ένα `text/csv`· πολλοί πίνακες συσκευάζονται σε ZIP με όνομα `{base}_extracted.zip`. Οι στήλες κόβονται σε δύο ή περισσότερα συνεχόμενα κενά· μεμονωμένα κενά μέσα στο κελί μένουν. Τα πεδία μπαίνουν σε εισαγωγικά κατά RFC 4180.
Δεν είναι OCR. Αμιγώς εικονογραφημένες σαρώσεις δεν έχουν περιεχόμενο για `pdftotext`. Το OCR σε Markdown επιστρέφει Markdown που δεν ξαναστέλνεται σε PDF σε CSV. Όταν οι λέξεις υπάρχουν μόνο ως pixel, εδώ δεν βγαίνουν αρχεία πίνακα.
PDF σε Excel χρησιμοποιεί την ίδια ευρετική διάταξης. Το Excel βάζει αυτούς τους πίνακες ως φύλλα στο ίδιο βιβλίο. Το CSV βγάζει ένα αρχείο ανά πίνακα. Κανένα από τα δύο δεν ανασυνθέτει συγχωνευμένα κελιά, χρωματιστές επικεφαλίδες ή κρυφά φύλλα από το PDF.
Ανοίξτε τη λήψη στο Excel ή LibreOffice Calc και ελέγξτε μερικές γραμμές για το κόψιμο στηλών. Σφιχτοί πίνακες χωρίς διπλά κενά συχνά πέφτουν σε μία στήλη. Τα αρχεία με κωδικό ξεκλειδώνονται για εσάς σε αυτή τη σελίδα μόλις εισαγάγετε τον κωδικό· οι χρήστες API εκτελούν πρώτα «Αφαίρεση κωδικού».
Τα ανεβάσματα είναι προσωρινά. Δεν κρατάμε βιβλιοθήκη CSV.
Λειτουργίες
- `pdftotext -layout` με ευρετική διαχωρισμού στηλών σε διπλά κενά
- Ένα CSV ανά πίνακα· πολλοί πίνακες σε ZIP· κενή ανίχνευση = HTTP 204
- Όχι OCR· το Markdown του OCR δεν έρχεται εδώ
- Ανώνυμο API: /api/v1/convert/pdf/csv
Πότε το χρησιμοποιείτε
- Μεταφορά πίνακα ηλεκτρονικού τιμολογίου στο Excel ή LibreOffice Calc
- Ένα CSV ανά πίνακα σε πολλές σελίδες αντί για ένα φύλλο
- Είσοδος σε σενάρια που δέχονται μόνο CSV
Πώς εξάγω έναν πίνακα από PDF σε CSV;
- Ανεβάστε PDF με επιλέξιμο κείμενο και στηλοειδή διάταξη πίνακα.
- Πατήστε «Εκτέλεση». Υπάρχει πεδίο εύρους σελίδων αλλά ο μετατροπέας δεν το διαβάζει. Δεν υπάρχει επιλογή OCR.
- Αν βρεθεί ένας πίνακας, κατεβάστε `.csv`. Αν πολλοί, κατεβάστε ZIP. Αν κανένας, παίρνετε κενή επιτυχία· αλλάξτε πηγή με επίπεδο κειμένου.
- Ανοίξτε στο Excel ή LibreOffice Calc και ελέγξτε το κόψιμο. Αμιγώς πεζό PDF δεν παράγει αρχείο.
Όρια και ειδικές περιπτώσεις
- Χρειάζεται επιλέξιμο κείμενο και διάκενα στηλών με διπλά κενά
- Χωρίς OCR· ο έλεγχος εύρους σελίδων δεν εφαρμόζεται
- Δεν ανασυνθέτει συγχωνευμένα κελιά και στυλ
- Όριο ανεβάσματος σε αυτόν τον ιστότοπο: 500 MB ανά αρχείο, με αποστολή σε τμήματα πάνω από περίπου 95 MB. Το σώμα ενός μεμονωμένου άμεσου αιτήματος API περιορίζεται στα 100 MB.
Παραδείγματα
- Κειμενικό PDF με τρίστηλο τιμοκατάλογο συχνά γίνεται ένα CSV με αυτές τις στήλες
- Σαρωμένη τραπεζική κατάσταση χωρίς επίπεδο κειμένου δίνει HTTP 204
Απόρρητο για αυτό το εργαλείο
Τα αρχεία ανεβαίνουν μέσω HTTPS, επεξεργάζονται στη μνήμη ή σε βραχύβιο προσωρινό κατάλογο στους διακομιστές μας και διαγράφονται όταν το αποτέλεσμα είναι έτοιμο. Δεν κρατάμε αντίγραφα για μετέπειτα περιήγηση, εκπαίδευση μοντέλων ή διαφημιστικά προφίλ. Οι λεπτομέρειες διατήρησης και οι γνωστοποιήσεις για cookie του AdSense βρίσκονται στην Πολιτική απορρήτου.
Συχνές ερωτήσεις
- Γιατί δεν υπάρχει CSV;
- Δεν βρέθηκαν δύο ή περισσότερες συνεχόμενες γραμμές πίνακα. Σαρώσεις, πεζός λόγος και πίνακες χωρίς διάκενα διπλού κενού αποτυγχάνουν σε αυτή την ευρετική. Το API απαντά 204 `no_content`.
- Μπορώ πρώτα OCR και μετά CSV;
- Όχι. Το OCR επιστρέφει Markdown. Αυτό το εργαλείο διαβάζει PDF μόνο μέσω pdftotext.
- Τι διαφέρει από PDF σε Excel;
- Η ανίχνευση είναι ίδια. Το CSV βγάζει ένα αρχείο ανά πίνακα (ένα CSV ή ZIP με πολλά). Το Excel γράφει κάθε πίνακα σε χωριστό φύλλο του ίδιου βιβλίου.
- Διαβάζει κάθε σελίδα;
- Ναι. Το pdftotext χωρίζει ανά αλλαγή σελίδας και σαρώνονται μπλοκ πίνακα σε κάθε σελίδα. Το πεδίο εύρους σελίδων σε αυτή τη σελίδα δεν διαβάζεται.
Τελευταία ενημέρωση:
Κλήση από κώδικα
Κάθε εργαλείο στον ιστότοπο είναι ένα απλό REST API. Για ανώνυμη χρήση δεν χρειάζεται λογαριασμός ούτε κλειδί API. Ίδιο για πρόγραμμα περιήγησης, προγραμματιστές και πράκτορες AI.
curl -X POST "https://pdf123.xyz/api/v1/convert/pdf/csv" \
-F "[email protected]" \
-F "pageNumbers=all" \
-o output.pdfΔιατίθεται και ως εργαλείο MCP, για πελάτες που μιλούν Model Context Protocol (JSON-RPC 2.0 μέσω POST /mcp). Πλήρης αναφορά API
Χρήση από πράκτορα AI
SkillΜε αυτό το skill, τα Claude Code, Codex, Cursor και άλλοι πράκτορες AI μπορούν να εκτελέσουν το «PDF σε CSV» για εσάς: /skills/pdf123-pdf-to-csv.md
Τα αρχεία χρησιμοποιούνται μόνο για αυτή την εργασία και διαγράφονται αυτόματα μετά.