Nenda kwenye maudhui makuu
PPDF123

Fanya OCR ya PDF Iliyoskaniwa kuwa Markdown

OCR kuwa Markdown husoma PDF iliyoskaniwa au ya picha na kurudisha maandishi yake kama faili ya Markdown. Haiongezi tabaka la maandishi kwenye PDF, na faili asilia haibadiliki.

Buruta faili hapa, au bofya uchague

Inakubali PDF · hadi 500.0 MB kwa kila faili · hadi faili 20 kwa mara moja

Unaweza pia kubandika faili kwa Ctrl/Cmd+V au kutoka kwenye menyu ya ubao wa kunakili.

OCR husoma skani au PDF za picha pekee na kurudisha Markdown (`text/markdown`, jina la faili `.md`). Haiandiki tabaka la maandishi yaliyofichwa kurudi kwenye PDF, wala haisafishi, hairekebishi mwelekeo, wala haiandiki upya skani.

Seva inaunganisha maandishi asilia yaliyomo kwenye PDF na matokeo ya utambuzi wa macho kwa kurasa za picha. Force OCR (`ocrType=force-ocr`, chaguo-msingi la tovuti) hutambua upya kila ukurasa. Normal (chochote kisicho `force-ocr`) hutumia maandishi asilia yakiwepo, na OCR tu kwa kurasa za picha pekee. Kwenye PDF safi za kidijitali, Auto haipakii mazingira ya OCR.

Usahihi hutegemea ubora wa skani, utofauti, na mwelekeo. Injini ya sasa haina kigezo cha lugha. Ikiwa mteja bado anatuma uga za zamani za Java OCRmyPDF (`languages`, `deskew`, `clean`, `sidecar`), zinapuuzwa.

Hii si hatua ya awali ya PDF kuwa Word au PDF kuwa RTF (maandishi). Zana hizo bado zinahitaji maandishi ndani ya PDF. OCR hapa ni uchimbaji sambamba: unapata Markdown, PDF asilia haibadiliki.

Usifanye OCR kwa faili usizoruhusiwa kuweka kidijitali au kusambaza tena. Maandishi yaliyotolewa pia yanazingatia hakimiliki na sheria za mahali pa kazi.

Unayetaka PDF inayoweza kutafutwa, hapa hautoipata. Bidhaa inayoweza kutafutwa ni faili ya Markdown. Fungua kwenye kihariri na kagua majina na namba zinazohitaji usahihi.

Picha za simu, kata na nyoosha kabla ya kupakia iwezekanavyo. Ukurasa uliopigwa kwa trapezi unapoteza utambuzi kwenye mandharinyuma. OCR si tafsiri: inatambua herufi, haiandiki hati kwa lugha nyingine.

Kazi inaendeshwa kwenye seva. Pakua kwa haraka. Hatuweki faili zako kama maktaba ya OCR. Faili zilizolindwa kwa nenosiri hufunguliwa kwa ajili yako kwenye ukurasa huu ukishaingiza nenosiri; wapigaji wa API waendeshe Ondoa nenosiri kwanza.

Sifa

  • Inarudisha Markdown, si PDF yenye tabaka la OCR
  • Force OCR inasoma upya kila ukurasa; Normal/Auto hutumia maandishi asilia yakiwepo
  • PDF asilia haibadiliki
  • API isiyo na jina: /api/v1/misc/ocr-pdf

Lini utumie

  • Kutoa maandishi ya vifungu kutoka skani za kumbukumbu
  • Kupeleka skani kwa wakala au mtiririko unaohitaji Markdown
  • Kurudisha maneno kutoka PDF za picha pekee zisizo na tabaka la maandishi

Ninafanyaje OCR ya PDF iliyoskaniwa?

  1. Pakia skani au PDF iliyopigwa kwa simu.
  2. Chagua Force OCR (chaguo-msingi) au Normal/Auto.
  3. Bofya Chakata na pakua faili `.md`.
  4. Kagua majina na namba katika Markdown kabla ya kutumia.

Mipaka na hali maalum

  • Usahihi hutofautiana na ubora wa picha
  • Kurasa nyingi huchukua muda zaidi
  • Injini ya sasa haina kigezo cha lugha
  • Si maktaba ya OCR ya ndani wala SDK ya nje ya mtandao
  • Kikomo cha kupakia kwenye tovuti hii: MB 500 kwa kila faili, likitumwa kwa vipande zaidi ya takriban MB 95. Mwili wa ombi moja la moja la API una kikomo cha MB 100.

Mifano

  • Skani ya mkataba wa kurasa 20 ya kijivu inakuwa faili ya Markdown ya maandishi ya vifungu
  • Ukurasa wa simu uliolazimishwa unaweza kuhitaji kupigwa tena ili OCR iwe na manufaa

Faragha ya zana hii

Faili hupakiwa kupitia HTTPS, zinachakatwa kwenye kumbukumbu au folda ya muda mfupi kwenye seva zetu, na kufutwa matokeo yakiwa tayari. Hatuhifadhi nakala kwa kuvinjari baadaye, mafunzo, au wasifu wa matangazo. Tazama Sera ya Faragha kwa maelezo ya uhifadhi na ufichuzi wa vidakuzi vya AdSense.

Maswali ya kawaida

Je, OCR inabadilisha mwonekano wa ukurasa?
Hairudishi PDF. Faili asilia haibadiliki; unapata upakuaji tofauti wa Markdown.
Je, hii ni maktaba ya OCR inayoweza kupachikwa?
Hapana. Ni kazi ya HTTP kwenye /api/v1/misc/ocr-pdf. Tazama /developers. Si SDK inayoweza kuunganishwa.
Baada ya OCR, naweza kugeuza kuwa Word?
Si kama mfululizo wa PDF. Pato la OCR ni Markdown. PDF kuwa Word bado inahitaji PDF yenye tabaka la maandishi.
Je, PDF ya kidijitali inahitaji Force OCR?
Kwa kawaida hapana. Normal/Auto hutumia maandishi yaliyopo na kuruka mazingira ya OCR. Tumia Force tabaka la maandishi likiharibika au lisiloaminika.

Ilisasishwa mwisho:

Tumia kutoka msimbo

Kila zana hapa ni REST. Matumizi bila kujisajili hayahitaji akaunti wala ufunguo wa API. Inafaa kivinjari, watengenezaji, na mawakala wa AI.

curl -X POST "https://pdf123.xyz/api/v1/misc/ocr-pdf" \
  -F "[email protected]" \
  -F "ocrType=force-ocr" \
  -o output.pdf

Pia inapatikana kama zana ya MCP kwa programu zinazotumia Model Context Protocol (JSON-RPC 2.0, POST /mcp). Maelezo kamili ya API

Itumie kupitia wakala wa AI

Skill

Ukiwa na skill hii, Claude Code, Codex, Cursor na mawakala wengine wa AI wanaweza kukuendeshea "OCR kuwa Markdown": /skills/pdf123-ocr.md

Skill zote za mawakala

Faili inatumika kazi hii tu, kisha inafutwa yenyewe.