Mae adnabod nodau optegol bellach yn pweru sganio derbynebau, gwirio ID, awtomeiddio anfonebau, digideiddio archifau hanesyddol, ac apiau nodiadau sy'n seiliedig ar steilws. Rhagwelir y bydd y farchnad OCR yn cyrraedd $32.90 biliwn erbyn 2030 ar gyfradd twf blynyddol gyfanredol (CAGR) o 14.8% (Grand View Research, 2024), gydag adnabod nodau deallus - cangen darllen llawysgrifen OCR - yn tyfu gyflymaf. P'un a ydych chi'n adeiladu dadansoddi dogfennau, canfod testun golygfa, neu drawsgrifio llawysgrifen, mae'r set ddata OCR rydych chi'n hyfforddi arni yn gosod eich nenfwd cywirdeb. Mae'r canllaw hwn yn cwmpasu 22 o setiau data OCR ffynhonnell agored am ddim - gan gynnwys y setiau data llawysgrifen gorau - wedi'u trefnu yn ôl achos defnydd ac wedi'u hadnewyddu gyda'r datganiadau cryfaf hyd at 2024.
Siop Cludfwyd Allweddol
- OCR (Adnabod Nodau Optegol): technoleg sy'n trosi delweddau o destun printiedig, golygfaol, neu destun wedi'i ysgrifennu â llaw yn ddata y gellir ei ddarllen gan beiriant.
- Mae setiau data OCR wedi'u rhannu'n bum grŵp: dogfen/ffurflen, testun golygfa, digid/cymeriad, llawysgrifen, ac amlieithog.
- Setiau data OCR dogfennau cipio tudalennau strwythuredig fel ffurflenni a derbynebau; setiau data testun-golygfa cipio testun “yn y gwyllt.”
- IAM, MNIST, ICDAR, ac SROIE yw'r meincnodau OCR a ddyfynnir fwyaf ar draws ymchwil o hyd.
- Mae telerau'r drwydded yn amrywio'n fawr — gwiriwch bob set ddata OCR cyn hyfforddiant masnachol.
Beth yw OCR (Cydnabod Cymeriad Optegol)?
Mae OCR yn dechnoleg sy'n trosi gwahanol fathau o ddogfennau, fel dogfennau papur wedi'u sganio, PDFs, neu ddelweddau o destun, yn ddata y gellir ei olygu a'i chwilio. Mae'n gweithio gan:
- Dadansoddi strwythur testun mewn delwedd
- Rhannu'r testun yn llinellau a chymeriadau
- Trosi'r cymeriadau gweledol hyn yn destun y gall peiriant ei ddarllen
Mae defnyddiau cyffredin yn cynnwys:
- Trosi dogfennau wedi'u sganio yn ffeiliau testun y gellir eu golygu
- Digido llyfrau printiedig
- Tynnu testun o ffotograffau
- Trosi presgripsiynau mewn llawysgrifen i destun digidol
- Adnabod plât trwydded
Sut ydych chi'n dewis y set ddata OCR gywir?
Mae dewis set ddata OCR yn dibynnu ar bedwar ffactor: math o destun, amgylchedd cipio, manylder anodiadau, a thrwydded. Mae angen data hyfforddi gwahanol ar OCR dogfennau printiedig na thestun golygfa wedi'i ysgrifennu â llaw mewn llinellau byr neu grwm. Mae setiau data dogfennau yn addas ar gyfer anfonebau, ffurflenni, a derbynebau; mae setiau data testun golygfa yn addas ar gyfer darllen arwyddion a chynnyrch; mae setiau data llawysgrifen yn addas ar gyfer nodiadau, llawysgrifau, a mewnbwn stylus. Mae anodiadau lefel geiriau a lefel llinell yn cefnogi piblinellau OCR llawn, tra bod setiau lefel cymeriad yn cyd-fynd â llinellau sylfaen dosbarthu. Cadarnhewch delerau'r drwydded bob amser, gan fod rhai setiau data OCR ar gyfer ymchwil yn unig neu angen cofrestru.
Beth yw'r setiau data OCR dogfennau a ffurflenni gorau?
Mae setiau data OCR dogfennau yn hyfforddi modelau i ddadansoddi tudalennau strwythuredig fel anfonebau, ffurflenni, derbynebau ac IDau. Mae'r rhain yn pweru awtomeiddio dogfennau busnes ac echdynnu allweddi-gwerthoedd.
- HWYL — 199 o ffurflenni wedi'u sganio â nodiadau ac ymddangosiad swnllyd, go iawn. Y meincnod safonol ar gyfer deall ffurflenni ac echdynnu gwerth allweddi.
- SROIE — Set ddata derbynebau sganiedig ICDAR 2019 o tua 1,000 o dderbynebau, yn cefnogi canfod testun, adnabod ac echdynnu gwybodaeth mewn un set.
- CORD — Set ddata derbynebau cyfunol wedi'i hadeiladu ar gyfer dadansoddi ôl-OCR, gyda labeli lefel maes cyfoethog ar gyfer awtomeiddio anfonebau a derbynebau.
- XFUND — Estyniad amlieithog o FUNSD sy'n cwmpasu saith iaith (Almaeneg, Sbaeneg, Ffrangeg, Eidaleg, Japaneg, Portiwgaleg, Tsieinëeg) gyda 199 tudalen yr un. Yn ddelfrydol ar gyfer dogfennau amlieithog artiffisial.
- DDI-100 — Tua 100,000 o ddelweddau dogfennau wedi'u gwyrdroi i'w canfod a'u hadnabod o dan ddirywiad yn y byd go iawn fel ystum, aneglurder a sŵn.
Beth yw'r setiau data OCR testun golygfa gorau?
Mae setiau data OCR testun-golygfa yn hyfforddi modelau i ddarllen testun mewn delweddau naturiol fel arwyddion, cynhyrchion a golygfeydd stryd. Mae'r rhain yn hanfodol ar gyfer OCR yn y gwyllt lle mae cefndiroedd yn anniben.
- Darlleniad Cadarn ICDAR — Y teulu meincnod y tu ôl i'r rhan fwyaf o ymchwil testun-golygfa, gan gynnwys yr heriau Testun Golygfa Ffocws ac Achlysurol gyda blychau ffiniol a thrawsgrifiadau ar lefel geiriau.
- Testun COCO — Anodiadau testun golygfa ar raddfa fawr wedi'u haenu ar ddelweddau MS-COCO. Cryf ar gyfer canfod testun ar raddfa fawr mewn golygfeydd naturiol.
- Testun Cyflawn — Yn arbenigo mewn testun crwm a thestun sydd wedi'i gyfeirio'n fympwyol, man gwan hysbys ar gyfer modelau OCR hŷn.
- Testun Golygfa Stryd (SVT) — Delweddau Word wedi'u cynaeafu o Google Street View, yn aml yn gydraniad isel ac yn amrywiol iawn. Ar gael trwy Papers with Code mirrors.
- TestunHier — Anodiad hierarchaidd o baragraff i linell i air, yn cwmpasu testun golygfa wedi'i ysgrifennu â llaw ac wedi'i argraffu. Yn ddefnyddiol ar gyfer OCR sy'n ymwybodol o gynllun.
Beth yw'r setiau data OCR digidau a chymeriadau gorau?
Mae setiau data OCR digidau a chymeriadau yn hyfforddi modelau i adnabod symbolau unigol mewn lleoliadau rheoledig. Dyma'r mannau cychwyn safonol ar gyfer llinellau sylfaen dosbarthu.
- MNIST — 70,000 o ddelweddau digid wedi'u hysgrifennu â llaw mewn graddfa lwyd. Y llinell sylfaen gyflymaf ar gyfer dilysu dosbarthwr digid.
- EMNIST — Yn ymestyn MNIST gyda 814,255 o lythrennau a digidau wedi'u hysgrifennu â llaw sy'n deillio o Gronfa Ddata Arbennig NIST 19.
- SVHN (Rhifau Tai Golygfa Stryd) — Dros 600,000 o ddelweddau digid go iawn o rifau tai. Cam ymarferol ymlaen o MNIST ar gyfer amodau swnllyd.
- Nodau74K — 74,107 o ddelweddau yn cwmpasu cymeriadau Saesneg a Kannada o ddelweddau naturiol a ffontiau cyfrifiadurol.
- Cronfa Ddata Arbennig NIST 19 — 810,000+ o ddelweddau cymeriad wedi'u hargraffu â llaw gan 3,600 o awduron. Y ffynhonnell y mae llawer o feincnodau OCR Saesneg yn deillio ohoni.
Beth yw'r setiau data llawysgrifen gorau ar gyfer OCR?
Mae setiau data llawysgrifen yn hyfforddi modelau OCR i ddarllen testun llawysgrifen mewn llinell, printiedig, a hanesyddol. Y setiau data llawysgrifen agored cryfaf yw'r meincnodau a ddyfynnir fwyaf ar gyfer adnabod testun llawysgrifen (HTR) o hyd.
- Cronfa Ddata Llawysgrifen IAM — Y safon aur ar gyfer llawysgrifen Saesneg, gyda 13,353 o linellau testun gan 657 o awduron. Y set ddata llawysgrifen a ddyfynnir fwyaf mewn ymchwil OCR 2024–2025 o hyd.
- IAM-ArDB — Fersiwn pen-strôc ar-lein IAM, yn cipio data llwybr. Y set ddata llawysgrifen ganonaidd ar gyfer adnabod steilws a thabledi.
- Papurau Bentham — Llawysgrifau Saesneg hanesyddol wedi'u trawsgrifio gan yr athronydd Jeremy Bentham. Y prif feincnod ar gyfer llawysgrifen hanesyddol OCR, ar gael trwy Transkribus.
- GNHK (Casgliad Llawysgrifen GoodNotes) — Set ddata 2021 o nodiadau ysgrifenedig â llaw Saesneg go iawn heb eu cyfyngu. Yn agosach at ddata cynhyrchu anniben na IAM glân o labordy.
Beth yw'r setiau data OCR amlieithog a di-Lladin gorau?
Mae setiau data OCR amlieithog yn hyfforddi modelau ar sgriptiau y tu hwnt i Saesneg, gan gynnwys nodiant Tsieinëeg, Arabeg a mathemategol. Mae'r rhain yn hanfodol ar gyfer adnabod dogfennau a llawysgrifen yn fyd-eang.
- CASIA-HWDB — Y meincnod OCR Tsieineaidd safonol, gyda 1.17 miliwn o samplau cymeriadau wedi'u hysgrifennu â llaw gan 1,020 o ysgrifenwyr.
- KHATT — 1,000 o ffurflenni Arabeg wedi'u hysgrifennu â llaw gan 1,000 o awduron gwahanol, wedi'u sganio ar sawl datrysiad. Y set ddata OCR Arabeg agored fwyaf cynhwysfawr.
- CROHME — Cystadleuaeth ar Adnabod Mynegiadau Mathemategol Ysgrifenedig â Llaw Ar-lein: 10,000+ o fynegiadau ar draws 101+ o symbolau mathemateg, mewn amrywiadau ar-lein ac all-lein. Hanfodol ar gyfer OCR hafaliadau ysgrifenedig â llaw.
Beth yw'r peryglon cyffredin wrth ddefnyddio setiau data OCR am ddim?
Mae tri pheryglon yn dal y rhan fwyaf o dimau.
Anghydweddiad parth: mae hyfforddiant ar IAM glân neu COCO-Testun a'i ddefnyddio ar anfonebau wedi'u crychu yn gwarantu cywirdeb gwael.
Dallineb trwydded: Mae nifer o setiau data testun-golygfa ac OCR hanesyddol ar gyfer ymchwil yn unig neu mae angen cofrestru cyn eu defnyddio'n fasnachol.
Bylchau anodiadau: mae llawer o setiau data OCR yn brin o'r metadata cynllun, blychau ffiniol lefel llinell, na labeli maes y mae eu hangen ar systemau cynhyrchu.
Dychmygwch gwmni logisteg maint canolig yn awtomeiddio darllen labeli cludo. Mae hyfforddiant testun golygfa cyhoeddus yn eu cael i 80% ar feincnodau, ond mae labeli go iawn gyda llewyrch a phlygiadau yn eu gostwng i 58%. Mae cau'r bwlch hwnnw angen targed. anodi data o 6,000 o ddelweddau label yn y parth cyn lansio.
Manteision a Heriau Setiau Data Ffynhonnell Agored
Mae angen i fusnesau osod y manteision a'r heriau yn erbyn ei gilydd i ddeall a oes rhaid iddynt ddewis data am ddim i'w ddefnyddio ar gyfer eu cymwysiadau ML.
Manteision
- Mae'r data ar gael yn hawdd. Oherwydd argaeledd data, mae cost datblygu'r cais yn cael ei leihau'n sylweddol.
- Mae'r amser a'r ymdrech a dreulir yn casglu data ar gyfer y rhaglen yn cael eu lleihau'n sylweddol gan fod y set ddata ar gael yn rhwydd.
- Mae digonedd o fforymau cymunedol neu grwpiau cymorth sy'n helpu i ddysgu, addasu a gwneud y gorau o'r set ddata.
- Un o brif fanteision y set ddata ffynhonnell agored yw nad yw'n gosod unrhyw gyfyngiadau ar addasu.
- Mae data Ffynhonnell Agored ar gael i gyfran fawr o'r boblogaeth, gan wneud dadansoddi ac arloesi yn bosibl heb rwystrau ariannol.
Heriau
- Mae'n anodd cael y data sy'n benodol i'r prosiect. Yn ogystal, mae posibilrwydd o wybodaeth ar goll a defnydd anghywir o'r data sydd ar gael.
- Mae caffael data perchnogol yn cymryd amser, ymdrech ac mae'n gostus
- Er y gallai fod yn haws cael data, gallai cost gwybodaeth a dadansoddi fod yn drech na'r fantais gychwynnol.
- Mae datblygwyr eraill hefyd yn defnyddio'r un data i ddatblygu cymwysiadau.
- Mae'r setiau data hyn yn agored iawn i doriadau diogelwch, preifatrwydd a chaniatâd.
Sut mae Shaip yn cefnogi prosiectau OCR ac adnabod llawysgrifen?
Shaip's Gwasanaethau data hyfforddi OCR paru curadu setiau data agored ag arfer casglu data ar draws 60+ o ieithoedd, yn cwmpasu dogfennau printiedig, llawysgrifen, derbynebau, ac IDau. Mae llifau gwaith anodiadau Shaip yn ychwanegu'r haenau y mae setiau data OCR cyhoeddus yn eu colli: blychau ffiniol lefel llinell, labeli lefel maes, QC trawsgrifio, a metadata ysgrifennwr.
Casgliad
Mae'r 22 set ddata OCR uchod yn rhoi sylfaen ffynhonnell agored gyflawn i chi ar draws dogfen, testun golygfa, digid, llawysgrifen, ac adnabyddiaeth amlieithog ar gyfer 2026. Dechreuwch gyda'r set ddata OCR sy'n cyd-fynd â'ch math o destun a'ch amgylchedd cipio, dilyswch yn erbyn sampl a gedwir allan o'ch data go iawn, a chyllidebwch ar gyfer anodiadau personol i gau'r bwlch parth. Mae'r cyfuniad hwnnw'n dod yn gyflymach nag adeiladu o'r dechrau.
Beth yw'r set ddata OCR am ddim orau ar gyfer dysgu peirianyddol?
Mae'r set ddata OCR rhad ac am ddim orau yn dibynnu ar y dasg. Mae ICDAR Robust Reading yn arwain testun golygfa, mae FUNSD ac SROIE yn arwain dogfennau a derbynebau OCR, ac mae IAM yn arwain llawysgrifen. Ar gyfer adnabod digidau, mae MNIST ac SVHN yn safonol. Mae'r rhan fwyaf o dimau'n cyfuno dau neu dri set ddata OCR ar draws categorïau yn hytrach na dibynnu ar un.
A yw setiau data OCR ffynhonnell agored yn rhad ac am ddim i'w defnyddio'n fasnachol?
Nid yw setiau data OCR ffynhonnell agored i gyd yn rhad ac am ddim ar gyfer defnydd masnachol. Mae MNIST, SVHN, a COCO-Text yn defnyddio trwyddedau caniataol, tra bod IAM, setiau ICDAR, a setiau data llawysgrifen hanesyddol yn aml yn gofyn am gofrestru neu'n cyfyngu eu defnydd i ymchwil. Adolygwch drwydded pob set ddata bob amser cyn hyfforddi model masnachol.
Beth yw'r gwahaniaeth rhwng setiau data OCR a setiau data llawysgrifen?
Mae setiau data OCR yn cwmpasu pob math o adnabod testun y gellir ei ddarllen gan beiriant, gan gynnwys dogfennau printiedig, testun golygfa, a digidau, tra bod setiau data llawysgrifen yn is-set sy'n canolbwyntio ar gynnwys llawysgrifen. Mae setiau data llawysgrifen fel IAM a Bentham yn hyfforddi modelau HTR, tra bod setiau data OCR dogfennau a thestun golygfa yn trin testun printiedig ac yn y gwyllt.
Pa setiau data OCR sy'n cefnogi adnabyddiaeth amlieithog?
Mae setiau data OCR amlieithog yn cynnwys XFUND ar gyfer saith iaith o ffurfiau, CASIA-HWDB ar gyfer Tsieinëeg, KHATT ar gyfer Arabeg, ac ICDAR MLT ar gyfer testun golygfa amlieithog. Mae cyfuno setiau data OCR penodol i sgriptiau ag ychwanegiad synthetig fel arfer yn perfformio'n well na hyfforddiant ar unrhyw set ddata sengl yn unig.
Faint o anodiadau personol sydd eu hangen arnaf y tu hwnt i setiau data OCR am ddim?
Mae anghenion anodi personol yn dibynnu ar ba mor bell yw eich dogfennau o ddata cyhoeddus. Efallai y bydd angen 1,000–5,000 o samplau yn y parth ar ffurflenni printiedig glân, tra bod angen 10,000–50,000 yn aml ar lawysgrifen flêr, derbynebau, neu sgriptiau prin. Mae piblinellau anodi Shaip fel arfer yn darparu cynnydd cywirdeb o 15–30% dros hyfforddiant OCR cyhoeddus yn unig.



