Setiau data NLP yw asgwrn cefn llawer o brosiectau prosesu iaith naturiol, gan gynnig hyblygrwydd ar gyfer ystod eang o dasgau megis dosbarthu testun, dadansoddi teimladau ac ateb cwestiynau. Mae Corpws Awduriaeth Blogiau, er enghraifft, yn cynnwys dros 681,000 o bostiadau blog gan bron i 20,000 o flogwyr, gan ei wneud yn adnodd cyfoethog ar gyfer astudio arddulliau ysgrifennu, adnabod awduron, a mwy.
I'r rhai sydd â diddordeb mewn ymchwil academaidd, mae set ddata papurau ymchwil arXiv yn darparu mynediad at gasgliad helaeth o bapurau gwyddonol ar draws sawl disgyblaeth, gan gefnogi tasgau NLP uwch fel dadansoddi dyfyniadau a dosbarthu dogfennau. Mae set ddata Canolfan Data Caffael Ffederal yn adnodd gwerthfawr arall, sy'n cynnig gwybodaeth fanwl am gontractau ffederal—yn ddelfrydol ar gyfer prosiectau sy'n cynnwys data llywodraeth ac adnabod endidau.
Defnyddir y setiau data nlp hyn yn helaeth i hyfforddi a gwerthuso modelau dysgu peirianyddol, gan helpu ymchwilwyr a datblygwyr i wella perfformiad eu systemau ar draws amrywiol dasgau nlp. P'un a ydych chi'n gweithio gyda phostiadau blog, papurau ymchwil, neu ddata llywodraeth, mae'r setiau data hyn yn darparu'r sylfaen ar gyfer cymwysiadau NLP cadarn ac amlbwrpas.
Beth yw NLP?
Mae NLP (Natural Language Processing) yn helpu cyfrifiaduron i ddeall iaith ddynol. Mae fel dysgu cyfrifiaduron i ddarllen, deall, ac ymateb i destun a lleferydd fel y mae bodau dynol yn ei wneud.
Beth all NLP ei wneud?
- Trowch destun blêr yn ddata trefnus
- Deall a yw sylwadau'n gadarnhaol neu'n negyddol
- Cyfieithu rhwng ieithoedd
- Creu crynodebau o destunau hir
- A llawer mwy!
- Dechrau arni gyda NLP:
Er mwyn adeiladu systemau NLP da, mae angen llawer o enghreifftiau arnoch i'w hyfforddi - yn union fel sut mae bodau dynol yn dysgu'n well gyda mwy o ymarfer. Y newyddion da yw bod llawer o adnoddau rhad ac am ddim lle gallwch ddod o hyd i'r enghreifftiau hyn: Wyneb Hugging, Kaggle ac GitHub. Gellir cael mynediad hawdd at setiau data o'r llwyfannau hyn, sy'n cyflymu datblygiad prosiectau NLP.
Maint a Thwf y Farchnad NLP:
O 2023 ymlaen, roedd y farchnad Prosesu Iaith Naturiol (NLP) yn werth tua $26 biliwn. Disgwylir iddo dyfu'n sylweddol, gyda chyfradd twf blynyddol cyfansawdd (CAGR) o tua 30% rhwng 2023 a 2030. Mae'r twf hwn yn cael ei yrru gan y galw cynyddol am geisiadau NLP mewn diwydiannau fel gofal iechyd, cyllid, a gwasanaeth cwsmeriaid.
Sut i ddewis set ddata NLP dda, ystyriwch y ffactorau canlynol:
- perthnasedd: Sicrhewch fod y set ddata yn cyd-fynd â'ch tasg neu barth penodol.
- Maint: Mae setiau data mwy yn gyffredinol yn gwella perfformiad model, ond yn cydbwyso maint ag ansawdd.
- Amrywiaeth: Chwiliwch am setiau data gydag arddulliau a chyd-destunau iaith amrywiol i wella cadernid modelau.
- Ansawdd: Gwiriwch am ddata cywir wedi'i labelu'n dda i osgoi cyflwyno gwallau.
- Hygyrchedd: Sicrhewch fod y set ddata ar gael i'w defnyddio ac ystyriwch unrhyw gyfyngiadau trwyddedu.
- Rhagbrosesu: Penderfynu a oes angen glanhau neu ragbrosesu sylweddol ar y set ddata.
- Cefnogaeth Gymunedol: Yn aml mae gan setiau data poblogaidd fwy o adnoddau a chefnogaeth gymunedol, a all fod o gymorth.
Drwy werthuso'r ffactorau hyn, gallwch ddewis set ddata sy'n gweddu orau i anghenion eich prosiect. Mae dewis y setiau data cywir yn hanfodol ar gyfer cyflawni canlyniadau gorau posibl mewn prosiectau NLP, gan eu bod yn effeithio'n uniongyrchol ar berfformiad model ac effeithlonrwydd hyfforddi.
Y 33 Set Data Agored y mae'n rhaid eu gweld orau ar gyfer NLP
cyffredinol
Spambase UCI (Dolen)
Mae gan Spambase, a grëwyd yn y Hewlett-Packard Labs, gasgliad o negeseuon e-bost sbam gan y defnyddwyr, gyda'r nod o ddatblygu hidlydd sbam wedi'i bersonoli. Mae ganddo fwy na 4600 o arsylwadau o negeseuon e-bost, y mae bron i 1820 ohonynt yn sbam.
Set ddata Enron (Dolen)
Mae gan set ddata Enron gasgliad helaeth o negeseuon e-bost 'go iawn' dienw sydd ar gael i'r cyhoedd i hyfforddi eu modelau dysgu peirianyddol. Mae'n cynnwys mwy na hanner miliwn o negeseuon e-bost gan dros 150 o ddefnyddwyr, yn bennaf uwch reolwyr Enron. Mae'r set ddata hon ar gael i'w defnyddio mewn fformatau strwythuredig ac anstrwythuredig. I wella'r data anstrwythuredig, mae'n rhaid i chi gymhwyso technegau prosesu data.
Set ddata Systemau Argymell (Dolen)
Mae set ddata'r System Argymell yn gasgliad enfawr o setiau data amrywiol sy'n cynnwys gwahanol nodweddion megis,
- Adolygiadau Cynnyrch
- Sgoriau seren
- Olrhain ffitrwydd
- Data caneuon
- Rhwydweithiau cymdeithasol
- Amserlenni
- Rhyngweithiadau defnyddiwr / eitem
- Data GPS
Penn Treebank (Dolen)
Mae'r corpws hwn, o'r Wall Street Journal, yn boblogaidd ar gyfer profi modelau labelu dilyniant.
NLTK (Dolen)
Mae'r llyfrgell Python hon yn darparu mynediad i dros 100 o gorporau ac adnoddau geiriol ar gyfer NLP. Mae hefyd yn cynnwys y llyfr NLTK, cwrs hyfforddi ar gyfer defnyddio'r llyfrgell. Mae NLTK yn cynnwys mynediad i WordNet, cronfa ddata geiriol fawr o Saesneg, lle mae geiriau fel enwau, berfau, ansoddeiriau ac adferfau wedi'u grwpio i mewn i synsetiau yn seiliedig ar ystyron a rennir. Mae NLTK hefyd yn darparu rhestr anodedig o gorporau ac adnoddau geiriol ar gyfer ymchwil NLP.
Dibyniaethau Cyffredinol (Dolen)
Mae UD yn darparu ffordd gyson o anodi gramadeg, gydag adnoddau mewn dros 100 o ieithoedd, 200 o gronfeydd coed, a chefnogaeth gan dros 300 o aelodau'r gymuned.
Setiau Data Dadansoddi Teimladau
Geiriaduron ar gyfer Ffilmiau a Chyllid (Dolen)
Mae'r set ddata Geiriaduron ar gyfer Ffilmiau a Chyllid yn darparu geiriaduron parth-benodol ar gyfer polaredd cadarnhaol neu negyddol mewn llenwadau Cyllid ac adolygiadau ffilm. Daw'r geiriaduron hyn o lenwadau IMDb ac US Form-8.Syniad 140 (Dolen)
Mae gan Sentiment 140 fwy na 160,000 o drydariadau gyda gwahanol emosiynau wedi'u categoreiddio mewn 6 maes gwahanol: dyddiad trydar, polaredd, testun, enw defnyddiwr, ID, ac ymholiad. Mae'r set ddata hon yn ei gwneud hi'n bosibl i chi ddarganfod teimlad brand, cynnyrch, neu hyd yn oed bwnc sy'n seiliedig ar weithgaredd Twitter. Gan fod y set ddata hon yn cael ei chreu'n awtomatig, yn wahanol i drydariadau eraill sydd wedi'u hanodi gan bobl, mae'n dosbarthu tweets ag emosiynau cadarnhaol ac emosiynau negyddol fel rhai anffafriol.
Set ddata Sentiment Aml-Barth (Dolen)
Mae'r set ddata teimladau aml-barth hon yn ystorfa o adolygiadau Amazon ar gyfer cynhyrchion amrywiol. Mae gan rai categorïau cynnyrch, fel llyfrau, adolygiadau sy'n rhedeg i filoedd, tra nad oes gan eraill ond ychydig gannoedd o adolygiadau. Ar ben hynny, gellir trosi'r adolygiadau â sgôr seren yn labeli deuaidd.
Banc Coed Sentiment Standford (Dolen)
Mae'r set ddata NLP hon o Rotten Tomatoes yn cynnwys ymadroddion hirach ac enghreifftiau testun manylach.
Corpws Awduraeth y Blog (Dolen)
Mae gan y casgliad hwn bostiadau blog gyda bron i 1.4 miliwn o eiriau, mae pob blog yn set ddata ar wahân.
Set ddata OpinRank (Dolen)
300,000 o adolygiadau gan Edmunds a TripAdvisor, wedi'u trefnu yn ôl model car neu gyrchfan teithio a gwesty.
Set Ddata Testun
Corpws Wiki QA (Dolen)
Wedi'i greu i helpu'r ymchwil cwestiwn ac ateb parth agored, mae'r WiKi QA Corpus yn un o'r setiau data mwyaf helaeth sydd ar gael i'r cyhoedd. Wedi'i lunio o logiau ymholiadau peiriannau chwilio Bing, mae'n dod gyda pharau cwestiwn-ac-ateb. Mae ganddo fwy na 3000 o gwestiynau a 1500 o frawddegau ateb wedi'u labelu.
Set Ddata Adroddiadau Achos Cyfreithiol (Dolen)
Mae gan set ddata Adroddiadau Achos Cyfreithiol gasgliad o 4000 o achosion cyfreithiol a gellir eu defnyddio i hyfforddi ar gyfer crynhoi testun yn awtomatig a dadansoddi dyfyniadau. Defnyddir pob dogfen, cyfeirnodau, dosbarthiadau dyfynnu, dyfyniadau dal, a mwy.
Perygl (Dolen)
Mae set ddata jeopardy yn gasgliad o fwy na 200,000 o gwestiynau sy'n ymddangos yn y sioe deledu gwis boblogaidd a ddaeth ynghyd gan ddefnyddiwr Reddit. Mae pob pwynt data yn cael ei ddosbarthu yn ôl ei ddyddiad a ddarlledir, rhif y bennod, ei werth, ei rownd a'i gwestiwn / ateb.
20 o Grwpiau Newyddion (Dolen)
Mae casgliad o 20,000 o ddogfennau yn cwmpasu 20 o grwpiau newyddion a phynciau, gan fanylu ar bynciau o grefydd i chwaraeon poblogaidd.
Set ddata Newyddion Reuters (Dolen)
Gan ymddangos gyntaf yn 1987, mae'r set ddata hon wedi'i labelu, ei mynegeio, a'i chasglu at ddibenion dysgu peirianyddol.
ArXiv (Dolen)
Mae'r set ddata sylweddol hon o 270 GB yn cynnwys testun cyflawn holl bapurau ymchwil arXiv.
Trafodion Senedd Ewrop Corpws Cyfochrog (Dolen)
Mae parau brawddegau o drafodion y Senedd yn cynnwys cofnodion o 21 o ieithoedd Ewropeaidd, yn cynnwys rhai ieithoedd llai cyffredin ar gyfer corpora dysgu peirianyddol.
Meincnod Biliwn o Eiriau (Dolen)
Yn deillio o News Crawl WMT 2011, mae'r set ddata modelu iaith hon yn cynnwys bron i biliwn o eiriau ar gyfer profi technegau modelu iaith arloesol.
Setiau Data Lleferydd Sain
Corpora Wikipedia Llafar (Dolen)
Mae'r set ddata hon yn berffaith i bawb sy'n edrych i fynd y tu hwnt i'r iaith Saesneg. Mae gan y set ddata hon gasgliad o erthyglau a siaredir yn Iseldireg ac Almaeneg a Saesneg. Mae ganddo ystod amrywiol o bynciau a setiau siaradwr sy'n rhedeg i gannoedd o oriau.
2000 HUB5 Saesneg (Dolen)
Mae gan set ddata Saesneg 2000 HUB5 40 o drawsgrifiadau sgwrs ffôn yn yr iaith Saesneg. Darperir y data gan y Sefydliad Cenedlaethol Safonau a Thechnoleg, a'i brif ffocws yw cydnabod lleferydd sgwrsio a throsi lleferydd yn destun.
LibriAraith (Dolen)
Mae set ddata LibriSpeech yn gasgliad o bron i 1000 awr o araith Saesneg wedi'i chymryd a'i segmentu'n gywir gan bynciau i benodau o lyfrau sain, gan ei gwneud yn offeryn perffaith ar gyfer Prosesu Iaith Naturiol.
Set Ddata Digid Llafar Am Ddim (Dolen)
Mae’r set ddata NLP hon yn cynnwys mwy na 1,500 o recordiadau o ddigidau llafar yn Saesneg.
Set Ddata Lleferydd M-AI Labs (Dolen)
Mae'r set ddata yn cynnig bron i 1,000 o oriau o sain gyda thrawsgrifiadau, yn cwmpasu ieithoedd lluosog ac wedi'u categoreiddio yn ôl lleisiau gwrywaidd, benywaidd a chymysg.
Cronfa Ddata Lleferydd Swnllyd (dolen)
Mae'r set ddata hon yn cynnwys recordiadau lleferydd swnllyd a glân cyfochrog, wedi'u bwriadu ar gyfer datblygu meddalwedd gwella lleferydd ond sydd hefyd yn fuddiol ar gyfer hyfforddiant ar leferydd mewn amodau heriol.
Setiau Data Adolygiadau
Adolygiadau Yelp (Dolen)
Mae gan set ddata Yelp gasgliad helaeth o tua 8.5 miliwn o adolygiadau o 160,000 a mwy o fusnesau, eu hadolygiadau, a data defnyddwyr. Gellir defnyddio'r adolygiadau i hyfforddi'ch modelau ar ddadansoddi teimladau. Ar ben hynny, mae gan y set ddata hon fwy na 200,000 o luniau sy'n cwmpasu wyth lleoliad metropolitan.
Adolygiadau IMDB (Dolen)
Mae adolygiadau IMDB ymhlith y setiau data mwyaf poblogaidd sy'n cynnwys gwybodaeth gast, graddfeydd, disgrifiad, a genre ar gyfer mwy na 50 mil o ffilmiau. Gellir defnyddio'r set ddata hon i brofi a hyfforddi eich modelau dysgu peiriant.
Set Ddata Adolygiadau a Sgoriau Amazon (Dolen)
Mae set ddata adolygu a graddio Amazon yn cynnwys casgliad gwerthfawr o fetadata ac adolygiadau o wahanol gynhyrchion o Amazon a gasglwyd rhwng 1996 a 2014 - tua 142.8 miliwn o gofnodion. Mae'r metadata yn cynnwys y pris, disgrifiad o'r cynnyrch, brand, categori, a mwy, tra bod gan yr adolygiadau ansawdd testun, defnyddioldeb y testun, graddfeydd, a mwy.
Setiau Data Cwestiynau ac Atebion
Set Ddata Holi ac Ateb Stanford (SQuAD) (Dolen)
Mae gan y set ddata darllen a deall hon 100,000 o gwestiynau y gellir eu hateb a 50,000 o rai na ellir eu hateb, pob un wedi'i greu gan weithwyr torf Wicipedia.
Cwestiynau Naturiol (Dolen)
Mae gan y set hyfforddi hon dros 300,000 o enghreifftiau hyfforddi, 7,800 o enghreifftiau datblygu, a 7,800 o enghreifftiau prawf, pob un ag ymholiad Google a thudalen Wicipedia cyfatebol.
TriviaQA (Dolen)
Mae gan y set hon o gwestiynau heriol 950,000 o barau SA, gan gynnwys is-setiau a ddilyswyd gan ddyn ac a gynhyrchir gan beiriannau.
CLEVR (Iaith Gyfansoddiadol a Rhesymu Gweledol Elfennol) (Dolen)
Mae'r set ddata ateb cwestiynau gweledol hon yn cynnwys gwrthrychau wedi'u rendro 3D a miloedd o gwestiynau gyda manylion am yr olygfa weledol.
Felly, pa set ddata ydych chi wedi dewis hyfforddi'ch model dysgu peiriant arni?
Wrth i ni fynd, byddwn yn eich gadael gydag a pro-tip.
Gwnewch yn siŵr eich bod yn mynd trwy'r ffeil README yn drylwyr cyn dewis set ddata NLP ar gyfer eich anghenion. Bydd y set ddata yn cynnwys yr holl wybodaeth angenrheidiol y gallai fod ei hangen arnoch, megis cynnwys y set ddata, y paramedrau amrywiol y mae'r data wedi'u categoreiddio arnynt, ac achosion defnydd tebygol y set ddata.
Waeth beth fo'r modelau rydych chi'n eu hadeiladu, mae gobaith cyffrous o integreiddio ein peiriannau'n agosach ac yn gynhenid â'n bywydau. Gyda NLP, mae'r posibiliadau ar gyfer busnes, ffilmiau, adnabod lleferydd, cyllid, a mwy yn fwy niferus.

Mae'r set ddata hon yn berffaith i bawb sy'n edrych i fynd y tu hwnt i'r iaith Saesneg. Mae gan y set ddata hon gasgliad o erthyglau a siaredir yn Iseldireg ac Almaeneg a Saesneg. Mae ganddo ystod amrywiol o bynciau a setiau siaradwr sy'n rhedeg i gannoedd o oriau.


