Mae robotiaid dynolryw yn croesi'r bwlch o arddangosiadau labordy i warysau go iawn, ceginau a lloriau ffatri - ond mae'r rhan fwyaf o dimau'n darganfod nad y model yw'r rhan anodd. Y data y tu ôl iddo ydyw. Gall modelau sylfaen adnabod cwpan; mae defnyddio dynolryw sy'n codi un, yn ei roi i berson oedrannus, ac yn addasu pan fydd y person yn cyrraedd yn wahanol yn broblem hollol wahanol. Data hyfforddi robotiaid dynolryw yw'r ffactor sy'n penderfynu rhwng arddangosiad caboledig a system sy'n goroesi cyswllt â'r byd go iawn.

Mae'r canllaw hwn yn mynd trwy'r hyn sydd ei angen ar dimau AI humanoid ar draws mathau o ddata, dyfnder anodiadau, cwmpas diogelwch, a rheolaethau ansawdd cyn iddynt wthio model i gynhyrchu.
Siop Cludfwyd Allweddol
- Mae defnyddio humanoid yn gofyn am ddata amlfoddol sy'n cyd-fynd â chamau gweithredu, nid delweddau wedi'u labelu yn unig.
- Mae angen arddangosiadau byd go iawn o hyd ar fodelau sylfaen i ymdopi ag amrywioldeb ffisegol.
- Mae tasgau deulaw, sy'n llawn cyswllt, yn galw am lwybr manwl gywir a nodiadau grym.
- Mae cwmpas senario diogelwch bellach yn faen prawf gatio defnydd ar draws y diwydiant.
- Mae adolygiad dynol-yn-y-ddolen a chytundeb rhyng-anodwyr yn parhau i fod yn rheolaethau ansawdd hanfodol.
- Mae fformatau allbwn sy'n barod ar gyfer VLA yn lleihau'r ffrithiant rhwng gweithrediadau data a phibellau hyfforddi.
Sut olwg sydd ar ddata hyfforddi robotiaid dynol?

Llwybr gweithredu: Dilyniant â stamp amser o ystumiau effeithydd terfynol, onglau cymalau, neu orchmynion modur sy'n disgrifio sut mae tasg yn cael ei chyflawni.
Unodd y cydweithrediad Open X-Embodiment ddata ar draws 22 o ymgorfforiadau robot a mwy na 500 o dasgau (DeepMind/Stanford et al., 2024), gan ddangos y raddfa y mae modelau sylfaen humanoid modern yn ei disgwyl yn y cyfnod cyn-hyfforddi. Ond nid yw graddfa cyn-hyfforddi yn unig yn cyflawni defnydd. Mae angen i dimau gael eu data penodol i dasgau eu hunain wedi'i haenu ar ei ben - wedi'i gasglu mewn amgylcheddau y bydd eu robotiaid yn gweithredu ynddynt mewn gwirionedd.
Pam mae timau humanoid yn taro wal ddata cyn eu defnyddio?
Mae timau humanoid yn taro wal ddata oherwydd nad yw parau delwedd-testun ar raddfa we yn cynnwys llwybrau gweithredu, grymoedd cyswllt, na bwriad dynol. Gall model ddisgrifio silff anniben yn berffaith a dal i fethu â deall ohoni. Mae'r bwlch rhwng deall golygfa a gweithredu ynddi wedi'i lenwi ag arddangosiadau strwythuredig, telemetreg, a sylw achos ymylol nad oes unrhyw set ddata gyhoeddus yn ei ddarparu.
Dychmygwch gwmni newydd dynol maint canolig y mae ei demo codi a gosod yn rhedeg yn lân mewn stiwdio dan reolaeth. Pan fydd yr un robot yn mynd i mewn i warws go iawn gyda lloriau adlewyrchol, rhwystrau rhannol, a phecynnu anghyfarwydd, mae'r gyfradd llwyddiant yn cwympo - nid oherwydd bod y model yn anghywir, ond oherwydd nad oes neb wedi'i hyfforddi o dan yr amodau hynny. Mae cau'r bwlch hwnnw'n broblem data, nid problem model.
Pa fathau o ddata sydd bwysicaf ar gyfer trin â dwy law?

Triniaeth ddwylaw: Dosbarth sgiliau robotig sy'n defnyddio dwy fraich a dwylo gyda'i gilydd i drin gwrthrychau na all polisïau un fraich eu rheoli'n ddibynadwy.
Mae'r haenau na ellir eu trafod yn cynnwys:
- Arddangosiadau dynol neu deleweithredol gyda'r ddwy law yn cael eu holrhain ar gyfraddau ffrâm uchel.
- Darlleniadau grym a chyffyrddol cydamserol ar draws gafaelwyr a phwyntiau cyswllt.
- Anodiadau cyflwr gwrthrych yn marcio safle, cyfeiriadedd ac anffurfiad ar draws pob ffrâm.
- Dilyniannau adfer ar ôl methiant sy'n dangos beth mae bodau dynol yn ei wneud pan fydd gwrthrych yn llithro neu'n symud.
- Parau cyfarwyddyd-gweithredu sy'n cysylltu nodau iaith naturiol â symudiad a weithredwyd.
Mae llifau gwaith AI Ffisegol Shaip yn cipio'r haen hon trwy gipio stiwdio byd-eang a chasglu maes ar draws ceginau, warysau, ffatrïoedd a chartrefi, gyda dyfnder anodiadau wedi'i addasu ar gyfer Gweledigaeth-iaith-gweithredu (VLA) hyfforddiant model. Gweler Cynnig AI Ffisegol Shaip ar gyfer y biblinell lawn.
Sut ddylech chi strwythuro data arddangos dynol ar gyfer hyfforddiant VLA?
Dylid strwythuro data arddangos dynol fel penodau arwahanol, wedi'u labelu yn ôl iaith — pob pennod yn cynnwys arsylwadau, cyfarwyddiadau, llwybrau gweithredu, a label llwyddiant neu fethiant wedi'u halinio.
Mewn ymdrech ar raddfa fawr ddiweddar, trawsnewidiwyd fideos dynol egosentrig heb strwythur yn ddata hyfforddi wedi'i fformatio ar gyfer VLA o 1 filiwn o benodau ar draws 26 miliwn o fframiau (Wu et al., arXiv, 2025), gan gadarnhau bod data arddangos yn fwyaf defnyddiol pan fydd wedi'i segmentu, wedi'i atomu, ac wedi'i alinio o ran iaith. Nid yw fideo rhydd, heb ei segmentu, yn unig yn hyfforddi polisi y gellir ei ddefnyddio.
Mae arddangosiadau defnyddiol yn cynnwys: Cyfarwyddyd tasg clir, arsylwadau fframiol, labeli gweithredu ym mhob cam, stampiau amser, a marcwr gwerthuso. Shaip's anodi data Mae llifau gwaith yn darparu'r union strwythur hwn, gan gynnwys metadata tarddiad ar gyfer adolygiad cyfreithiol menter.
Sut mae senarios diogelwch yn newid y biblinell ddata?
Mae senarios diogelwch yn newid y biblinell ddata drwy orfodi timau i gynllunio sylw digwyddiadau prin cyn i'r casglu ddechrau, nid ar ôl hynny. Achosion ymylol — rhwystrau, golau isel, dull dynol annisgwyl, gwrthrychau wedi'u gollwng — yw'r sefyllfaoedd lle mae risg defnyddio yn canolbwyntio.
Achos ymyl: Cyflwr gweithredu prin ond credadwy sy'n achosi methiannau maes a digwyddiadau diogelwch yn anghymesur.
Piblinellau cadarn yn pobi i mewn:
- Rhestrau senarios wedi'u sgriptio sy'n gysylltiedig â haenau risg defnyddio
- Setiau prawf atchweliad sy'n dal drifft perfformiad
- Trothwyon cytundeb rhyng-anodwyr ar gyfer labeli risg uchel
- Meincnodau parodrwydd rhyddhau ar draws digwyddiadau prin
Sefydliad Cenedlaethol Safonau a Thechnoleg yr Unol Daleithiau Fframwaith Rheoli Risg AI yn darparu cyfeirnod niwtral defnyddiol ar gyfer trefnu gwerthusiad haenog risg, yn enwedig ar gyfer timau sy'n gweithredu ar draws amgylcheddau rheoleiddiedig.
Sut ddylid mesur ansawdd data humanoid?
| haen | Beth mae'n ei gwmpasu | Rheoli ansawdd a argymhellir |
|---|---|---|
| Dull Casglu | Amgylchedd, synwyryddion, caniatâd | Logiau calibradu · caniatâd cyfranogwyr · llwybr tarddiad |
| Anodi | Llwybrau, gwrthrychau, cyfarwyddiadau | Adolygiad haenog · cytundeb rhyng-anodwyr (IAA) · calibradu set aur |
| Dilysu | Achosion ymyl, diogelwch, atchweliadau | Senarios haen risg · meincnodau parodrwydd rhyddhau |
| Cyflawni | Fformat, cynllun, gwerthusiad | Cynlluniau wedi'u halinio â VLA · penodau gwerthuso · logiau archwilio |
Mae sicrhau ansawdd haenog Shaip — dilysu pas cyntaf, calibradu set aur, ac adolygiad rhyddhau terfynol — wedi'i adeiladu o amgylch y math hwn o sylw haenog, gyda Adolygiad HITL cau'r ddolen rhwng allbwn y model a data ailhyfforddi.
Casgliad: O'r demo i'r defnydd mae problem data
Nid yw data hyfforddi robotiaid dynolryw yn biblinell sengl; mae'n bentwr o benderfyniadau ynghylch moddoldeb, dyfnder anodiadau, sylw diogelwch, a rheoli ansawdd. Mae timau sy'n gwneud hyn yn iawn yn symud o arddangosiadau trawiadol i systemau sy'n cael eu defnyddio mewn gwirionedd. Timau nad ydynt yn gorfod ailhyfforddi am flynyddoedd.
Beth yw'r bwlch mwyaf rhwng data demo humanoid a data defnyddio?
Mae'r bwlch mwyaf yn gorwedd yn y sylw a roddir i amrywioldeb y byd go iawn. Mae data demo yn tueddu i ddod o stiwdios glân, rheoledig gydag actorion cydweithredol. Rhaid i ddata defnyddio gasglu annibendod, amrywiad goleuo, ymddygiad dynol annisgwyl, sŵn synhwyrydd, a digwyddiadau prin. Heb yr ehangder hwnnw, mae modelau'n pasio meincnodau mewnol ond yn methu yn y maes.
Faint o arddangosiadau dynol sydd eu hangen ar dîm humanoid fel arfer?
Fel arfer, mae angen rhwng ychydig gannoedd a sawl miliwn o arddangosiadau ar dîm humanoid, yn dibynnu ar gymhlethdod y dasg, gofynion deheurwydd, ac ymgorfforiad. Mae hyfforddiant arddull sylfaen yn disgwyl miliynau o benodau; gall mireinio wedi'i dargedu ar gyfer tasg benodol redeg ar ychydig filoedd o arddangosiadau o ansawdd uchel ynghyd â chyfarwyddiadau iaith cryf a sylw ar yr achosion ymylol.
Pa gywirdeb anodiadau sy'n dderbyniol ar gyfer data hyfforddi humanoid?
Mae cywirdeb derbyniol yn dibynnu ar yr haen. Yn aml, mae labeli canfod gwrthrychau yn dal cytundeb rhyng-anodyddion uwchlaw 95%, tra bod labeli gweithredu a thrawiad yn gofyn am oddefiadau tynnach ar bwyntiau cyswllt ac enydau gafael. Mae'r rhan fwyaf o dimau cynhyrchu yn gosod trothwyon derbyn fesul haen ac yn defnyddio calibradu set aur ynghyd ag adolygiad consensws i gynnal cysondeb ar draws anodyddion.
A all data synthetig ddisodli arddangosiadau dynolryw yn y byd go iawn?
Ni all data synthetig ddisodli arddangosiadau yn y byd go iawn yn llawn, ond gall eu mwyhau. Mae efelychu yn ardderchog ar gyfer graddio digwyddiadau prin a rhoi golygfeydd ar hap. Mae data byd go iawn yn dal i angori trosglwyddo rhwng efelychwyr, yn enwedig ar gyfer deinameg cyswllt a rhyngweithio rhwng pobl a robotiaid. Mae'r rhan fwyaf o biblinellau cynhyrchu yn cyfuno'r ddau, gyda meincnodau wedi'u paru i fonitro'r bwlch.
Pa ddulliau synhwyrydd sydd bwysicaf ar gyfer modelau sylfaen humanoid?
Mae'r dulliau synhwyrydd sydd bwysicaf yn cynnwys camerâu RGB cydamserol, synwyryddion dyfnder, IMU, olrhain llaw a llygaid, a darlleniadau grym neu dorc. Mae sain yn ychwanegu cyd-destun ar gyfer tasgau dilyn cyfarwyddiadau. Y manylyn hollbwysig yw cydamseru amser ar draws pob sianel gyda metadata calibradu, gan fod ffrydiau heb eu cydamseru yn torri aliniad model i lawr yr afon.
Sut ddylai timau werthuso partner data humanoid?
Mae gwerthuso partner data humanoid yn gweithio ar draws pedwar echelin: lled casglu, dyfnder anodiadau, seilwaith ansawdd, ac ystum cydymffurfio. Chwiliwch am gasglu amlfoddol profedig ar draws amgylcheddau amrywiol, piblinellau sicrhau ansawdd strwythuredig, ardystiadau ISO 27001 ac SOC 2, a fframweithiau caniatâd a tharddiad penodol. Anaml y bydd gwerthwyr sy'n trin data fel llafur a gafwyd gan y dorf yn bodloni gofynion gradd defnyddio.


