Mae'r newid o robotiaid sgwrsio i robotiaid sy'n dilyn gorchmynion iaith naturiol yn rhedeg trwy un dosbarth o fodelau. Mae modelau VLA — modelau gweledigaeth-iaith-gweithredu — yn cyfuno canfyddiad gweledol, dealltwriaeth iaith, a chynhyrchu gweithredoedd mewn un rhwydwaith niwral. Mae eu pŵer yn real, ond mae'n dibynnu bron yn gyfan gwbl ar y data hyfforddi maen nhw'n ei lyncu. Mae'r canllaw hwn yn esbonio beth sydd mewn gwirionedd mewn data hyfforddi VLA, beth mae timau'n ei danamcangyfrif, a sut i gynllunio set ddata sy'n cynhyrchu model sy'n werth ei ddefnyddio.
Siop Cludfwyd Allweddol
- Mae modelau VLA yn mapio mewnbynnau gweledigaeth ac iaith yn uniongyrchol i weithredoedd robotiaid mewn un rhwydwaith.
- Rhaid i ddata hyfforddi gynnwys arsylwadau gweledol cydamserol, cyfarwyddiadau iaith, a gweithredoedd.
- Mae angen data arddangos ar raddfa fawr ar docynnau gweithredu ar wahân i ddysgu'n dda.
- Mae fideo dynol egocentrig yn cael ei gloddio fwyfwy fel ffynhonnell cyn-hyfforddi VLA cost isel.
- Mae penodau gwerthuso cadarn yr un mor bwysig â data hyfforddi ar gyfer defnydd dibynadwy.
- Mae mireinio VLA yn llwyddo neu'n methu ar drylwyredd anodiadau, nid cyfaint crai yn unig.
Beth yw model VLA?
Mae model VLA yn fodel sylfaen robotig sy'n cymryd delweddau a chyfarwyddiadau iaith naturiol fel mewnbwn ac yn allbynnu gweithredoedd robot. Yn wahanol i biblinellau traddodiadol sy'n gwahanu canfyddiad, cynllunio a rheolaeth i wahanol fodiwlau, mae modelau gweledigaeth-iaith-gweithredu yn dysgu mapio o'r dechrau i'r diwedd mewn un rhwydwaith.
Model VLA: Rhwydwaith niwral sy'n cymryd arsylwadau gweledol cydamserol a chyfarwyddiadau iaith naturiol ac yn cynhyrchu dilyniannau o gamau gweithredu robot neu docynnau gweithredu.
Mae'r dyluniad unedig hwn yn caniatáu i fodelau VLA etifeddu galluoedd rhesymu o rag-hyfforddiant iaith-weledigaeth mawr a'u hymestyn gyda rheolaeth echddygol. Ar gyfer defnydd, mae hynny'n golygu y gall un model mewn egwyddor gyflawni llawer o dasgau - ond dim ond os yw ei ddata hyfforddi yn eu cwmpasu gyda'r strwythur cywir.
Beth sydd mewn gwirionedd yn y data hyfforddi VLA?
Mae data hyfforddi VLA yn cynnwys pedwar cynhwysyn craidd fesul pennod: arsylwadau gweledol, cyfarwyddyd iaith naturiol, trywydd gweithredu, a label llwyddiant neu fethiant. O amgylch y rhain, mae timau'n ychwanegu stampiau amser, cyflwr proprioceptive, a marcwyr gwerthuso.
Y pedwar haen orfodol:
- Sylwadau gweledol — Fframiau RGB, yn aml wedi'u paru â golygfeydd dyfnder neu gamera arddwrn.
- Cyfarwyddiadau iaith — gorchmynion cryno mewn iaith naturiol fel “tywallt dŵr i’r cwpan.”
- Llwybrau gweithredu — dilyniannau gweithredu discreteiddiedig neu barhaus wedi'u mapio i raddau rhyddid robotiaid.
- Labeli canlyniad — marcwyr llwyddiant, methiant, neu gwblhau rhannol penodol fesul pennod.
Hyfforddwyd model VLA agored 7 biliwn o baramedrau ar fwy nag un filiwn o benodau a dynnwyd o 22 o ymgorfforiadau robot (Stanford et al., 2024), gan ddangos yr amrywiaeth a ddisgwylir ar gyfer cyffredinoli traws-dasgau. Heb yr ehangder hwn, mae modelau VLA yn tueddu i gofio gwrthrychau penodol yn hytrach na chyffredinoli.
Pam mae anodi gweithred yn anoddach nag anodi delwedd?
Mae anodi gweithredoedd yn anoddach oherwydd bod gweithredoedd yn byw mewn mannau parhaus, uchel-ddimensiwn ac yn dibynnu ar ymgorfforiad robot, nid dim ond cynnwys ffrâm. Mae labelu blwch ffiniol ar gwpan yn syml; nid yw labelu llwybr sy'n gafael yn y cwpan hwnnw'n llwyddiannus gyda gafaelwr penodol mewn pwynt cyswllt penodol.
Tocyn gweithredu: Cynrychiolaeth ddisgreteiddiedig o symudiad robot neu ddadleoliad effeithydd terfynol y gall model VLA ei ragweld fel tocyn iaith.
Mae angen i dimau anodi alinio pob tocyn gweithredu â'i arsylwad cydamserol, marcio adegau cyswllt, cipio adferiad methiant, a thagio ffiniau atomig y cyfarwyddyd iaith. Shaip's anodi data Mae llifau gwaith yn ymdrin â hyn ar raddfa fawr, gyda thacsonomegau strwythuredig wedi'u tiwnio i fannau gweithredu robotig a throthwyon derbyn fesul tasg.
Ble mae fideo dynol egocentrig yn ffitio i mewn i hyfforddiant VLA?

Trawsnewidiodd papur diweddar fideos dynol egosentrig heb strwythur yn benodau wedi'u fformatio ar gyfer VLA — 1 miliwn o segmentau a 26 miliwn o fframiau — trwy drin y llaw ddynol fel effeithydd terfynol medrus (Wu et al., arXiv, 2025). Mae'r math hwn o ddata traws-ymgorfforiad bellach yn arferol mewn ryseitiau cyn-hyfforddi VLA.
Y broblem: nid data hyfforddi yw fideo crai. Mae angen segmentu, disgrifiadau iaith, ail-dargedu â llaw, a dilysu ansawdd cyn iddo gyrraedd piblinell VLA. Shaip's AI Corfforol Mae gweithrediadau data yn cynnwys cipio egocentrig, trosi real2sim, ac anodiad wedi'i alinio â VLA mewn un dosbarthiad.
Sut ydych chi'n adeiladu setiau gwerthuso sy'n dal moddau methiant VLA?
Mae setiau gwerthuso yn dal moddau methiant VLA pan gânt eu cynllunio cyn hyfforddiant, nid ar ôl hynny. Mae tri strwythur bwysicaf: meincnodau llwyddiant o fewn y dosbarthiad, chwiliedyddion cyffredinoli y tu allan i'r dosbarthiad, a senarios diogelwch haenedig o risg.
Dychmygwch fodel VLA cartref sydd wedi'i hyfforddi'n helaeth ar dasgau cegin. Byddai set werthuso resymol yn profi: tasgau hysbys mewn ceginau hysbys (dosbarthiad mewnol), tasgau hysbys mewn goleuadau anghyfarwydd (OOD ysgafn), gwrthrychau anhysbys gyda chyfarwyddiadau hysbys (cyffredinoli cysyniad), a digwyddiadau prin fel gollyngiadau damweiniol (haen ddiogelwch). Heb bob un, mae'r risg o'i ddefnyddio yn parhau i fod heb ei fesur.
Adnodd niwtral defnyddiol ar gyfer trefnu sylw haen risg yw'r Fframwaith Rheoli Risg AI NIST, sy'n gwahanu haenau effaith mewn ffordd sy'n mapio'n glir ar ddyluniad set gwerthuso.
Data hyfforddi VLA: beth i gyllidebu ar ei gyfer
| haen | Beth mae'n ei gynnwys | Magl cyffredin |
|---|---|---|
| Arsylwadau gweledol | RGB aml-olygfa, dyfnder, camera arddwrn | Stampiau amser ar goll neu heb eu cydamseru |
| iaith | Cyfarwyddiadau, disgrifiadau atomig | Ymadrodd amwys nad yw'n mapio i gamau gweithredu |
| Llwybrau gweithredu | Tocynnau arwahanol neu reolaethau parhaus | Dim aliniad â'r ymgorfforiad robot |
| Gwerthuso | Penodau, chwiliedyddion OOD, haenau diogelwch | Wedi'i gynllunio'n rhy hwyr, ar ôl rhewi'r model |
Casgliad: Mae modelau VLA yn cael eu hennill neu eu colli yn y set ddata
Mae nenfwd model VLA wedi'i osod gan ei ddata hyfforddi — ei led, ei ddyfnder anodi, a'i drylwyredd gwerthuso. Timau sy'n cynllunio'r set ddata fel cynnyrch, nid ôl-ystyriaeth, sy'n mynd ati i'w defnyddio yn gyntaf. Nid yw timau sy'n crafu fideo ac yn gobeithio am allu sy'n dod i'r amlwg fel arfer yn gwneud hynny.
Beth yw'r gwahaniaeth rhwng model VLA a pholisi robotig?
Y gwahaniaeth yw cwmpas. Yn draddodiadol, mae polisi robotig yn mapio arsylwadau i gamau gweithredu ar gyfer un dasg neu deulu tasgau bach. Mae model VLA yn bolisi sylfaen sy'n anelu at ymdrin â llawer o dasgau ar draws llawer o wrthrychau, wedi'u cyflyru gan gyfarwyddiadau iaith naturiol. Mae'r ddau yn bolisïau; modelau VLA yw'r fersiwn gyffredinol sydd wedi'i hyfforddi ar ddata ehangach, wedi'i alinio ag iaith.
Faint o ddata hyfforddi VLA sydd ei angen fel arfer ar gyfer rhediad mireinio?
Mae rhediad mireinio fel arfer yn defnyddio ychydig filoedd i ychydig gannoedd o filoedd o arddangosiadau o ansawdd uchel, yn dibynnu ar gymhlethdod y dasg a chryfder y model sylfaenol. Mae asgwrn cefn VLA wedi'u hyfforddi ymlaen llaw yn lleihau'r gofyniad cyfaint yn sylweddol. Y ffactor pendant yw ansawdd yr anodi a chywirdeb iaith-cyfarwyddyd, nid cyfrif penodau crai yn unig.
Allwch chi hyfforddi model VLA yn gyfan gwbl ar ddata efelychiedig?
Mae hyfforddi model VLA yn gyfan gwbl ar ddata efelychiedig yn bosibl ond anaml y mae'n ddigonol i'w ddefnyddio. Mae efelychu'n trin amrywiaeth a digwyddiadau prin yn dda; mae cipio byd go iawn yn seilio dynameg cyswllt a throsglwyddo rhwng efelychiad a realiti. Mae'r rhan fwyaf o biblinellau cynhyrchu yn cyfuno'r ddau, gyda meincnodau pâr sy'n mesur y bwlch perfformiad rhwng efelychiad a realiti yn benodol.
Pa ddulliau synhwyrydd sydd eu hangen ar ddata hyfforddi VLA?
Mae data hyfforddi VLA angen fideo RGB cydamserol a thrawiad gweithredu o leiaf. Mae piblinellau perfformiad uchel yn ychwanegu dyfnder, golygfeydd camera arddwrn, sain, IMU, a darlleniadau grym neu dorc yn dibynnu ar ddosbarth y dasg. Y manylyn na ellir ei drafod yw cydamseru amser ar draws dulliau - hebddo, mae'r signalau iaith a gweithredu yn symud ar wahân yn ystod hyfforddiant.
Sut ydych chi'n gwerthuso ansawdd set ddata VLA cyn hyfforddi?
Mae gwerthuso set ddata VLA yn gweithio ar draws pedwar gwiriad: cywirdeb aliniad iaith-gweithred, cysondeb segmentu penodau, lled cwmpas gofod gweithredu, a chynrychiolaeth achos ymyl. Adolygiad dynol yn seiliedig ar sampl gyda graddnodi set aur yw'r man cychwyn mwyaf dibynadwy. Mae cytundeb rhyng-anodyddion uwchlaw 95% ar labeli gweithredu yn drothwy cynhyrchu cyffredin.
A yw data hyfforddi VLA yr un peth â data dysgu dynwared?
Mae data hyfforddi VLA yn uwchset o ddata dysgu dynwared. Mae data dysgu dynwared yn canolbwyntio ar barau arsylwi-gweithredu o arddangosiadau. Mae data VLA yn ychwanegu cyfarwyddiadau iaith, strwythur aml-dasg, a sylw traws-ymgorfforiad ar raddfa fawr fel y gall y model gyffredinoli y tu hwnt i lwybrau cofiadwy.




