Googlen tutkijaryhmä yhdisti luonnollisen kielen käsittelyn ja tietokonenäön voimat kehittääkseen uudenlaisen robottinavigointitavan osana uusi tutkimus julkaistiin keskiviikkona.
Pohjimmiltaan tiimi päätti opettaa robotille – tässä tapauksessa Everyday Robotille – kuinka navigoida sisätilassa käyttämällä luonnollisen kielen ohjeita ja visuaalisia syötteitä. Robottinavigointi edellytti tutkijoita paitsi kartoittaa ympäristö etukäteen, mutta myös tarjota tiettyjä fyysisiä koordinaatteja tilassa ohjaamaan konetta. Vision Language -navigoinnin viimeaikaiset edistysaskeleet ovat antaneet käyttäjille mahdollisuuden yksinkertaisesti antaa roboteille luonnollisen kielen komentoja, kuten ”siirry työpenkkiin”. Googlen tutkijat vievät tätä konseptia pidemmälle sisällyttämällä siihen multimodaalisia ominaisuuksia, jotta robotti voi hyväksyä luonnollisen kielen ja kuvan ohjeet samanaikaisesti.
Esimerkiksi varastossa oleva käyttäjä voisi näyttää robotille tuotteen ja kysyä: ”Mille hyllylle tämä menee?” Gemini 1.5 Pron tehoa hyödyntäen tekoäly tulkitsee sekä puhutun kysymyksen että visuaalisen tiedon muodostaakseen vastauksen lisäksi myös navigointipolun, joka johtaa käyttäjän oikeaan paikkaan varastokerroksessa. Robotteja testattiin myös komennoilla, kuten ”Vie minut neuvotteluhuoneeseen, jossa on pariovet”, ”Mistä voin lainata käsien desinfiointiaine” ja ”Haluan tallentaa jotain poissa näkyvistä yleisöltä. Minne minun pitäisi mennä?”
Tai yllä olevassa Instagram-rullassa tutkija aktivoi järjestelmän ”OK-robotilla” ennen kuin pyytää, että hänet johdetaan jonnekin, jossa ”hän voi piirtää”. Robotti vastaa: ”Anna minulle hetki. Thinking with Gemini…” ennen kuin lähdet reippaasti läpi 9 000 neliöjalan DeepMind-toimiston etsimään suurta seinään kiinnitettävää taulua.
Ollakseni rehellinen, nämä uraauurtavat robotit tunsivat jo toimistotilan pohjaratkaisun. Ryhmä käytti tekniikkaa, joka tunnetaan nimellä ”Multimodal Instruction Navigation with demonstration Tours (MINT).” Tämä sisälsi, että tiimi ohjasi ensin manuaalisesti robottia toimistossa ja osoitti tietyt alueet ja ominaisuudet luonnollisella kielellä, vaikka sama vaikutus voidaan saavuttaa yksinkertaisesti tallentamalla video tilasta älypuhelimella. Sieltä tekoäly luo topologisen kaavion, jossa se sovittaa kameransa näkemään esittelyvideon ”maalikehyksen”.
Tämän jälkeen tiimi käyttää hierarkkista Vision-Language-Action (VLA) -navigointikäytäntöä, joka ”yhdistää ympäristön ymmärtämisen ja terveen järjen päättelyn”, opastaakseen tekoälyä kuinka muuntaa käyttäjien pyynnöt navigointitoimiksi.
Tulokset olivat erittäin onnistuneita, kun robotit saavuttivat ”86 prosentin ja 90 prosentin päästä-päähän onnistumisasteet aiemmin mahdottomissa navigointitehtävissä, jotka sisälsivät monimutkaisia päätelmiä ja multimodaalisia käyttäjän ohjeita suuressa todellisessa ympäristössä”, tutkijat kirjoittivat.
He kuitenkin tunnustavat, että parantamisen varaa on vielä, ja huomauttavat, että robotti ei voi (vielä) suorittaa itsenäisesti omaa esittelykierrosta, ja huomauttavat, että tekoälyn epämiellyttävä päättelyaika (kuinka kauan vastauksen muotoileminen kestää) on 10–30 sekuntia. muuttaa vuorovaikutuksen järjestelmän kanssa kärsivällisyyden tutkimukseksi.
Tue työtämme ❤️
Jos pidit tästä artikkelista, harkitse tipin antamista, jotta voimme jatkaa laadukkaan sisällön julkaisemista.