Grok 3 Hands-On: xAI nousee pelottavaksi haastajaksi OpenAI:lle

Grok 3 Hands-On: xAI nousee pelottavaksi haastajaksi OpenAI:lle

Elon Muskin Xai on odottanut Googlea, antropisia ja Deepseekiä haastaa Openain, Elon Muskin Xai on noussut nopeasti sen lähimpänä kilpailijana tällä viikolla. Tällaisessa lyhyessä jaksossa Xai on kehittänyt Grok 3 -mallin esittäen vaikuttavia vertailuarvioita. Joten teimme syvän sukelluksen ja testasimme Grok 3: ta perus- ja päättelymallit monilla monimutkaisilla kehotuksilla, ja se, mitä löysimme, oli todella yllättävää.

Perustelukyselyt Grok 3: ssa

Aloin testata GROK 3: n päättelymallia suositulla mansikkakysymyksellä, ja se vastasi oikein, että niitä on Kolme R: tä sanalla mansikka Kun ajattelin 15 sekuntia. Heitin toisen sanan ”Lollapalooza” ja pyysin sitä laskemaan L: n lukumäärän ja se vastasi 4: llä, mikä on oikein.

Seuraavaksi kysyin Grok 3: ta, mikä luku on suurempi – 9,11 tai 9,9. Jälleen Grok 3 ajatteli 8 sekuntia ja keksi oikean vastauksen. Itse asiassa Grok 3 -malli suunnitteli useita matemaattisia menetelmiä lopputuloksen tarkistamiseksi, mikä oli vaikuttavaa.

Sen jälkeen poseeroin tämän hiukan kääntyneen palapelin GROK 3: lle väärinkäytökseksi. Aikaisemmassa vertailessani ChatgPT O1: n ja Deepseek R1: n välillä molemmat mallit saivat vastauksen väärin ja sanoivat, että kirurgi oli pojan äiti. Jopa viimeisin Openai O3-Mini-High saa vastauksen väärin, jättäen täysin huomiotta sen tosiasian, että se on selvästi ilmoitettu, että kirurgi on pojan isä.

The surgeon, who is the boy's father, says "I cannot operate on this boy, he's my son!" Who is the surgeon to the boy?

Lopuksi, Grok 3: n päättelymalli ajatteli 35 sekunnin ajan ja sanoi, että kirurgi on pojan isä, joka on oikea. Rakastin Grok 3: ssa, että se perusteltiin: ”On mahdollista testaammeko sen. Mutta pelkästään tekstin perusteella suhde on nimenomainen.”Se ajatteli myös ääneen,”Ei toiminnan mainitseminen voi olla konteksti tai a punainen silli.

Lue myös:

Gemini 2.0 Flash -ajattelu vs. chatgpt o1: Openai ajattelee syvempää

Grok 3 on ainoa päättelymalli, joka saa vastauksen oikealle, Gemini 2.0 Flashin lisäksi. Se ei ollut väärin, eikä yrittänyt loputtomasti löytää käänne ja luoda jotenkin uusi suhde.

Testaus hämärässä Kreikan kysymyksessä Grok 3: sta
In Greek mythology, who was Jason's maternal great-grandfather?

Viimeiseksi esitin kysymyksen ihmiskunnan viimeisestä tentistä (Kuhluta), ja Grok 3: n päättelymalli otti sen vain 47 sekunnissa. Aikaisemmin vain O3-Mini-High on pystynyt saamaan vastauksen oikein minuutissa ja 25 sekunnissa. Jopa Deepseek R1 ei löytänyt vastausta oikein. Sanoisin, että tällä hetkellä Grok 3: lla on paras päättelymalli, ja se ylittää Openain O3-mini-High, O1 ja Deepseek R1.

Grok 3: n koodaussuorituskyky

Grok 3: n koodauskyvyn testaamiseksi pyysin perustelumallia kirjoittamaan Python -ohjelman, joka näyttää pallon, joka pomppii kuusikulmion sisällä. Pohjimmiltaan pallon tulisi noudattaa fysiikan periaatteita ja pomppia luonnollisesti.

Grok 3 ajatteli yli minuutin ja loi Python -koodin. Suoritin koodin tietokoneellani, ja pallo epäonnistui pomppia. Se vain hyppäsi kuusikulmion ulkopuolelle. Oli melko yllättävää, kun otetaan huomioon, että Grok 3: n päättelymalli saavutti loistavan pistemäärän Livecodebench -vertailuarvolla.

Write a Python program that shows a ball bouncing inside a spinning hexagon. The ball should be affected by gravity and friction, and it must bounce off the rotating walls realistically
Grok 3 Genered Python -ohjelma, jossa pallo pyörii kuusikulmiossa

Joten pyysin ei-perimäistä Base Grok 3 -mallia saman python-koodin luomiseksi. Yllättäen se toimi ensimmäisen kokeilun parissa ja pallo palautui suurella tarkkuudella. Pallo seurasi luonnollista polkua ja simuloi pallon liikettä täydellisesti. Ehkä päättelymalli ylitti ongelman, mikä johti häiriöön törmäyksen havaitsemisfunktiossa.

Lue myös:

Mikä on kohdistin AI, ChatgPT -korvaaminen koodaamiseen

Sanoisin, että Base Grok 3 -sarjaton malli on Kiinteä koodaustehtäviin. Tämä on kuitenkin yksi monista testeistä, ja sinun on käytettävä koodipohjaasi sekä perusteluja että ei-kohtuuttomia malleja tarkistaaksesi kumpi toimii paremmin.

Grok 3: n DeepSearch AI -agentti

Xai on myös julkaissut uuden AI -agentin nimeltä “Syvennys”Rakennettu Grok 3 -malliin. Se on samanlainen kuin Openain syvä tutkimusagentti, joka on rakennettu koko O3 -malliin, joka selaa verkossa, tekee tutkimusta ja tuottaa kattavan raportin 5-30 minuutissa. Grok 3: n DeepSearch vie kuitenkin vain muutaman minuutin.

DeepSearch AI -agentin testaaminen GROK 3: ta käyttämällä

Joten pyysin Grok 3 DeepSearch AI -agenttia tutkimaan ”Kuinka AI muuntaa sirujen suunnitteluprosessin?” Se aloitti ajatteluprosessin ja käytti useita verkkosivuja, mukaan lukien IEEE: n, ACM: n ja muun tieteelliset paperit. Yli minuutti DeepSearch AI -agentti tuotti 1300-sanan raportin, joka sisälsi linja-viittaukset, taulukot ja avainkohdat.

DeepSearch AI -agentin testaaminen GROK 3: ta käyttämällä

Vaikka raportti selitti NVIDIA: n RL-piirit ja Intelin Floorset-tietojoukko AI-käyttöisen sirujen suunnitteluprosessia varten, se ei täysin maininnut Googlea Alfachip Kehys sirun pohjasuunnitelmien luomiseen. Loppuraportti on samanlainen kuin Perplexity’n uusi syvä tutkimustyökalu. Molemmat työkalut ovat nopeita, mutta kiiltävät paljon viimeaikaisia ​​edistysaskeleita.

Grok 3: n poliittinen puolueellisuus

XAI: n omistaja Elon Musk on jatkuvasti kritisoinut ChatgPT: tä heräämisestä ja vasemmistolaisesta puolueellisuudesta. Huhtikuussa 2024 Musk ilmoitti aikovansa luoda totuuden ja kehittää ”maksimaalinen totuuden etsivä AI”.

Juuri ennen Grok 3 -laukaisua, Musk yhteinen GROK 3 -mallin vastaus, joka kutsuu mediapistettä ”roskaa”. Monien mielestä Grok 3 -malli olisi poliittisesti konservatiivinen ja nojaa oikealle.

Grok 3 poliittisissa kysymyksissä

Kuitenkin testauksessa, Grok 3 on mahdollisimman poliittisesti neutraali. Jopa sen jälkeen, kun Grok 3 on ajautunut asenteeseen aiheeseen, se selittää eron ja jättää sen käyttäjän mieltymykseen ja harkintaan. Politiikan ulkopuolella, jopa sosiaalisissa kysymyksissä, kuten transseksuaalien oikeudet, DEI -ohjelmat, maahanmuutto ja myöntävä toiminta – aiheita, joita Musk on avoimesti kritisoinut – Grok 3 ylläpitää neutraalia asemaansa.

grok 3 tuottavat vitsejä poliittisista henkilöistä

Mielenkiintoista on, että Grok 3 ei vältä vitsailua omistajastaan ​​Elon Muskista ja nykyisestä Yhdysvaltain presidentistä Donald Trumpista.

Grok 3: n turvallisuuskaiteet

Kun testasin Grok 2: ta viime vuonna, se oli suurelta osin sensuroimaton ja siinä ei ollut turvasuojakaiteita. Grok 2 sai järkyttelevästi sähköpostin huijaus ihmisille. GROK 3: lla on kuitenkin paljon parempia turvallisuuskaiteet, mikä on hyvä uutinen AI -turvallisuudelle. Jos kehottelet Grok 3: ta jollain haitallisella, siinä mainitaan: ”En voi auttaa millä tahansa, jonka tarkoituksena on vahingoittaa tai pettää muita.”

grok 3 haitallisista kehotuksista

Mitä tulee AI -kuvan luomiseen, Grok.com -sivuston nykyinen Grok -kuvan generaattori ei tuota kuvia ollenkaan. X: llä se kuitenkin tuottaa edelleen kuvia julkisista hahmoista ja kuuluisuuksista ilman turvapaketteja, mikä on huolestuttavaa. Sen voimaa Xaiin sisäinen Aurora Kuvanmuodostusmalli.

Grok 3: Varhainen tuomio

Xai on julkaissut sekä suuremman Grok 3 -alustan että päättelemallit, ja arvioidessani ne molemmat ovat Frontier AI -malleja, jotka ovat lähellä koko OpenAi O3 -mallia. Openai on toistaiseksi julkaissut vain O3-MINI- ja O3-MINI-HIGH: n, täyden O3-mallin lisäksi, joka saa syvän tutkimuksen AI-agentin.

Varhaisen testaukseni perusteella voin sanoa, että GROK 3: n päättelymalli ylittää (tai ainakin vastaavat) kaikki käytettävissä olevat mallit, mukaan lukien OpenAi O3-Mini ja Deepseek R1. Tämä tuomio perustuu tietysti tavanomaiseen ”ajatteluun”. XAI: lla on ”iso aivo” -asetus GROK 3: n päättelymallille, joka käyttää enemmän laskentaa ajattelemaan pidempään. Se on Supergrok -tilaajien saatavilla.

Sen Base Grok 3 -suojattu malli on myös kykenevämpi kuin GPT-4O, Claude 3.5 Sonet ja Gemini 2.0 Pro, josta tulee vankka vaihtoehto chatgPT: lle. Ehkä koodaustehtävissä Claude 3.5 Sonnet voi silti voittaa, mutta aukko kutistuu merkittävästi.

Muskin johtama Xai on tehnyt valtavan työn kehittäessään voimakkaan esikoulutetun GROK 3 -mallin ja päätelmän skaalatun päättelymallin. Nyt meidän on odotettava Openain GPT-4.5- ja GPT-5-malleja, jotka on tarkoitus julkaista tulevina viikkoina ja kuukausina.

Mutta tällä hetkellä Xai on seisonut haastaakseen Openain määräävän aseman AI -tilassa. Oikeudellisen taistelun lisäksi Elon Muskin ja Sam Altmanin välinen taistelu raivoaa.

Tue työtämme ❤️

Jos pidit tästä artikkelista, harkitse tipin antamista, jotta voimme jatkaa laadukkaan sisällön julkaisemista.

Turvallinen maksu PayPalilla
Moyens I/O Staff on motivoinut sinua antamalla neuvoja tekniikasta, henkilökohtaisesta kehityksestä, elämäntavoista ja strategioista, jotka auttavat sinua.