Spoločnosť xAI v pondelok 21. septembra oficiálne uviedla Grok 4.7, nový model umelej inteligencie zameraný najmä na programovanie, profesionálnu prácu s informáciami a dlhšie viacstupňové úlohy. Firma ho označuje za svoj doteraz najvýkonnejší model pre coding a knowledge work a tvrdí, že oproti Groku 4.6 dokáže dlhšie pracovať na komplikovaných problémoch, dôkladnejšie kontrolovať vlastné výsledky a lepšie zvládať rozsiahly kontext.
Novinka používa podľa xAI nový a väčší základný model než Grok 4.6 a počas tréningu prešla dlhším reinforcement learning procesom na náročnejšej sade úloh. Väčší dôraz bol kladený na problémy, ktorých riešenie môže trvať celé hodiny, nie iba na krátke otázky a odpovede. Decrypt uvádza, že model má približne 2,1 bilióna parametrov oproti približne 1,5 bilióna pri Groku 4.6, čo by predstavovalo nárast približne o 40 percent.
xAI sa pri Groku 4.7 zameralo aj na praktické programovanie. Model má lepšie pracovať v prostrediach, kde musí samostatne analyzovať kód, upravovať viacero súborov a pokračovať v dlhších úlohách bez neustáleho zásahu používateľa. V benchmarku CursorBench 4.0 ho xAI prezentuje ako konkurencieschopný najmä pomerom medzi cenou a výkonom, hoci výsledky zároveň ukazujú, že v absolútnom výkone zostáva v niektorých testoch za najlepšími modelmi konkurencie.
Podobný obraz ukazujú testy profesionálnej znalostnej práce. V GDPval, ktorý skúša úlohy podobné práci právnikov, analytikov alebo finančných profesionálov, dosiahol Grok 4.7 podľa zverejnených výsledkov skóre 1695, zatiaľ čo Claude Fable 5.1 získal 1735. V benchmarku AA Briefcase, ktorý testuje niekoľkohodinové kancelárske úlohy spájajúce výskum, analýzu a tvorbu dokumentov, skončil Grok 4.7 opäť tesne za Fable 5.1. Výsledky teda naznačujú výrazné zlepšenie oproti predchádzajúcej generácii, nie však jednoznačné prvenstvo medzi všetkými frontier modelmi.
Zaujímavou súčasťou vývoja je aj technické a inžinierske zameranie. Decrypt uvádza, že xAI pri tréningu využilo aj doplnkové údaje zo SpaceX, napríklad telemetriu Starlinku, výrobné dáta a záznamy technických porúch. Cieľom má byť lepšie uvažovanie o fyzických systémoch, hardvéri a technických problémoch. Samotné xAI zároveň ukazuje výsledky modelu aj na benchmarkoch z oblasti elektrotechniky a profesionálnej inžinierskej práce.
Firma tvrdí, že výrazne prepracovala aj bezpečnostnú vrstvu. Grok 4.7 má mať doteraz najvyššiu odolnosť xAI voči jailbreakom a lepšie rozlišovať medzi legitímnym bezpečnostným výskumom a nebezpečnými požiadavkami. V oblasti kybernetickej bezpečnosti xAI zároveň poskytuje vybraným partnerom obmedzený prístup k red-team schopnostiam modelu na obranný výskum.
Silnou stránkou Groku 4.7 môže byť cena. API začína na 2 dolároch za milión vstupných tokenov a 6 dolároch za milión výstupných tokenov. xAI ponúka aj rýchlejšiu verziu s približne dvojnásobnou rýchlosťou generovania, ktorá stojí dvojnásobok. Firma tým pokračuje v stratégii, pri ktorej sa nesnaží súťažiť iba absolútnym benchmarkovým výkonom, ale aj cenou a širokou dostupnosťou.
Grok 4.7 je dostupný okamžite v Grok aplikácii, Cursor, Grok Build, cez xAI API a viacero ďalších platforiem. Tentoraz teda nejde o obmedzený test ani čakaciu listinu, ale o reálne verejné vydanie.
Model zároveň prichádza po viacerých posunoch pôvodného termínu. Elon Musk počas posledných týždňov viackrát naznačoval blízke vydanie, no xAI si nakoniec nechalo viac času na dokončenie tréningu. Pred vydaním Musk sám znižoval očakávania a tvrdil, že Grok 4.7 bude približne na úrovni Claude Opus 5.0, pričom ďalšie väčšie skoky očakáva až pri Groku 4.8, 4.9 a neskôr Groku 5.
Grok 4.7 preto nevyzerá ako model, ktorý by jednoznačne prekonal celú konkurenciu vo všetkých oblastiach. Je však ďalším krokom xAI smerom k dlhším autonómnym úlohám, programovaniu a profesionálnej práci, pričom jeho najväčšou konkurenčnou výhodou môže byť kombinácia výkonu, ceny a integrácie do širšieho ekosystému xAI.
