Astra Ultrafast je dostupná cez OpenAI API a pre oprávnených používateľov ChatGPT Work a Codex. OpenAI ju predstavilo už 29. septembra spolu s novým plánom Pro 500 za 500 dolárov mesačne. NVIDIA teraz doplnila dôležitý detail: zrýchlená služba je postavená na GPU Blackwell, ktoré patria medzi najvýkonnejšie akcelerátory firmy určené pre generatívnu AI a veľké jazykové modely.
Podľa NVIDIA môže Astra Ultrafast v Codexe dosahovať až osemnásobne vyššiu rýchlosť generovania tokenov než štandardný režim Astra. OpenAI pri API hovorí o zrýchlení až približne šesťnásobne. Tieto čísla však treba chápať ako maximálne hodnoty uvádzané samotnými firmami, nie ako univerzálny výsledok platný pre každú úlohu. Reálna rýchlosť závisí od typu promptu, veľkosti kontextu, používaných nástrojov aj aktuálneho zaťaženia infraštruktúry.
Práve pri AI agentoch môže mať rýchlejšia inference väčší význam než pri obyčajnom chate. Programovací agent napríklad nemusí vytvoriť iba jednu odpoveď. Môže analyzovať projekt, napísať kód, spustiť test, prečítať výsledok, opraviť chybu a celý cyklus niekoľkokrát zopakovať. Ak sa každý takýto krok vykoná podstatne rýchlejšie, rozdiel sa počas jednej komplexnej úlohy postupne násobí.
Blackwell teda v tomto prípade neslúži na vytvorenie inteligentnejšieho modelu, ale najmä na jeho rýchlejšie prevádzkovanie. GPT-6 Astra Ultrafast zostáva podľa OpenAI tým istým základným modelom Astra. Používateľ si nepripláca za nový model s lepšími schopnosťami, ale predovšetkým za vyššiu výpočtovú prioritu, nižšiu latenciu a rýchlejšie generovanie.
NVIDIA zároveň uvádza, že výsledok nie je iba otázkou hrubého výkonu GPU. OpenAI optimalizuje svoj inference softvér priamo pre architektúru Blackwell a využíva vlastné AI modely aj na zlepšovanie kódu, ktorý zabezpečuje beh modelov na GPU. Výkon tak vzniká kombináciou hardvéru a softvérových optimalizácií, nie jednoduchým presunutím rovnakého systému na výkonnejší server.
To ukazuje širší trend v súčasnom vývoji umelej inteligencie. Rozdiel medzi jednotlivými AI službami už neurčuje iba kvalita samotného modelu. Čoraz dôležitejšie je, na akých akcelerátoroch model beží, ako je optimalizovaná pamäť, komunikácia medzi GPU a samotná inference vrstva. Dva prístupy k rovnakému modelu tak môžu používateľovi poskytovať výrazne odlišnú rýchlosť.
Pre NVIDIA ide zároveň o ďalšie potvrdenie významu Blackwellu v infraštruktúre najväčších AI spoločností. Firma svoju novú generáciu GPU stavia nielen ako hardvér na trénovanie stále väčších modelov, ale čoraz viac aj ako platformu pre ich každodennú prevádzku. Práve inference sa s rastúcim počtom používateľov a AI agentov stáva jednou z najnáročnejších a najdrahších častí celého AI ekosystému.
Pre používateľov zostáva hlavnou otázkou cena. Pro 500 stojí 500 dolárov mesačne a je určený predovšetkým ľuďom a firmám, pre ktorých má čas ušetrený pri dlhých agentických úlohách reálnu ekonomickú hodnotu. Pri bežnom chatovaní, písaní textov alebo jednoduchších otázkach nemusí byť rozdiel oproti štandardnému režimu natoľko dôležitý, aby vyššiu cenu ospravedlnil.
Spojenie OpenAI a Blackwellu tak nepredstavuje nový model, ale ukazuje ďalšiu fázu konkurencie v AI. Po období, keď sa pozornosť sústreďovala najmä na to, ktorý model je inteligentnejší, sa čoraz viac bojuje aj o to, kto dokáže rovnakú inteligenciu doručiť používateľovi rýchlejšie. Pri nástupe autonómnejších agentov môže byť práve rýchlosť inference jednou z hlavných konkurenčných výhod.
