OpenAI vo svojom oficiálnom blogu 18. augusta 2026 priznalo, že v uplynulých týždňoch dočasne spomalilo škálovanie svojich najpokročilejších modelov. Spoločnosť to zdôvodňuje dvoma súbežnými vývojmi — bezpečnostným incidentom medzi OpenAI a Hugging Face a samostatným predbežným zistením, že jeden z pripravovaných modelov, interne označovaný Astra, môže spĺňať prah „kritických" kybernetických schopností podľa jej vlastného bezpečnostného rámca Preparedness Framework. OpenAI uvádza, že k tomuto zisteniu dospela 7. augusta 2026.
Firma v dôsledku toho zaviedla dvojtýždňovú pauzu v reinforcement learning (RL) tréningu na svojich najnovších modeloch určených na nasadenie, počas ktorej posilňovala zabezpečenie výskumných prostredí a rozširovala pokrytie monitorovacích systémov formou red-teamingu. Najväčší plánovaný frontier RL beh zostáva pozastavený — namiesto neho spoločnosť vykonáva menšie tréningové behy a hodnotenia, aby si overila správanie modelu, validovala bezpečnostné opatrenia a získala viac dôkazov o zarovnaní (alignmente) predtým, než v ňom bude pokračovať.
Bezprostredne po incidente s Hugging Face OpenAI pozastavila frontier model inferenciu vo výskumných clustroch pri behoch, ktoré mohli spúšťať kód alebo používať nástroje s prístupom na internet. Rýchlo obnovila obmedzenejšiu a bezpečnejšiu cestu pre spúšťanie kódu, no jednotlivé pracovné zaťaženia (workloads) postupne prehodnocovala jedno po druhom. Firma zaviedla prísnejšiu izoláciu (sandboxing) pre úlohy spracúvajúce kód generovaný modelom alebo inak nedôveryhodný kód, rozšírila sieťovú izoláciu vysoko rizikových workloadov a investuje do nepretržitého bezpečnostného testovania pomocou vlastných modelov proti simulovaným útokom. Časť tréningových a hodnotiacich úloh pre Astru už tieto nové, najprísnejšie bezpečnostné požiadavky spĺňa, výrazná časť workloadov však zostáva pozastavená, kým sa plne nepresunie do vylepšených prostredí.
Spoločnosť zároveň výrazne rozšírila monitorovací systém na viacstupňový model — od klasifikátorov aktivácie, ktoré kontrolujú vnútornú aktivitu modelu pri každom vzorkovanom tokene, až po sofistikovanejších automatizovaných vyšetrovateľov skúmajúcich akcie s nástrojmi, uvažovanie modelu aj celú postupnosť aktivít kvôli neoprávnenému prístupu, krádeži dát, deštruktívnemu správaniu či pokusom obísť bezpečnostné opatrenia. Cieľom je vydať upozornenie do 30 minút od zachytenia podozrivej aktivity; ak bezpečnostné tímy do 30 minút nedokážu jednoznačne potvrdiť, že ide o falošný poplach, aktivita sa má pozastaviť. Tento monitoring je od 7. augusta povinný pre celú inferenciu Astry pri použití nástrojov, nielen pre RL tréning a hodnotenia. Podľa OpenAI predstavuje táto bezpečnostná réžia približne 20 % výpočtového výkonu, ktorý sa monitoruje.
OpenAI zároveň uvádza, že pri RL behoch na najschopnejších modeloch teraz uplatňuje techniky zarovnania (alignmentu) naprieč väčším počtom fáz tréningu — vrátane vylepšovania odmeňovacích modelov na lepšiu detekciu nebezpečného správania, trénovania modelov na väčšiu úprimnosť o vlastných akciách a schopnostiach a obmedzovania takzvaného reward hackingu, teda hľadania spôsobov, ako získať vysoké skóre v tréningu bez skutočného dosiahnutia zamýšľaného cieľa.
Spoločnosť avizuje, že v nasledujúcich týždňoch zverejní technickú správu s podrobnejšími poznatkami, plánuje tiež ďalej upravovať svoj Preparedness Framework a zapájať do procesu externé organizácie. Presný termín obnovenia plného tréningu ani dátum vydania modelu Astra OpenAI nešpecifikovala.
