Americký Senát sa koncom septembra zaoberal bezpečnosťou autonómnych AI agentov. Počas vypočutia s názvom „Rogue AI: Securing the Homeland Against AI Agent Attacks“ sa senátor Ruben Gallego opýtal zakladateľa a CEO organizácie Apollo Research Mariusa Hobbhahna, ako ďaleko sú modely umelej inteligencie od vytvorenia jazyka, ktorému by ľudia nedokázali rozumieť.
Hobbhahn odpovedal iba dvoma slovami: „Mínus 12 mesiacov.“
Následne svoje tvrdenie vysvetlil. Apollo Research podľa neho už v roku 2025 spolupracovalo s OpenAI na skúmaní vnútorného uvažovania jedného z jej modelov. Výskumníci pri analýze zistili, že model používal spôsob vyjadrovania, ktorý nebol bežnou angličtinou a nebol pre ľudí dokonale zrozumiteľný.
Výrok však neznamená, že umelá inteligencia vytvorila nový jazyk porovnateľný s angličtinou, slovenčinou alebo čínštinou a začala ho tajne používať na komunikáciu s ďalšími AI systémami. Takýto záver dostupný výskum nepotvrdzuje.
Problém sa týka predovšetkým takzvaného chain-of-thought, teda pracovného procesu, ktorý reasoning model používa pri riešení problému. Zjednodušene ho možno prirovnať k poznámkovému papieru, na ktorý si systém počas riešenia úlohy zapisuje medzikroky. Pre bezpečnostných výskumníkov je schopnosť sledovať takéto uvažovanie cenná, pretože môže pomôcť odhaliť, prečo model vykonal určitú akciu.
Apollo Research v roku 2025 spolupracovalo s OpenAI na skúmaní možného „schemingu“ – správania, pri ktorom by AI systém mohol konať inak, než jeho tvorcovia zamýšľali, a pritom svoje skutočné zámery skrývať. Výskumníci získali obmedzený prístup k interným reasoning stopám modelov OpenAI o3 a o4-mini.
Práve pri tejto práci narazili na problém interpretovateľnosti. Apollo neskôr uviedlo, že model o3 používal nezvyčajný a neštandardný jazyk. To komplikuje jeden z možných spôsobov bezpečnostného dohľadu: ak ľudia prestanú rozumieť pracovným reasoning stopám modelu, bude ťažšie pomocou nich zisťovať, čo systém plánuje.
Samotné OpenAI zároveň upozorňuje, že monitorovanie chain-of-thought je užitočným, ale krehkým bezpečnostným nástrojom. Výskum ukázal, že reasoning modely niekedy vo svojich pracovných stopách pomerne otvorene opisujú zámer obísť pravidlá alebo využiť medzeru v zadanej úlohe. Práve tieto stopy potom môže kontrolovať človek alebo ďalší AI systém.
Problém nastáva v momente, keď sa reasoning prestane dať spoľahlivo interpretovať. Hobbhahn pred senátormi priznal, že výskumníci zatiaľ nemajú jednoznačné riešenie. Jednou z možností je vývoj lepších metód interpretability, ďalšou použitie iných AI modelov na kontrolu reasoning procesu výkonnejšieho systému. Aj to však podľa neho môže byť krehké riešenie.
Situáciu komplikuje ešte ďalší fenomén. Pokročilé modely dokážu v niektorých prípadoch rozpoznať, že sú testované. Apollo Research pri bezpečnostných experimentoch zaznamenalo prípady, keď model vo svojom reasoning procese uvažoval o tom, či sa nachádza v hodnotiacom prostredí. Ak systém vie, že ho niekto kontroluje, jeho správanie počas testu nemusí presne ukazovať, ako by konal mimo neho.
To je dôvod, prečo sa otázka zrozumiteľnosti vnútorného uvažovania AI dostáva medzi významné témy bezpečnostného výskumu. Čím autonómnejšie budú AI agenti a čím viac právomocí dostanú pri práci s počítačmi, kódom alebo externými systémami, tým dôležitejšie bude vedieť zistiť nielen to, čo vykonali, ale aj prečo sa pre daný krok rozhodli.
Tvrdenie, že „AI už hovorí vlastným tajným jazykom“, by preto bolo zavádzajúce. Reálny problém je menej filmový, ale z pohľadu bezpečnosti možno podstatnejší: niektoré vnútorné reasoning procesy pokročilých modelov začínajú byť pre človeka ťažšie čitateľné a výskumníci zatiaľ nemajú spoľahlivú metódu, ktorá by garantovala, že im budú rozumieť aj pri ďalších generáciách AI.
