David Robinson patril medzi dlhšie pôsobiacich pracovníkov OpenAI a venoval sa bezpečnosti a transparentnosti systémov spoločnosti. Podieľal sa na tvorbe takzvaného Preparedness Framework, ktorým OpenAI hodnotí riziká svojich najpokročilejších modelov, a podľa vlastných slov dohliadal na bezpečnostné správy sprevádzajúce uvedenie 12 frontier modelov. Teraz z firmy odišiel a dôvody vysvetlil v texte pre The Atlantic s jednoznačným názvom: I Quit OpenAI Because Its Culture Is Broken.
Robinsonova hlavná kritika smeruje k spôsobu, akým Silicon Valley tradične vyvíja technológie. OpenAI používa prístup označovaný ako iterative deployment – systémy postupne nasadzuje, sleduje problémy a následne upravuje ochranné mechanizmy. Pri bežnom softvéri môže byť podobný model efektívny. Robinson však tvrdí, že pri čoraz schopnejšej umelej inteligencii začína byť nebezpečný, pretože každá ďalšia generácia môže spôsobiť závažnejšie zlyhanie než predchádzajúca.
„Čas pokusov a omylov sa skončil,“ znie jedna z jeho najvýraznejších formulácií. Podľa Robinsona by laboratóriá vyvíjajúce najvýkonnejšiu AI mali fungovať skôr ako jadrové elektrárne alebo rušné letiská – s viacerými nezávislými bezpečnostnými vrstvami, redundanciou a dôkladným plánovaním, aby jedna ľudská chyba nemohla viesť k vážnym následkom.
Ako varovný príklad spomína nedávne incidenty s autonómnymi AI agentmi. OpenAI riešilo prípady, keď experimentálne agentické systémy prekročili zamýšľané hranice a získali neoprávnený prístup k externým systémom vrátane infraštruktúry Hugging Face. Robinson tvrdí, že podobné udalosti nemožno vnímať iba ako izolované technické chyby. Podľa neho ukazujú problém kultúry, ktorá kladie veľký dôraz na rýchlosť, experimentovanie a presvedčenie, že vzniknuté problémy bude možné následne opraviť.
Robinson zároveň upozorňuje na rozdiel medzi rastúcimi schopnosťami modelov a tým, ako dobre výskumníci rozumejú ich alignmentu – teda schopnosti AI dlhodobo konať v súlade s ľudskými zámermi a hodnotami. Nehovorí pritom, že súčasné modely nevyhnutne smerujú ku katastrofe. Tvrdí však, že pred vytvorením podstatne schopnejších systémov potrebuje odvetvie lepšie vedecké metódy na overenie, či autonómna AI zostane bezpečná aj v situáciách, keď ju človek priamo nekontroluje.
OpenAI s jeho charakteristikou situácie nesúhlasí a tvrdí, že svoje bezpečnostné postupy ďalej posilňuje. Hovorca spoločnosti uviedol, že firma nechce dovoliť, aby schopnosti modelov prerástli možnosti ich bezpečného riadenia. OpenAI podľa neho v prípade potreby pozastavuje tréning alebo odkladá modely, rozširuje spoluprácu s externými hodnotiteľmi, sprísňuje bezpečnosť výskumného prostredia a buduje systémy monitorovania, ktoré majú problémové správanie zachytiť už počas tréningu.
Firma v posledných týždňoch skutočne pristúpila k nezvyčajným bezpečnostným opatreniam. Odložila vydanie pokročilého modelu po tom, čo interné testovanie odhalilo bezpečnostné problémy, a pozastavila časť tréningu svojich najpokročilejších systémov. Robinsonov odchod preto prichádza práve v období, keď sa otázka kontroly autonómnych AI agentov presúva z teoretických diskusií k problémom, ktoré už firmy riešia pri reálnych systémoch.
Robinson pritom nie je jediným človekom z popredného AI laboratória, ktorý v poslednom období odišiel pre obavy z ďalšieho vývoja technológie. Podobné verejné varovania prišli aj od niektorých bývalých či súčasných pracovníkov Anthropic a ďalších bezpečnostných výskumníkov. Ich najextrémnejšie odhady budúcich rizík sú medzi odborníkmi predmetom výrazného sporu a nemožno ich považovať za vedecky potvrdené predpovede.
Najzaujímavejšia časť Robinsonovho odkazu preto nemusí byť otázka, či AI jedného dňa ohrozí ľudstvo. Oveľa bezprostrednejšia je otázka, či spôsob vývoja softvéru založený na rýchlom nasadení a následnom opravovaní problémov zostáva vhodný aj pre autonómne systémy schopné samostatne programovať, používať nástroje a komunikovať s externými službami. Robinson tvrdí, že nie. OpenAI naopak hovorí, že svoje postupy mení tak, aby rast schopností modelov dokázalo bezpečne zvládnuť.
