Dokument s názvom „Towards safety cases for frontier AI training“ opisuje takzvané bezpečnostné prípady, teda štruktúrované, dôkazmi podložené argumenty o rizikách, aké sa používajú v letectve alebo jadrovej energetike. OpenAI ich označuje za „cieľ, ku ktorému smerujeme“ a priznáva, že pri AI modeloch ich bude ťažšie spraviť rovnako prísne kvôli rýchlemu rastu schopností. Ide o skoré odporúčania, ktoré sa podľa firmy budú vyvíjať, a o výzvu na spätnú väzbu od komunity. Text sa týka len trénovania metódou posilňovaného učenia, nasadenie modelov si vyžaduje širší okruh kritérií.
Technická časť stojí na troch pilieroch. Prvý je zosúladenie modelu s ľudskými zámermi: kontrola tréningových prostredí, aby model nebol odmeňovaný za obchádzanie pravidiel, priebežné testy nesúladu a zákaz, aby automatické hodnotenie videlo model „myšlienkový postup“, čím sa má zabrániť tomu, aby sa model naučil skrývať pred monitormi. Druhý je izolácia, teda zabezpečenie prostredia, v ktorom model beží, testy prieniku a nemeniteľné záznamy priebehu. Tretí je monitorovanie s pevnými časovými lehotami na reakciu, vrátane automatického pozastavenia behu, ak nikto neodpovie na upozornenie.
Organizačné zásady zahŕňajú „nesúhlasné stanoviská“ od členov iných tímov, schválenie vedením s právom veta, zodpovednosť vedúceho behu vrátane hodnotenia jeho výkonu a možnosť rýchleho pozastavenia. Systémy majú byť „fail closed“, teda nemalo by byť možné spustiť beh bez zapnutého monitoringu. Osobitná časť sa venuje vyšetrovaniu incidentov nesúladu: hľadanie príčin, poučenie a zverejnenie výsledkov po skončení vyšetrovania. OpenAI píše, že tieto zásady sa práve zavádzajú do praxe.
Oznámenie prichádza po sérii udalostí. OpenAI v auguste pozastavilo časť trénovania po pozorovaní „rôznych stupňov nesúladu“ v ešte nevydaných modeloch, čo šéf Sam Altman potvrdil, a 16. septembra zverejnilo rámec pre hlásenie takýchto prípadov. Dokument sám tieto udalosti nespomína, ide o kontext z ďalších zdrojov. Pre bežných používateľov AI nástrojov to znamená, že jedna z najväčších firiem v odbore verejne priznáva, že bezpečnostné pravidlá sa musia sprísniť skôr, než sa modely stanú ešte schopnejšími. Ide však o samoregulačné odporúčania firmy, nie o záväzný štandard, a ich skutočný dopad ukáže až prax.
