OpenAI zverejnilo podrobnosti o nezvyčajnom spôsobe, akým sa podľa spoločnosti skupina používateľov pokúšala získavať chránené reasoning výstupy jej modelov. Aktivita sa začala 1. júla 2026 v relatívne malom rozsahu, ale 24. a 25. júla prudko vzrástla. Počas týchto dvoch dní OpenAI zaznamenalo približne 16 000 požiadaviek od viac ako 4 000 používateľov, ktoré zodpovedali sledovanému spôsobu extrakcie. V širšom súbore súvisiaceho správania spoločnosť identifikovala viac ako 15 000 používateľov.
Cieľom podľa OpenAI nebolo iba kopírovanie bežných odpovedí modelu. Operátori sa snažili dostať k chránenému internému reasoning procesu, ktorý model používa pri riešení úlohy, ale používateľovi ho štandardne neposkytuje v pôvodnej podobe. Jedna z techník bola mimoriadne zaujímavá: chránené alebo zašifrované reasoning dáta získané v jednej konverzácii boli prenesené do ďalšej konverzácie a model bol následne vyzvaný, aby ich reprodukoval v čitateľnej forme.
OpenAI zdôrazňuje, že nešlo o prelomenie šifrovania, napadnutie databázy ani získanie priameho prístupu k uloženým konverzáciám používateľov. Operátori namiesto toho manipulovali interakcie s modelmi tak, aby bolo možné chránené reasoning výstupy reprodukovať. Spoločnosť tento typ aktivity označuje ako adversarial distillation, teda systematické a neoprávnené používanie výstupov alebo uvažovania jedného modelu na tréning, reprodukciu alebo zlepšovanie iného AI systému.
OpenAI tvrdí, že jadro pozorovanej aktivity dokázalo spojiť s osobami asociovanými so spoločnosťou Moonshot AI, čínskym vývojárom rodiny modelov Kimi. Zároveň však pridáva dôležitú výhradu: nedokáže potvrdiť, že všetci operátori a účty zachytené počas sledovaného obdobia patrili jednému aktérovi. Preto zatiaľ nemožno tvrdiť, že Moonshot AI prevádzkoval celú identifikovanú sieť. Moonshot sa k najnovším tvrdeniam OpenAI podľa dostupných správ bezprostredne verejne nevyjadril.
Zaujímavé je, že Anthropic zverejnil podobné obvinenia už pred OpenAI. Vo svojej septembrovej bezpečnostnej správe tvrdil, že Moonshot presmerovával požiadavky používateľov Kimi na Claude a následne používateľom zobrazoval odpovede Claude, hoci si mysleli, že komunikujú s modelom Kimi. Anthropic uvádza prípad, keď bolo počas desiatich dní takto odoslaných takmer 300 000 požiadaviek cez sieť 5 380 podvodných účtov. Podľa Anthropicu boli minimálne niektoré z týchto interakcií ukladané a využívané na získavanie reasoning dát pre tréning modelov. Ide o tvrdenia Anthropicu a nie o nezávislé zistenie regulačného orgánu.
Takzvaná distilácia sama osebe nie je neobvyklou technikou strojového učenia. Zjednodušene umožňuje menšiemu modelu učiť sa z výstupov výkonnejšieho modelu. Problém nastáva vtedy, keď sa výstupy cudzieho systému získavajú vo veľkom rozsahu bez povolenia a obchádzajú sa pritom technické alebo zmluvné obmedzenia. Prístup k detailnému reasoning procesu môže byť pre vývojára konkurenta mimoriadne hodnotný, pretože neposkytuje iba výslednú odpoveď, ale informácie o spôsoboch riešenia zložitejších problémov.
OpenAI uvádza, že kampaň do 28. júla úplne narušilo. Zablokovalo alebo obmedzilo zapojené účty, posilnilo kontroly pri vytváraní nových účtov a odstránilo mechanizmus, ktorý umožňoval opätovne vložiť chránené reasoning dáta do modelu a pokúsiť sa o ich rekonštrukciu. Informácie o útoku spoločnosť poskytla aj ďalším firmám prostredníctvom Frontier Model Forum a príslušným vládnym kanálom.
Prípad ukazuje nový druh konkurenčného boja v AI. Najhodnotnejším aktívom vývojárov už nie sú iba tréningové dáta, výpočtová infraštruktúra či samotné modelové váhy. Čoraz väčšiu hodnotu majú aj schopnosti špičkových modelov riešiť komplikované problémy. Ak sa tieto schopnosti dajú vo veľkom získavať prostredníctvom výstupov konkurenčného modelu, ochrana pred neoprávnenou distiláciou sa môže stať jednou z ďalších významných bezpečnostných oblastí celého AI priemyslu.
