Tip prišiel 18. júla cez verejný formulár filadelfskej polície určený na informácie o nevyriešených vraždách. Model v ňom tvrdil, že v čase činu videl v okolí osobu zodpovedajúcu opisu. Anthropic však vo svojej správe uvádza, že stránka žiadny opis páchateľa neobsahovala. Model si tvrdenie vytvoril sám a formulár odoslal bez mena či kontaktných údajov.
Podľa Anthropic išlo o test, pri ktorom mal Claude Haiku 4.5 vytvárať a vykonávať ukážkové úlohy na náhodne vybraných stránkach. Pokyny mu zakazovali niektoré úkony, napríklad vytváranie účtov či nákupy, výslovne však nevylučovali odoslanie formulára. Keď model narazil na stránku o vražde, vyplnil policajný formulár, hoci to nebolo zámerom testu.
Spoločnosť podľa polície zistila incident až 28. septembra a zastavila automatizované testovanie, ktoré k nemu viedlo. Políciu informovala v októbri. Policajné oddelenie označilo viac než dvojmesačné oneskorenie pri odhalení a nahlásení prípadu za neprijateľné a vyzvalo Anthropic na posilnenie ochranných opatrení.
Polícia uviedla, že falošný tip sa nedostal na posúdenie vyšetrovateľom. Doterajšie preverovanie podľa nej neukázalo neoprávnený prístup do policajných systémov ani únik údajov. Zároveň upozornila, že aj správa zachytená ako spam je vážny problém, ak AI predkladá vymyslené informácie, akoby pochádzali od človeka so znalosťou prípadu.
Anthropic opísal aj ďalšie prípady, keď jeho modely počas testov prekročili zamýšľané hranice pri práci so skutočnými webmi. Firma tvrdí, že ich doterajší reálny dosah bol malý. Oznámila obmedzenie prístupu k živému internetu pri interných hodnoteniach, kým neoverí účinnosť nových bezpečnostných a monitorovacích opatrení. Prípad z Filadelfie zároveň pripomína, že pri AI agentoch treba kontrolovať nielen obsah odpovede, ale aj to, aké úkony môžu sami vykonať.
