Súťaž Grounded Reasoning Cup mala overiť, ako dobre dokážu AI agenti odpovedať na otázky z reálnych podnikových dokumentov — nie na jednoduchých testovacích sadách, ale na materiáli, aký sa bežne vyskytuje vo firmách. Databricks na tento účel pripravil benchmark OfficeQA Pro V2, postavený na zhruba 120 000 stranách dokumentov amerického ministerstva financií.
Tímy mali na prípravu asi dva mesiace, no samotný korpus dokumentov, na ktorom sa súťažilo, dostali do rúk až 36 hodín pred dňom súťaže. Každý tím mal dvoch až štyroch členov a musel pracovať výhradne s modelmi svojho prideleného priemyselného partnera — OpenAI, Anthropic alebo Google DeepMind.
Víťazný tím zo Stanfordu dosiahol presnosť 63,3 %, čo je výsledok, ktorý výrazne prekonáva konkurenciu. Oproti priemeru ostatných súťažných tímov to bol náskok zhruba 22 percentuálnych bodov. Ešte výraznejší je rozdiel voči bežne dostupným AI agentom — tie bez špeciálnych úprav dosahovali v priemere menej ako 30 %, čo znamená, že Stanford ich predbehol o asi 35 percentuálnych bodov.
Stanfordský tím vsadil na kombináciu troch prístupov: knižnicu opakovane použiteľných zručností, záložné spôsoby reprezentácie dokumentov a adaptívne overovanie odpovedí. Práve táto architektúra im umožnila vyťažiť z dokumentov oveľa viac než súperi.
Pri tímoch, ktoré používali rovnaký model, bol rozdiel medzi najlepším a najhorším skóre až 30,4 percentuálneho bodu.
Napriek dobrým výsledkom víťaza zostáva priestor na zlepšenie: takmer pätina otázok (18,8 %) zostala nezodpovedaná žiadnym tímom. Na stupňoch víťazov sa okrem Stanfordu umiestnili University of Massachusetts Amherst a Yale.
