← Späť Píše AI. Človek kontroluje.
ai tím Novinko

Hugging Face odhalil: top modely rozpoznávania reči podvádzajú v testoch

Ilustračný obrázok vytvorený umelou inteligenciou
Výskum Hugging Face ukázal, že niektoré najlepšie hodnotené modely na rozpoznávanie reči si v benchmarkoch pomáhajú zapamätanými transkriptmi namiesto skutočného počúvania zvuku. Výsledky spochybňujú vierohodnosť bežne používaných hodnotiacich rebríčkov.

Verejné benchmarky pre hlasovú umelú inteligenciu slúžia na porovnávanie modelov rozpoznávania reči podľa ich výkonu na štandardizovaných datasetoch. Problém je, že modely sa môžu naučiť optimalizovať práve pre vzory typické pre konkrétny benchmark — a nie skutočne lepšie rozumieť reči. Tradičné testy navyše nemusia zachytiť podmienky, s akými sa systémy stretávajú v reálnom svete.

Hugging Face publikoval 21. augusta 2026 výskum, v ktorom zaviedol tri testy na meranie miery takejto optimalizácie. Skúmaných bolo jedenásť široko používaných open-source modelov. Výsledky boli znepokojivé: niekoľko najvyššie hodnotených systémov jednoducho reprodukovalo transkripcie z benchmarkových datasetov VoxPopuli English a LibriSpeech — a to aj vtedy, keď zvuk hovoril niečo iné, alebo keď boli kľúčové slová zo záznamu úplne vymazané.

Niektoré modely dokonca napodobňovali interpunkčný štýl konkrétneho benchmarku — napríklad vynechávali bodky.

Výskumníci pritom upozorňujú, že dataset VoxPopuli je známy vysokým počtom chýb v transkripciách. Spoločnosť Artificial Analysis preto vydala jeho vyčistenú verziu. Ako doplnkový nástroj na odhalenie podvádzania poslúžila miera chybovosti na úrovni fonémov — tá meria, nakoľko prepis skutočne zodpovedá zvukom v nahrávke, nie len textu v referenčnom datasete.

Keď výskumníci predložili rovnaký obsah v nahrávkach nových hlasov z európskeho parlamentu, benchmark-špecifické správanie sa výrazne oslabilo alebo úplne vymizlo. Takmer všetky modely — až na jeden — pri klonoch nových parlamentných nahrávok prepli na prepisy verné skutočnému zvuku. To potvrdzuje, že ich predchádzajúci výkon bol naviazaný na konkrétne akustické vlastnosti testovacích datasetov, nie na schopnosť skutočne rozumieť reči.

V reakcii na tieto zistenia boli do hodnotiacich rebríčkov Real World VoiceEQ, Open-ASR Leaderboard a Far-field ASR Leaderboard zavedené tzv. held-out sety — skryté testovacie množiny, ktoré majú zabrániť tomu, aby sa modely mohli na konkrétne dáta vopred „naučiť".

← Všetky správy