Lidské schvalování příkazů AI agentů: 1 z 3 hrozeb přehlédnuto

Experiment ukázal, že lidé schvalují 1 z 3 hrozeb při interakci s AI agenty, což vyvolává otázky o efektivitě lidského dohledu.

7. srpna 2026

Nedávný experiment, který zahrnoval více než 40 000 herních sezení, odhalil, že průměrný hráč přehlédl 1 z 3 hrozeb, což znamená průměrnou přesnost identifikace hrozeb pouze 66,3 %. Tento výsledek vyvolává důležité otázky o tom, jak efektivní je lidský dohled při schvalování příkazů AI agentů.

Podle výsledků experimentu skončilo 32,9 % sezení s negativním skóre, což naznačuje, že schválené hrozby převážily nad blokovanými bezpečnými příkazy. Zajímavé na tom je, že 35,2 % hráčů dokázalo zachytit každou hrozbu, ale pouze 20,8 % z nich to zvládlo, aniž by blokovalo více než 1 z 5 bezpečných příkazů.

Nejčastěji přehlížený příkaz byl 'npm run analyze', který byl schválen 64,7 % času. Tento příkaz, i když se na první pohled zdá být neškodný, může ve skutečnosti spouštět skripty, které by mohly být potenciálně nebezpečné. Příkazy, které skutečně exfiltrují údaje, jsou přehlíženy třikrát častěji než zjevně destruktivní příkazy, což ukazuje na slabiny v lidské schopnosti rozpoznat subtelné hrozby.

Dalším důležitým zjištěním je, že míra přehlížení se zvyšuje pod tlakem. Hráči, kteří byli testováni v časově omezené výzvě, prokázali, že s rostoucím počtem schvalovaných příkazů klesá jejich pozornost a důslednost.

Zajímavé je také, že 7 % hráčů schválilo každý jednotlivý příkaz, což může naznačovat buď vysokou míru důvěry v AI agenta, nebo nedostatek povědomí o potenciálních hrozbách. Tento fenomén může být nebezpečný, protože uživatelé, kteří schvalují všechny příkazy, se vystavují riziku schválení škodlivých akcí.

Celkově výsledky tohoto experimentu ukazují na výzvy spojené s lidským schvalováním příkazů AI agentů. I když je lidský dohled důležitý, je zřejmé, že samotný model schvalování příkazů může být nedostatečný. Vývojáři by měli brát v úvahu tyto poznatky při navrhování systémů, které zahrnují interakci s AI, a hledat způsoby, jak minimalizovat rizika spojená s lidským faktorem.