Studie odhaluje, proč AI agenti selhávají i s pečlivě naprogramovanými dovednostmi

Studie odhaluje, proč AI agenti selhávají i s pečlivě naprogramovanými dovednostmi

Ondřej Barták
Ondřej Barták
podnikatel a programátor
24. 8. 2026
5 minut čtení · 1 zhlédnutí
Studie odhaluje, proč AI agenti selhávají i s pečlivě naprogramovanými dovednostmi

Vývojáři dnes přidávají AI agentům dovednosti téměř automaticky, přičemž předpokládají, že předáním popsaného postupu doplní agentovi chybějící znalosti, díky čemuž si poradí lépe. Nová studie několika univerzit, která provedla přes 8 tisíc testů, však ukazuje, že tento předpoklad je mylný. Dovednosti podle ní neslouží jako sklad vědomostí, ale fungují spíše jako záchytný bod, který agentovi nedovolí vypadnout z kolejí uprostřed složitého úkolu.

Jak výzkumníci dovednosti otestovali

Vývojáři obvykle skládají knihovny dovedností pokusem a omylem podle vlastního citu, avšak autoři studie chtěli efekt dovedností izolovat, a tak nechali agenty pracovat v testech, kde se úkol neobejde bez několika kroků za sebou. Použili k tomu Terminal-Bench 2.0 a SkillsBench, které vyžadují spouštění příkazů, ladění chyb a následné ověření, zda výsledek opravdu odpovídá zadání. 

Pak porovnali tři způsoby práce, přičemž ve všech případech vycházeli ze stejné předchozí zkušenosti. V prvním režimu dostal agent úkol bez jakéhokoli kontextu z minulých pokusů, ve druhém mu předložili hrubé a neutříděné záznamy z předchozího pokusu a ve třetím mu poskytli destilovanou dovednost v podobě vyčištěného a sjednoceného popisu postupu vytaženého z týchž záznamů. 

Rozdíl mezi druhým a třetím režimem vyšel na 6,06 procentního bodu ve prospěch destilované dovednosti, což potvrzuje, že samotná zkušenost nestačí a záleží na tom, do jaké podoby ji vývojář upraví, než ji agentovi předá. Kdokoli si může tento test zopakovat a ověřit, zda jeho vlastní abstrakce přinášejí něco navíc oproti prostému vložení syrových logů do promptu. 

Pracovní postup vede, výklad látky prohrává

Zjištění studie zní, že dovednosti zabírají ve chvíli, kdy se z neutříděných záznamů stane opora pro postup, která agentovi stabilizuje provedení úkolu, což znamená, že dovednost má agentovi ukázat jednotlivé kroky a ne ho učit samotná fakta. 

Čísla to potvrzují, že opora pro postup stojí za 65,7 procenta případů, kdy dovednost pomohla, zatímco předání konkrétní znalosti se na úspěchu podílelo jen ze 4,5 procenta. Dovednosti tedy neopravují vysokoúrovňové uvažování modelu, ale dodávají mu odolnost při samotném provádění, což je nejlépe vidět na poruchách prostředí, kdy agent zápasí s nastavením nástrojů, obchází závislosti nebo si neumí připravit prostředí. Podíl takových selhání totiž klesl z 5,3 procenta při běhu bez opory na pouhých 0,2 procenta u agentů s destilovanou dovedností. 

Studie popisuje jeden konkrétní případ, kdy agent bez opory sice věděl, jak napsat opravu v Reactu, ale neprošel kontrolou odezvy. Rozhraní se načítalo 915 milisekund, přestože limit byl pod 800 milisekund, protože agent nechal požadavky běžet za sebou místo souběžně. Dovednost pak posloužila jako pracovní postup, který řekl agentovi, aby nezávislé operace přepsal na Promise.all, spustil je co nejdříve a na výsledek čekal až na konci, a když agent tuto sekvenci dodržel, prošel všemi testy za 11,74 sekundy. 

Pro vývojáře z toho plyne jasná rada, aby nepsali dovednosti jako výklad látky nebo obecné algoritmy, ale raději je koncipovali jako sjednocené kontrolní seznamy krok za krokem, kterých se agent musí držet.

Nebezpečí neoznačené zkušenosti

Nicméně autoři varují, že dovednosti selhávají tam, kde stojí na předpokladech, míjejí se s kontextem nebo se neumějí přizpůsobit, přičemž velká část těchto problémů vzniká už při jejich tvorbě. Když se totiž dovednost destiluje ze syrových záznamů a nikdo agentovi neřekne, které procesy dopadly dobře a které špatně, výsledný postup se rychle rozpadne. 

Výzkumníci to ukázali na pokusu, kde tuto informaci schválně odebrali a agentovi postavenému na modelu Gemini předložili smíšenou dávku pěti záznamů obsahující tři úspěšné a dva neúspěšné pokusy. Když agent při destilaci viděl, jak jednotlivé pokusy dopadly, dosahoval na navazujících úkolech 74,6 procenta úspěšnosti, avšak jakmile mu tuto značku vzali, úspěšnost spadla na 40 procent. Bez informace o výsledku totiž nedokázal oddělit užitečný signál od šumu a natrvalo si do knihovny dovedností zapsal i vlastní halucinace a neefektivní kroky. 

Záznamy mají svou cenu, ale pouze tehdy, když v sobě nesou správné signály, přičemž jejich kvalitu si lze předfiltrovat například tak, že jejich hodnocení svěříte jazykovému modelu jako nezávislému posuzovateli.

Podivná matematika vyhledávání v katalogu

Druhý problém přichází s růstem knihovny, protože když se počet dostupných dovedností zvětšil z pěti na sto, přesnost skutečně použitých vytažených dovedností spadla z 29,6 procenta na pouhá 3,3 procenta. Čekali byste, že se pod tímto propadem složí i úspěšnost úkolů, avšak to se nestalo a u agenta na modelu Gemini zůstala úspěšnost stabilní zhruba mezi 36 a 39 procenty i v okamžiku, kdy měl na výběr ze sta možností.

Vysvětlení zní, že trefit se přesně do té jediné správné dovednosti není nutnou ani dostačující podmínkou úspěchu, protože agenti sice sahají po nesprávných dovednostech často, jenže i příbuzná dovednost jim dodá dostatek použitelné opory k tomu, aby úkol zvládli. Když si agent místo přesného postupu pro ladění pokladního rozhraní vytáhne obecný postup pro ladění rozhraní, pořád dostane smysluplný kontrolní seznam, podle kterého se může úspěšně řídit.

Skutečné riziko velkých katalogů leží konkrétně ve významové zaměnitelnosti, protože jakmile se v knihovně nahromadí dovednosti, které si jsou ve vektorovém prostoru podobné jako vejce vejci, vyhledávání přestane rozlišovat a začne vracet náhodné výsledky. 

Jak zabránit tomu, aby si agent tahal, co ho napadne

Řešení, které autoři nabízejí, se neopírá o chytřejší vektorové vyhledávání, ale o architekturu, kdy dovednosti nejprve rozdělíte podle oblastí a teprve pak řešíte podmínky pro jejich spuštění. V praxi to znamená postavit dvoupatrový systém, kde v prvním patře rozhoduje směrovač postavený na jazykovém modelu, který úkol zařadí do konkrétní přihrádky například podle toho, zda jde o práci na straně rozhraní, nebo serveru. Ve druhém patře si pak agent vytáhne dovednost jedině tehdy, když se splní tvrdě daná podmínka, kterou může být přesný řetězec chyby v záznamu terminálu, jako je například hlášení o odmítnutém spojení.

Výzkumníci k tomu dodávají, že práci s dovednostmi je potřeba chápat jako otázku celého životního cyklu, a ne jako jednorázové vložení paměti do promptu. Ke svým dovednostem se tedy chovejte jako ke knihovně provozních postupů, které budete pravidelně procházet a ověřovat, zda je agent umí správně použít, a stavte kolem nich takovou architekturu, která obejde významovou zaměnitelnost dřív, než začne škodit.

Kategorie:AI a věda
Líbil se vám tento článek?
Objevte další zajímavé příspěvky na blogu
Zpět na blog

Související články

Čínská umělá inteligence pozná riziko deprese čtyři roky dopředuČínská umělá inteligence pozná riziko deprese čtyři roky dopředu
Čínští vědci vyvinuli model, který ze snímků mozku a reakce na lidské tváře odhalí mladé lidi ohrožené depresí. Nabízí šanci zasáhnout dříve, než se potíže rozvinou.
3 min čtení
20. 8. 2026
Matematik s pomocí Claude Fable 5 vyvrátil matematickou domněnku starou 87 letMatematik s pomocí Claude Fable 5 vyvrátil matematickou domněnku starou 87 let
Když v neděli večer sledoval celý svět finále mistrovství světa mezi Španělskem a Argentinou, matematik Levent Alpöge napsal na síť X pár nenápadných řádků, které rozvířily matematickou obec. Jacobiho
4 min čtení
22. 7. 2026
Sedmnáctiletý student postavil vlastní AI, která z oční sítnice pozná autismus a ADHDSedmnáctiletý student postavil vlastní AI, která z oční sítnice pozná autismus a ADHD
Když Edward Kang před třemi lety probíral vědecké články kvůli školnímu projektu, narazil na studii výzkumníků z Čínské univerzity v Hongkongu, kteří pomocí snímků sítnice diagnostikovali autismus. Ná
4 min čtení
13. 7. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Provozovatel: CodedTrip LLC, USA.

YouTube
TikTok