Francouzská firma Mistral vydala nástroj Agentic Search, který umělé inteligenci pomáhá vyhledávat ve firemních dokumentech podobně jako člověk. Dosavadní vyhledávače prošly archiv jen jednou, vytáhly pár úryvků a model musel odpovědět pouze z nich. Nový nástroj ale může hledat opakovaně, otevřít si konkrétní dokument, přejít na vybranou stránku či tabulku a prostudovat ji. V testu postaveném na amerických burzovních výkazech díky tomu úspěšnost odpovědí stoupla z necelých 27 procent na 86.
Kde má jednorázové hledání problém
Dnešní firemní vyhledávání s umělou inteligencí funguje většinou jednoduše. Systém najde několik zdánlivě relevantních úseků textu a předloží je modelu s otázkou. Pokud v nich odpověď skutečně je, výsledek je správný. Když ale potřebný údaj leží v opomenuté tabulce nebo v úplně jiném dokumentu, model se k němu nedostane. Odpovídá pouze z původních podkladů a nedokáže si vyžádat jinou zprávu či další kontext.
Dle Mistralu má tento přístup tři slabiny. Model nedokáže sám rozhodnout, že první výsledky nestačí. Nezvládne ani otevřít složitější dokument a vyhledat v něm správnou tabulku, přestože systém daný dokument správně identifikoval. Chybí mu také možnost udělat druhý pokus, ověřit nalezené číslo nebo porovnat dva různé zdroje.
Pět jednoduchých povelů
Agentic Search staví na existujícím indexu firmy a přidává k němu pětici nástrojů se srozumitelnými názvy: search najde dokumenty v celém archivu, open otevře konkrétní z nich, navigate přesune model na stránku nebo oddíl, read vytáhne obsah daného místa a grep v otevřeném dokumentu vyhledá zadaný vzorec.
Mistral to ukazuje na příkladu z amerických vládních věstníků. Otázka na součet měsíčních výdajů na obranu za rok 1953 skončila u jednorázového vyhledávání napůl cesty, protože nalezené dokumenty pokrývaly jen část roku. S novým postupem model díky druhému, přeformulovanému dotazu narazil na věstník z února 1954, otevřel patnáctou stránku, prostudoval tabulku se všemi dvanácti měsíci a výsledek spočítal.
Podstatným detailem je, že tyto nástroje nevyžadují dodatečné trénování modelu ani úpravy pro jednotlivé modelové řady. Kvalita vyhledávání tak podle Mistralu poroste s tím, jak se modely budou zlepšovat v uvažování a práci s nástroji, aniž by firma musela zasahovat do své infrastruktury.
Na co se nový přístup hodí a kdy je to zbytečné
Firma upřesňuje, kde má nasazení nového nástroje smysl. Patří sem dlouhé dokumenty jako smlouvy, výkazy, manuály či technické specifikace, dále dotazy vyžadující srovnání několika zdrojů, odpovědi s nutností doložit konkrétní místo v textu a v neposlední řadě tabulky nebo naskenované soubory, u nichž význam závisí na řádcích, sloupcích a okolním kontextu.
Naopak u krátkých a přehledných dokumentů, kde odpověď téměř jistě leží v prvním nalezeném úryvku, u plošného vyhledávání pasáží nebo u dotazů, kde se přesně ví, kde odpověď hledat, zůstává klasický index lepší volbou. Platit za zbytečné procházení textu přinese jen náklady bez užitku.
Ani u složitých dokumentů se však odpovědnost člověka nemění. Úspěšnost 86 procent znamená, že přibližně každá sedmá odpověď je chybná. Pokud výsledek směřuje do auditní dokumentace nebo úředního podání, jde stále pouze o dobrý první návrh, nikoli o hotovou práci.
Kde to běží a co to stojí
Agentic Search je dostupný přes Mistral Search Toolkit pro týmy, které si staví vlastní vyhledávací potrubí, a přes funkci Libraries zabudovanou do produktů Studio a Vibe, kde stačí nástroj rovnou používat. Nejrychlejší cestou k vyzkoušení je startovací aplikace na GitHubu, která z vlastního archivu dokumentů vytvoří místní index podle výchozího nastavení.
Provoz může běžet v cloudu i kompletně na vlastních serverech zákazníka, což pro evropské a britské firmy s přísnými požadavky na lokalitu dat představuje zásadní rozdíl oproti nabídkám postaveným výhradně na americké infrastruktuře. Jde ovšem o popis technického zázemí, nikoli o nezávislý audit nebo konkrétní certifikaci, takže vlastní posouzení souladu s předpisy firmám nikdo neušetří. Indexování ve funkci Libraries stojí podle ceníku jeden dolar za milion tokenů, jednotlivé dotazy jeden cent, rozpoznávání textu v dokumentech tři dolary za tisíc stran a tarif Vibe Pro necelých patnáct dolarů měsíčně.



