Francouzský startup Kog tvrdí, že z běžných grafických karet dostane třicetkrát rychlejší AI

Francouzský startup Kog tvrdí, že z běžných grafických karet dostane třicetkrát rychlejší AI

Ondřej Barták
Ondřej Barták
podnikatel a programátor
19. 8. 2026
4 minut čtení · 3 zhlédnutí
Poslechněte si článek
Audio verze článku
Francouzský startup Kog tvrdí, že z běžných grafických karet dostane třicetkrát rychlejší AI

Když se dnes mluví o zrychlení odpovědí velkých jazykových modelů, obvykle se řeší nový hardware. Cerebras se svými čipy navrženými přímo pro tuto úlohu podal v květnu žádost o vstup na burzu a trhy na to reagují pozitivně. Francouzský startup Kog jde jiným směrem. Tvrdí, že v grafických kartách, které už datacentra dávno vlastní, zůstává nevyužitá obrovská porce výkonu, kterou lze odemknout čistě softwarově. Firma slibuje až třicetkrát rychlejší generování odpovědí. Její demo, které okamžitě zaujalo komunitu, vygenerovalo 3000 tokenů za sekundu na jediný požadavek. Pro srovnání, ChatGPT zvládá zhruba stovku.

Kog na sebe upozornil v květnu technickou ukázkou. Cílem bylo dokázat, že bleskové generování odpovědí pro jednoho uživatele lze zvládnout i na standardních serverových kartách, které firmy běžně využívají. Startup konkrétně pracoval s čipy AMD MI300X a Nvidia H200. 

Část komunity sice zklamalo, že se výsledky netýkají grafických karet v noteboocích, jiní ale rychle pochopili potenciál. Rychlost a náklady na provoz modelů dnes limitují snad všechny firmy, které chtějí AI nasadit do ostrého provozu. Možnost odemknout nový výkon na již zakoupeném hardwaru proto přitáhla obrovskou pozornost. „Získali jsme dvě stě obchodních poptávek,“ řekl pro TechCrunch šéf firmy Gaël Delalleau. 

Nový pohled na věc

Základem je přístup, který Kog označuje jako hardwarově-softwarový co-design. Cílem je udržet výpočetní jednotky karty v nepřetržitém chodu a eliminovat prostoje, kdy čip pouze čeká na přenos dat mezi jednotlivými komponentami. 

Startup Kog proto nahradil standardní komunikační vrstvu RCCL vlastní knihovnou Kog Communication Library (KCCL). Ta zajišťuje, že se výkon při rozdělení modelu mezi více špičkových karet škáluje lineárně a neztrácí se v komunikační režii. Druhým bodem je architektura LaneFormer. Ta odkládá komunikaci mezi kartami o jednu vrstvu, takže výpočet pokračuje bez přerušení a generování textu probíhá bez jediné synchronizační pauzy.

Kog navíc optimalizuje práci s pamětí na základě fyzické architektury čipu, takže každý přístup směřuje přesně tam, kam má. Zatímco jiné nástroje rozložení paměti pouze odhadují, Kog jej zná přesně. Praktickým detailem, který inženýři ocení nejvíce, je snadná integrace: engine lze nasadit jako přímou náhradu za běžně používané LLM, a to zcela bez přepisování kódu. 

Prezentovaná data opírá firma o přímé srovnání s LLM a TensorRT-LLM na stejném hardwaru a se shodným modelem. Na kartách AMD Instinct dosáhl jeho engine až 3,5krát vyšší rychlosti. U modelu Llama 3 (8B) pak firma deklaruje výkon 1368 tokenů za sekundu.

Každá sekunda stojí peníze

Delalleau očekává, že prvním velkým odbytištěm bude softwarový vývoj. Každý, kdo pracuje s autonomními programátorskými agenty, to zná, uživatel zadá úkol a pak čeká, někdy i hodiny. Že jsou lidé ochotni za rychlost platit, si uvědomuje i Anthropic, který si za Fast Mode u modelů Claude účtuje násobek běžné ceny.

Kog cílí přesně na zákazníky, pro které je toto čekání kritické, protože jejich každodenní práce závisí na plynulých AI procesech. Startup už spolupracuje s partnery, kteří vyvíjejí nástroje pro generování her a aplikací z jediného zadání, v této oblasti se totiž vyšší rychlost okamžitě promítá do přímých příjmů. Firma přesto přiznává, že trh ještě není plně připraven. Obchodní jednání ukázala, že zákazníci nemají kapacitu ani chuť ladit malé specializované modely. Kog proto od svého spuštění soustředí veškeré úsilí na zrychlení velkých, komplexních modelů.

A právě v tom spočívá jeho největší výzva. Působivé demo se 3000 tokeny za sekundu totiž běželo na malém modelu LaneFormer 2B se dvěma miliardami parametrů, který si startup sám vyvinul a nedávno vydal jako open-source. Od tohoto úspěchu k slibovanému třicetinásobnému zrychlení u plnohodnotných velkých modelů však vede dlouhá cesta. Velikost parametrů totiž pro rychlé generování odpovědí představuje tu vůbec největší překážku.

Delalleau si přesto stojí za tím, že stejný přístup zafunguje i u velkých modelů. Grafické karty mají podle něj obrovský potenciál a tvrzení, že se pro generování textu nehodí, je omyl. Novější čipy totiž nabízejí stále vyšší propustnost paměti, kterou současný software nedokáže plně využít. 

Měsíce práce na každém typu čipu

Nevýhodou takto hluboké optimalizace je, že ji nelze uspěchat. Každé nové grafické kartě musí tým věnovat několik týdnů až měsíců intenzivního výzkumu. Pro startup s pouhými jedenácti lidmi to znamená velké omezení v tom, kolik různých čipů dokáže Kog podporovat.

Do budoucna chce firma svou metodiku přenést do procesů řízených AI agenty, kteří by integraci dalších čipů a modelů zvládli mnohem rychleji. Pro Evropu, která se snaží vybudovat vlastní nezávislost v oblasti hardwaru i modelů, je úspěch startupu klíčovým prvkem. Kog navíc není jediný. Francouzský projekt ZML rovněž vydal software, který obchází ekosystém Nvidia CUDA a umožňuje rychlé generování napříč konkurenčními čipy.

Kategorie:AI
Líbil se vám tento článek?
Objevte další zajímavé příspěvky na blogu
Zpět na blog

Související články

EU chce dohnat Ameriku a Čínu, vypsala tendr na sedm AI gigatovárenEU chce dohnat Ameriku a Čínu, vypsala tendr na sedm AI gigatováren
Brusel chce vybudovat až sedm obřích výpočetních center pro umělou inteligenci. Veřejné peníze mají přilákat soukromé investice a pomoci Evropě dohnat USA i Čínu.
6 min čtení
24. 8. 2026
Meta platí Microsoftu stovky milionů dolarů ročně za konkurenční AI modelyMeta platí Microsoftu stovky milionů dolarů ročně za konkurenční AI modely
Meta sice buduje vlastní AI infrastrukturu, při vývoji si však pomáhá konkurenčními modely přes Microsoft Azure. Za přístup k nim platí stovky milionů dolarů ročně.
4 min čtení
24. 8. 2026
Anthropic míří v říjnu na burzu a nejspíš předčí i rekordní vstup SpaceXAnthropic míří v říjnu na burzu a nejspíš předčí i rekordní vstup SpaceX
Výrobce modelů Claude chystá historický úpis s oceněním až dva biliony dolarů. Za raketovým růstem tržeb však stojí obří ztráty a náklady na vývoj AI.
3 min čtení
24. 8. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Provozovatel: CodedTrip LLC, USA.

YouTube
TikTok