Nový model Atlas pomáhá trénovat roboty a točit efekty v 1440p

Nový model Atlas pomáhá trénovat roboty a točit efekty v 1440p

Ondřej Barták
Ondřej Barták
podnikatel a programátor
3. 9. 2026
4 minut čtení · 3 zhlédnutí
Poslechněte si článek
Audio verze článku
Nový model Atlas pomáhá trénovat roboty a točit efekty v 1440p

Společnost World Labs, kterou vede stanfordská profesorka Fei-Fei Li, zveřejnila svůj nový světový model Atlas. Dokáže z textu, obrázků i videa vytvořit fotorealistické trojrozměrné prostředí, ve kterém si uživatel sám určí, odkud se na scénu bude dívat. Firma model označuje jako omni model, protože pracuje se všemi těmito typy vstupů zároveň, tedy s textem, snímky, videem a 3D daty. Nápad spočívá v tom, že model si všechny vstupy uloží do jednoho společného prostorového kontextu. Každý obrázek má v tomto kontextu své místo v prostoru, nikoli pouze pořadí ve frontě dat. Atlas pak dopočítává, co následuje, a hlídá, aby to odpovídalo všemu, co již viděl. Zbytek scény, který na vstupu chybí, si domyslí.

Ovládání kamery po pixelech

První skupina úloh, kterou model zvládá, se týká generování obrazu s přesně zadanou kamerou. Atlas dostane jeden až šest referenčních snímků a k nim popis pohybu kamery, přičemž geometrii kamery bere jako plnohodnotný vstup, nikoli jako textovou instrukci typu otoč se doleva. Výstupem může být video dlouhé až minutu v rozlišení 1440p.

World Labs to ukazují na příkladu, kdy modelu dodaly jedinou fotku. Atlas z ní vytvořil celou scénu i s objekty, které na snímku vůbec nejsou. Dopočítal odvrácenou stranu robota a k bazénu přidal travnatý pruh, protože podle své znalosti světa předpokládá, že tam takový prvek patří.

Prostorový kontext umožňuje i trik, který jinde nefunguje. Do kontextu lze vložit dva nesouvisející snímky, umístit je od sebe v prostoru a model mezi nimi vytvoří plynulý přechod. Sám si vymyslí dveře, chodbu nebo výklenek, kterým se z jedné scény dostane do druhé.

Rekonstrukce reálných míst z pár fotek

Druhou oblastí je rekonstrukce skutečných prostorů. Jde o dlouhodobý problém počítačového vidění, tedy jak dopočítat pohled z nové pozice, když má člověk k dispozici jen několik snímků. Atlas podle firmy nepotřebuje speciální techniku ani stovky hustě nasnímaných záběrů.

Zajímavé je, jak se u něj dá vyvažovat věrnost a fantazie. Čím více snímků model dostane, tím méně si vymýšlí. Věrné rekonstrukce zvládne už ze dvou nebo tří fotek a v testech tím překonal i modely trénované výhradně na 3D rekonstrukce. Zároveň si poradí s více než stovkou vstupních obrázků, pokud jde o co nejpřesnější kopii konkrétního místa.

Výsledky nemusí zůstat u obrázků a videí. Atlas pracuje současně s obrazovými snímky a hloubkovými mapami, takže umí vygenerovat i skutečné trojrozměrné výstupy, tedy body v prostoru nebo takzvané gaussovské splaty. Ty se dají renderovat přímo na zařízení ve vysokém rozlišení a s plynulou snímkovou frekvencí. Stejná reprezentace se používá v nástroji Marble, který World Labs nabízejí veřejnosti a jehož další verze mají na Atlasu stavět.

Trénink robotů z mobilního videa

Robotika je oblastí na kterou World Labs cílí. Pro roboty totiž nestačí prostor pouze zrekonstruovat. Když se simulovaný robot prostorem pohybuje, Atlas současně dopočítává obraz a hloubku, které by jeho senzory v každém okamžiku viděly. Svět i pohled robota na tento svět vznikají v rámci jednoho modelu.

Firma nasnímala dva velké prostory mobilním videem a k rekonstrukci každého z nich použila 24 snímků. Skenování podobných míst přitom obvykle vyžaduje drahé a komplikované vybavení. Poté v takto vytvořených prostorech nasimulovala pohyb různých typů robotů po různých trasách.

Model je nejefektivnější při manipulaci s předměty. Z několika neformálních záznamů pomáhá postavit simulaci, která zachytí i to, jak se objekty pohybují a jak na sebe reagují, a to včetně pevných, kloubových či poddajných předmětů. Jednou nasimulovanou úlohu pak lze snadno obměňovat, protože se dají vyměnit předměty, jejich pozice, pohyb robota, osvětlení i pozadí. Vzniká tak velké množství různorodých trénovacích a testovacích dat.

Jak je Atlas funguje

Technicky jde o multimodální autoregresní difuzní transformer. Každá z těchto vlastností má svůj úkol. Multimodalita znamená, že model zpracovává text, obrázky, pozice kamery a hloubkové mapy, přičemž video bere jako sekvenci snímků. Autoregresivní část zajišťuje, že výstupy vznikají postupně, každý s ohledem na předchozí kontext, takže se stejná architektura hodí na mnoho různých úloh. Difuzní složka výstup postupně čistí od šumu a umožňuje měnit rychlost za kvalitu podle toho, kolik kroků čištění si vývojář zvolí. Transformer pak celé konstrukci dává základ, který efektivně využívá současný hardware.

World Labs zdůrazňují, že spojily postupy z velkých jazykových modelů a z video modelů. Díky autoregresivnímu transformeru může Atlas těžit z triků na zrychlení jazykových modelů, jako je ukládání mezivýsledků nebo rozdělení výpočtu mezi více strojů. Jakožto difuzní model v latentním prostoru zároveň využívá vylepšení známá z generování obrázků a videa.

Testy proti konkurenci

Dle firmy žádný samostatný test nedokáže obsáhnout model, který zvládá tolik různých úloh. Vybrala si proto dvě oblasti.

U generování se zadanou kamerou dostaly modely jednu vstupní fotku a jeden až tři filmové pohyby kamery, tedy panorámu, jízdu nebo jeřáb. Atlas dostal trasu kamery ve svém vlastním formátu, zatímco ostatní modely ji měly popsanou slovy, protože jiný vstup nepodporují. Lidé pak vybírali, který výstup lépe odpovídá zadanému pohybu. Atlas vyhrál ve všech srovnáních, od tří čtvrtin hlasů proti MiniMax H3 až po více než 90 procent proti modelům FLUX 3 a Seedance 2.5. Rozdíl podle World Labs roste s tím, jak moc je pohyb kamery složitější.

Druhý test se týkal 3D rekonstrukce z malého počtu pohledů. Model dostal sadu snímků s pozicemi kamer a měl ke každému pixelu určit odpovídající bod v prostoru. Atlas skončil s nejnižší průměrnou chybou před pěticí nedávných specializovaných modelů, mezi nimiž byly Pi3X, VGGT-Ω 1B, Depth Anything 3 nebo MapAnything. World Labs uvádějí, že si výsledky všech porovnávaných metod přepočítaly samy, aby všechny běžely za stejných podmínek.

Zdroj: theinformation.com

Kategorie:AI
Líbil se vám tento článek?
Objevte další zajímavé příspěvky na blogu
Zpět na blog

Související články

Tvůrce modelu Kimi K3 míří na burzu. Moonshot AI chce získat 3 miliardy dolarůTvůrce modelu Kimi K3 míří na burzu. Moonshot AI chce získat 3 miliardy dolarů
Moonshot AI, tvůrce modelu Kimi K3, plánuje jednu z největších hongkongských emisí posledních let. Firma chce získat 3 miliardy dolarů navzdory americkým obviněním.
2 min čtení
4. 9. 2026
Nový model GPT-6 Astra: co umí, kde selhává a kolik stojíNový model GPT-6 Astra: co umí, kde selhává a kolik stojí
GPT-6 Astra slibuje rychlejší práci s počítačem, kancelářskými úkoly i kódem. Jak přesvědčivé jsou její výsledky, kde naráží na limity a kolik za ni zaplatíte?
5 min čtení
4. 9. 2026
Model Solaris nepíše kód, vykresluje obrazovku v reálném čase bez HTML, CSS i JavaScriptuModel Solaris nepíše kód, vykresluje obrazovku v reálném čase bez HTML, CSS i JavaScriptu
Runway představuje Solaris, který mění obrazovku v živé prostředí: rozhraní vykresluje snímek po snímku a na pokyny i gesta reaguje bez klasického programování.
5 min čtení
3. 9. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Provozovatel: CodedTrip LLC, USA.

YouTube
TikTok