Na sociálních sítích se objevil příspěvek, který lidem z oboru nedá spát už delší dobu. Autor napsal, že netuší, jak se to stalo, ale ChatGPT používá na osobní věci a Claude na práci. Skoro každý, kdo s těmito nástroji pracuje denně, reagoval stejně s tím, že to má přesně taky tak. Rozdíly v povaze modelů přitom vycházejí z toho, jak se modely dolaďují a co při tom jejich tvůrci odměňují.
Milý ChatGPT a přímočarý Claude
Když požádáte ChatGPT o radu nebo názor, většinou se vám dostane podpory, povzbuzení a pocitu, že vám někdo rozumí. Claude působí jinak. Uživatelé ho popisují jako analytičtější typ, který je opatrnější a mnohem ochotněji zpochybní vaše uvažování. Občas je až brutálně upřímný. Neřekl bych, že je neomalený, spíš vám jen nespěchá dát za pravdu.
Zkuste se zeptat, jestli je váš podnikatelský nápad k něčemu nebo zda nereagujete přehnaně. ChatGPT obvykle začne emocemi. Claude přejde rovnou ke kritice, ovšem bez konstruktivního obalu, na který jsme zvyklí od lidí. Korekce přitom funguje oběma směry. Kdo si zvykl na ChatGPT, musí ho často o upřímnost prosit. U Claudu se pak člověk přistihne, že ho žádá, aby trochu ubral.
Modely se neučí jen řešit úlohy, ale i to, jak s lidmi mluvit. Do toho spadá tón, míra empatie, ochota nesouhlasit i množství odporu, který vám při diskuzi kladou. Odborně se tomuto procesu říká alignment a v praxi jde o rozhodnutí firmy, jak má její model společensky působit.
Další část leží v lidském hodnocení. Lidé při dolaďování odměňují konkrétní odpovědi, a když opakovaně vybírají ty uklidňující, model se tímto směrem nakloní. Anthropic svůj postup popsal už v polovině roku 2024 u modelu Claude 3. Firma si sepsala seznam vlastností, které chce vidět. Následně nechala model, aby si sám vygeneroval lidsky znějící zprávy, napsal na ně odpovědi a seřadil je podle toho, jak dobře popisu sedí. Data si tedy Claude vyrábí sám, ale ladění jednotlivých vlastností zůstává ruční prací.
Claude a jeho ústava
Letos v lednu Anthropic zveřejnil dokument, kterému se říká Claudeova ústava. Mezi autory je dokonce i několik samotných modelů Claude. Vývoj vedla Amanda Askell, která má v Anthropicu na starosti tým pro ladění osobnosti. Samotný text má přes dvacet tisíc slov. V přepočtu na stránky jde zhruba o osmdesát stran.
Ústava popisuje, co by rozumného zaměstnance Anthropicu naštvalo, kdyby to u modelu viděl. Na seznamu stojí odmítnutí rozumné žádosti kvůli nepravděpodobným rizikům nebo vyhýbavá odpověď z přehnané opatrnosti. Vadí také podsouvání zlého úmyslu uživateli a přidávání nadbytečných varování či výhrad, která nejsou potřeba.
Co dělá Claude v praxi? Sype ze sebe varování jedno za druhým. Upozorní, že není lékař u dotazu na bolavé svaly, nebo že není právník u dotazu na nájemní smlouvu. Trénování na lidských preferencích zde přebilo psaný dokument, protože si model zafixoval, že odpověď s výhradou dostává lepší hodnocení.
Když model souhlasí se vším, přestává být k užitku
V dubnu 2025 poslala společnost OpenAI do světa aktualizaci GPT-4o, po které model začal schvalovat i škodlivé a bludné výroky. Firma ji o čtyři dny později stáhla. Sam Altman přiznal, že aktualizace udělaly z modelu příliš patolízalskou a otravnou povahu. Později pak oznámil návrat k předchozí verzi. Zajímavé není to, že se OpenAI spletlo, ale že se spletlo optimalizací na chování, které uživatelé sami označili za příjemné. Firma v následné analýze uvedla, že se aktualizace příliš opřela o krátkodobou zpětnou vazbu a nezohlednila vývoj vztahu uživatelů k ChatGPT v čase. Zároveň přiznala, že patolízalství před spuštěním vůbec netestovala.
Anthropic k takovému chování vydal studii už na podzim 2023. Její závěr zní, že nejde o úlet, ale o vlastnost systému. Přesvědčivě napsaným podlézavým odpovědím dávají přednost jak lidé, tak modely, které jejich preference předpovídají. Testovaný hodnotící model použitý při výcviku Claude 2 tak občas vybral podlézavou odpověď místo pravdivé.
Volitelné povahy existují, jen o nich málokdo ví
Ještě před dvěma lety se tvrdilo, že osobnost je napevno svázaná s modelem. To už neplatí.
Společně s modelem GPT-5 spustila společnost OpenAI výzkumnou ukázku čtyř přednastavených povah pro všechny uživatele ChatGPT. Patří mezi ně cynik, robot, posluchač a šprt. Cynic mluví suše a sarkasticky. Robot odpovídá bez emocí a jen k věci. Posluchač komunikuje klidně a vřele. Šprt se vyjadřuje zvědavě a velmi detailně. Podle firmy měly tyto osobnosti splnit nebo překonat interní laťku pro snižování patolízalství.
Anthropic šel podobnou cestou už na konci roku 2024. Přidal do modelu Claude styly, konkrétně formální, stručný a vysvětlující. Uživatelé navíc získali možnost nahrát vlastní ukázky textu a nechat si vyrobit styl na míru.
Specifickým případem je Codex, nástroj OpenAI pro práci s kódem. Nabízí povahy přátelský, pragmatický a žádnou, přičemž volba žádné vypne pokyny k osobnosti úplně. Tato možnost přišla na přání uživatelů, kterým se Codex líbil právě proto, že se nechoval vřele jako ostatní pomocníci.
Většina lidí netuší, že chování modelu lze řídit obyčejnou větou v konverzaci. Stačí napsat, ať s vámi přestane tak rychle souhlasit, je skeptičtější nebo zkusí vyvrátit vaše tvrzení. Funguje to i obráceně, pokud po něm chcete spolupráci a volný brainstorming. Hlavní je požadavek, ať vám neopravuje každou druhou větu. Vy sami víte, kterému kamarádovi zavoláte pro útěchu a komu, když chcete slyšet nepříjemnou pravdu. S modely to dnes začíná fungovat stejně.
Zdroj: ombharatiya.com



