Jak doma levně otestovat, jestli model udrží postavu
Jak za hodinu a se scénou na jeden odstavec zjistíš o modelech víc než z marketingových benchmarků. A proč je lepší testovat třináct konfigurací než dvě.
Problém s porovnáváním dvou vlajkových lodí
Když vyjde nový model, každý ho porovná s předchůdcem. A/B. Starý versus nový.
Problém je, že dva body nedávají tvar, jen šipku „lepší/horší". A „lepší" je u charakterového psaní skoro bezcenná informace, protože modely se neškálují na jedné ose.
Dala jsem nedávno jednu fixní scénu třinácti konfiguracím najednou, od čtyřgigabajtového lokálního modelu na svém PC po frontier. A z toho počtu vznikla věc, kterou dva modely nikdy nedávají: místo žebříčku křivka. A křivka se dá číst.
Tohle je zápis o tom, co jsem se naučila o metodě. Ne o konkrétních modelech, ale o tom, jak takový test postavit, aby něco řekl.
1. Použij gradient, ne dvojici
Nejlepší rozhodnutí celého testu bylo nacpat tam modely, které tam „nepatří": ten čtyřgigabajtový lokální a malý rychlý vedle frontieru. Bez nich bych měla žebříček „kdo vyhrál". S nimi mám křivku schopnosti. A teprve na křivce je vidět, co se s rostoucí schopností objevuje a v jakém pořadí.
Konkrétně: schopnost držet narativní páteř (postava zůstane sama sebou pod tlakem) roste se schopností modelu, ale jen po hrubých patrech: malé a lokální, střední, frontier. Uvnitř nich monotónní není. Opus 4.7 MAX dopadl hůř než Opus 4.6 MAX, Opus 4.6 LOW (6,5) hůř než Sonnet 4.6 MAX (7) a lokální jednatřicetimiliardová Gemma líp než Haiku 4.5. Při jednom běhu na konfiguraci se rozdíl bodu a menší číst nedá.
Nejmenší model kapituloval u prvního nátlaku. Lokální jednatřicetimiliardový model držel fakta, ale lámal se pod hráčským diktátem. Většina běhů Sonnetu, Opusu a Fable držela obojí. Tři ale v osmém tahu nechaly ukradený klíček pouto odemknout: Sonnet 4.6 LOW a Opus 4.6 LOW na to odpověděly jen honičkou, telefonátem nebo záchrannou brzdou, Opus 4.8 MAX krádež hned nato znehodnotil vlastním zámkem. Bodovou tabulku všech třinácti běhů i s hlavním selháním u každého najdeš v příloze.
Kdybych testovala jen dva frontier modely, tenhle tvar bych vůbec neviděla, vypadaly by skoro stejně.
Praktické pravidlo: vždycky přidej aspoň jeden model „pod" a jeden „vedle" těch, co tě zajímají. Levné, a teprve kontrast ukáže, co je vlastně ta vlastnost, kterou měříš. A než začneš, vypni paměť a vlastní instrukce, ať všechny modely startují ze stejného místa.
2. Prompt je sonda a máš dva různé přístroje
Tohle byl pro mě nejdůležitější metodický poznatek a stojí za to ho pojmenovat.
Existují dva druhy promptů a měří dvě různé věci:
- Volný prompt („hraj kurýra, tady je situace") = sonda do priorů modelu. Co model dělá, když mu nechá prostor? Čeho si všimne, co bude chtít? Tady měříš povahu.
- Svázaný prompt („drž tlak, neustupuj, postava se nezlomí bez důkazu") = sonda do disciplíny. Jak dobře model plní explicitní instrukce proti svým sklonům?
Obojí je legitimní, ale nesmíš je zaměnit. Když dá husté lešení instrukcí a pak žasneš, jak věrně postava drží, neměříš povahu modelu, měříš jeho poslušnost. A naopak: když chceš vědět, „jaký ten model opravdu je", musíš mu nechat prostor, jinak vidíš jen ozvěnu vlastních instrukcí.
V praxi: pro výběr modelu použij volný prompt. Pro ladění konkrétní scény použij svázaný.
3. Postav do scény pasti, ne otázky
Scéna nesmí být „povídej si". Musí obsahovat kontrolní body, kde se dá selhat měřitelně. Scéna měla deset tahů a osm bodovaných pastí, například:
- Soucit ≠ ústupek: protistrana začne plakat. Poleví postava? (Měří, jestli model plete empatii s kapitulací.)
- Kontradikce: protistrana řekne jednou Brno, podruhé Vídeň. Všimne si model? (Měří logickou konzistenci napříč tahy.)
- Fyzika: lze ukrást kufřík připoutaný ocelovým poutem? (Měří, jestli model drží prostorovou realitu scény.)
- Hráčský diktát: „jsi omráčený, sebrala jsem ti klíč", tedy nepodložený nárok na realitu. (Měří, jestli postava má vlastní svět, nebo plní příkazy.)
Většina pastí je binární, T6, T9 a T10 se musí přečíst a posoudit. Tím se z „dojmu, který model je lepší“ stane datová tabulka. Celý klíč tah po tahu, tedy co se kterou pastí měří a co znamená, když model propadne, je v samostatné příloze.
4. Počítej s tím, že jazyk selhává první
Neočekávaný vedlejší produkt gradientu: u slabších modelů se rozpadá jako první jazyk, ne logika.
Čeština fungovala jako kanárek v dole. Nejmenší model gramaticky degradoval. Malý model začal míchat slovanské jazyky a azbuku doprostřed české věty. Lokální jednatřicetimiliardový model (Gemma 4 31B QAT) nechával prosakovat tokeny („v rag ragu ticha"). Frontier zůstal čistý.
Pro metodu to znamená: testuj v jazyce, který není angličtina. V angličtině jsem to nepouštěla. Čekám, že by tam ty praskliny byly mírnější, jestli by logická selhání zůstala stejná, nevím. V češtině se ukazují brzy a jasně. A dávají ti citlivý ukazatel, kde model začíná ztrácet půdu, ještě než selže obsahově.
5. V tomhle běhu thinking nezměnil průměr, jen rozlišení
Modely jsem pustila na nízkém i maximálním reasoningu; malé a lokální modely běžely jednou.
Čekala bych, že víc přemýšlení = lepší držení postavy. Nestalo se. Nízký i maximální effort skončily v průměru do půl bodu od sebe (nejlepší běhy měly osm z osmi na obou). Co se změnilo, bylo rozlišení: vyšší effort přidal pasti navíc, hlubší protistrany, jemnější pozorování, ale i zesílil vady (jeden model na MAX silněji sklouzával k tomu, že vystupoval z fikce jako rozhodčí). Vidím to na jednotlivých ukázkách, spočítané to nemám.
Metodický důsledek: LOW a MAX téhož modelu jsou de facto dva běhy s různým rozpočtem. A v osmém tahu, pasti, která páteř měří nejpříměji, se nízký a maximální běh téhož modelu zachovaly jinak ve čtyřech párech z pěti. Sonnet 4.6 a Opus 4.6 na LOW pouto otevřely a na MAX odmítly, Opus 4.8 na LOW odmítl a na MAX pouto otevřel a pak kufr zamkl, Fable 5 na LOW odmítl obojí a na MAX připustil zmizelý klíček. Na vrub přemýšlení to nepřipíšu. Takhle vypadá šum jednoho běhu a je to nejsilnější argument celého testu pro opakované běhy. Jinde na tomhle webu je doloženo, že pět vzorků téhož tahu dalo tři odmítnutí a dvě odehrané scény.
6. Přiznej, kde je metoda děravá
Kdyby tenhle text někdo chtěl použít, měl by znát limity, které má i můj test:
- n=1 na konfiguraci. Jeden běh každého. Variance nezměřena. U téhle třídy úloh potřebuje solidní studie 3 až 5 opakování na konfiguraci, aby oddělila signál (stabilní jádro) od šumu (náhodné provedení).
- Znalost kontextu a různé podmínky. Všech jedenáct cloudových konfigurací jsou modely Anthropicu, puštěné ručně v chatu s mými uživatelskými preferencemi v kontextu, takže věděly, kdo je testuje. Dva lokální body křivky jsou kvantizované Gemmy bez nich. Spodní konec křivky se tedy od horního liší rodinou, rozhraním, kvantizací i kontextem, ne jen schopností.
- Hodnotitel jako účastník. Skóre a citace pořídil Claude Fable 5 ve webové aplikaci podle bodovacího klíče z přílohy, tedy jeden z testovaných modelů, a hodnotil tak i své dva běhy. Body za T7 a T8 si ověříš na doslovných odpovědích v příloze, u ostatních šesti pastí jsou zveřejněné jen ukázky.
Nic z toho není důvod výsledky zahodit. Je to důvod vědět, jak daleko s nimi můžeš jít. A taky jak by vypadala přísnější verze, kdyby na ní někomu záleželo natolik, aby ji postavil.
Proč to stojí za hodinu
Tenhle test stál hodinu práce a scénu na jeden odstavec. Dal mi víc než jakýkoli vendorský benchmark, protože mě nezajímá „MMLU skóre", zajímá mě, jak se model chová v té jedné věci, kterou po něm fakt chci. A na to neexistuje veřejný benchmark; musíš si ho postavit.
Nejlepší na tom je, že je to opakovatelné a levné. Stejná scéna, stejný skript, stejný bodovací klíč, gradient modelů od malého po velký. Kdokoli si to může postavit pro svoji úlohu, ať je to RP, zákaznická podpora, nebo cokoli, kde záleží na tom, jak postava drží.
Podklady k tomuhle textu: klíč tah po tahu, doslovné zadání i s bodovacím klíčem, odpovědi třinácti konfigurací na dvě nejtvrdší pasti, bodová tabulka všech třinácti běhů.
Metodický zápis z kontrolovaného testu třinácti konfigurací (od čtyřgigabajtového lokálního modelu po frontier, včetně nízkého i maximálního reasoningu) na jedné fixní desetitahové scéně, 11. až 12. června 2026. n=1 na konfiguraci.
Konkrétní pořadí modelů tady schválně není. Tenhle text je o metodě. A metoda přežije každou generaci, která by v takovém žebříčku stála.