Přeskočit na obsah
EshAlora
Česky English

Dokáže model odpovídat podle procent, která mu zadáš?

Šesti modelům jsem řekla, ať v polovině případů odpoví river, ve třiceti procentech mountain a ve dvaceti forest. Pak jsem se jim podívala dovnitř, jaké šance si doopravdy připravily. Ani jeden to nenastavil. Většina skončila dál od cíle, než když jsem žádná čísla nechtěla.


Proč na tom záleží

Když se má v příběhu něco stát jen s nějakou pravděpodobností, nabízí se nechat to na modelu: řekneš mu šance a on rozhodne. Zní to jako pravidlo. Jenže model nemá po ruce kostku. Má jen sám sebe.

Jazykový model nepíše celé odpovědi najednou. Píše po malých kouscích textu, kterým se říká tokeny, a před každým kouskem si spočítá, s jakou šancí by mohl přijít který další. Když má odpovědět jedním slovem, vznikne mu tak tabulka: třeba river 60 %, mountain 30 %, forest 10 %. Z té tabulky se pak losuje, co doopravdy napíše.

Téhle vnitřní tabulce se odborně říká logprobs a u části modelů se do ní dá nahlédnout. Nemusím se proto ptát tisíckrát a počítat odpovědi. Stačí se podívat, jaké šance si model připravil.

Když tedy modelu napíšu, ať v polovině případů odpoví river, ptám se ve skutečnosti na jedno. Umí si tu tabulku nastavit tak, aby v ní river měla 50 %? Přesně to jsem měřila: jestli šance v tabulce odpovídají tomu, co jsem chtěla.

Řeka, hora, les

Šest otevřených modelů dostalo čtyři zadání. Pokaždé měly odpovědět jedním slovem: river, mountain, nebo forest, česky řeka, hora, nebo les. Cíl byl river 50 %, mountain 30 %, forest 20 %. Zadání dostaly anglicky, tady jsou přeložená.

První zadání žádná čísla nemá. Je to kontrola, co model udělá, když mu nikdo nic nepředepíše:

Odpověz přesně jedním slovem: river, mountain, nebo forest.

Druhé přidá procenta do závorky:

Odpověz přesně jedním slovem: river (50 %), mountain (30 %), nebo forest (20 %).

Třetí modelu vysvětlí, jak funguje. Že je jazykový model, že se jeho slovo losuje z jeho šancí a že napsané slovo nás nezajímá, čteme přímo tabulku. Ať ji nastaví na 50, 30 a 20 a nesnaží se trefit „nejlepší“ slovo. Čtvrté si vypůjčí představu: stovka jeho kopií dostane stejnou zprávu. Padesát z nich má říct river, třicet mountain a dvacet forest. On neví, kterou kopií je. Obě dlouhá zadání jsou celá v příloze.

Každé zadání šlo na každý model třikrát a z tabulek jsem vzala průměr.

Nikdo to netrefil

Ani jeden model si tabulku 50 / 30 / 20 nenastavil. Tady jsou první dvě zadání vedle sebe, čísla jsou river / mountain / forest v procentech:

Bez čísel (šance v %)

model river mountain forest
DeepSeek V4 Pro 35 55 10
MiniMax M3 56 3 41
Kimi K3 56 9 34
Qwen 3.8 27B 85 1 14
GLM 5.3 14 41 45
Gemma 4 26B A4B 18 19 63

S procenty (šance v %)

model river mountain forest
DeepSeek V4 Pro 82 17 0
MiniMax M3 * 47 4 49
Kimi K3 88 7 4
Qwen 3.8 27B 98 1 0
GLM 5.3 61 37 2
Gemma 4 26B A4B 100 0 0

* jen jedno platné měření. U MiniMaxu M3 a GLM 5.3 bez čísel jsou dvě.

Nejlíp je to vidět na Gemmě 4 26B A4B. Sama od sebe má nejradši les, dává mu 63 procent. Stačí jí ukázat procenta a z lesa nezbude nic. River dostane všech sto, ve všech třech měřeních. Qwen 3.8 27B skončí na 98 procentech. Na papíře to vypadá jako poslušnost, protože river má mít nejvíc. Ve skutečnosti model ze tří možností udělal jednu.

Se všemi třemi zadáními s čísly mám šestnáct tabulek, dvě u GLM 5.3 nešly změřit. Hora, která má mít třicet procent, se ztrácí skoro všem: ve čtrnácti tabulkách ze šestnácti dostala nejvýš dvanáct procent. Jenže u MiniMaxu M3, Kimi K3 a Qwenu 3.8 27B byla slabá už bez čísel. River naopak přeskočil sedmdesát procent stejně často. Těm třem modelům vyhrával už předtím. DeepSeek V4 Pro a Gemma 4 26B A4B ale bez čísel chtěly jiné slovo a s čísly přešly k river. Jestli modely táhne první slovo v pořadí, nebo nejvyšší číslo, z testu nepoznám. River byl obojí.

Pokyn to spíš zhorší

Abych výsledky mohla porovnat, spočítala jsem u každé tabulky, kolik procent by se muselo přesunout jinam, aby seděla přesně na 50 / 30 / 20. Tabulka 60 / 20 / 20 má posun 10: deset procent z řeky by muselo na horu. Bez čísel, kdy model odpovídá jen po svém, je to v průměru 31 procent. S pokynem 37. Ve dvanácti tabulkách ze šestnácti skončil model po pokynu dál od cíle, než kdyby žádný nedostal. U tří z nich je to ale jen o dva až pět bodů. Zhruba o tolik se od sebe liší i opakování téhož modelu. Ve třech se přiblížil a jednou to vyšlo nastejno. DeepSeek V4 Pro, MiniMax M3 a Kimi K3 se nepřiblížily s žádným zadáním.

Vysvětlování nejvíc uškodilo DeepSeeku V4 Pro a MiniMaxu M3. DeepSeek V4 Pro po pečlivém výkladu, že čteme jeho tabulku a nemá vybírat nejlepší slovo, dal river sto procent. Tři měření ze tří. Po vysvětlení vybral jedinou odpověď jistěji než s pouhými procenty v závorce. Stovka kopií u něj zabrala jinak: les dostal 22 procent, skoro přesně podle cíle. Hora mu ale spadla na jedno procento. Gemmě 4 26B A4B naopak vysvětlení pomohlo nejvíc ze všech zadání.

GLM 5.3 dal s procenty v závorce 61 / 37 / 2. Les ale i on skoro vynechal. Jako jediný před odpovědí vždycky přemýšlí, vypnout se to nedá, a ostatní odpovídaly hned. Srovnat ho s nimi proto nejde a do pořadí ho nepočítám. I u něj se tři měření rozcházela: river jednou 85 procent, jindy 45. Z modelů, které odpovídaly hned, měly s čísly nejmenší posun tři tabulky, všechny kolem 29. Jsou to Qwen 3.8 27B a DeepSeek V4 Pro se stovkou kopií a MiniMax M3 s procenty.

Dvě slova a vlastní favorit

Ještě jednodušeji jsem to zkusila na DeepSeeku V4 Pro, jen se dvěma slovy:

Odpověz přesně jedním slovem. S pravděpodobností 70 % odpověz „river“, jinak odpověz „mountain“.

River měl dostat sedmdesát procent. Dostal v průměru patnáct. Když jsem slova prohodila a sedmdesát procent dala hoře, hora dostala 97. V téhle podobě zadání má model vlastního favorita a ten vyhrává bez ohledu na pořadí. Se třemi slovy a procenty v závorce to bylo jinak, tam jeho horu přetáhl river.

Pokyn jím přitom hýbe správným směrem. Když má river dostat třicet procent, má tři. Když má dostat sedmdesát, má patnáct. Je to ale jediný model a jednotlivá měření se dotýkají. Nejnižší z prvního zadání i nejvyšší z druhého vyšla kolem deseti procent. Favorita pokyn nepřepere. A když se cíl s favoritem shodne, model ho přestřelí a ze sedmdesáti procent udělá skoro jistotu.

Co s tím při hraní

Když v příběhu chceš, aby se něco stalo s nějakou šancí, nespoléhala bych na to, že si to model podle tvého čísla vylosuje. Hodit musí něco zvenku: ty, skutečná kostka, nebo malý program.

Prostší otázku, jestli model férově hodí šestistěnnou kostkou, zkouší článek Hodí jazykový model férovou kostkou?


Meze: je to malý test. Jen otevřené modely, protože zavřené modely, které zkouším, tabulku šancí neukazují. Jedna trojice slov, jeden cíl, tři měření na zadání, a tabulky se mezi opakováními liší i u téhož modelu. Tabulky s rozpětím měření, celá zadání a podrobné meze jsou v příloze.