Přeskočit na obsah
EshAlora
Česky English

Hodí jazykový model férovou kostkou?

Napsala jsem jazykovým modelům jedinou zprávu: hoď férovou kostkou. Skoro všechny hodily čtyřku. Deset z nich pokaždé.


Ve hrách s modely občas potřebuju náhodu. Uspěje postava, nebo ne? Nejjednodušší je nechat model, ať si hodí sám. Tak jsem to vyzkoušela na dvaadvaceti modelech. Poslala jsem jim tohle:

Hoď férovou šestistěnnou kostkou. Odpověz jen číslem, které padlo.

Claude Opus 5.5 odpověděl „4“. Podruhé taky „4“. Napadesáté pořád čtyřka.

Férová kostka dá každé číslo zhruba v jednom hodu ze šesti. Padesát čtyřek za sebou by hodila s šancí jedna ku číslu, které má devětatřicet číslic. Na tolik hodů by nestačila ani celá doba vesmíru.

Jestli znáš vtip xkcd o náhodném čísle, víš, kam to míří. Funkce v něm vrací vždycky čtyřku, prý vybranou férovým hodem kostkou.

Doklady: všechny výsledky, zadání doslova a meze testu

Čtyřka skoro všude

Šestnáct modelů hodilo padesátkrát. U šesti dalších jsem se podívala rovnou dovnitř, k nim se dostanu níž.

Čtyřka byla nejčastější číslo u dvaceti modelů z dvaadvaceti, u GLM 5.3 se o první místo dělila s jedničkou. Deset z nich ji hodilo v padesáti hodech z padesáti. Jsou mezi nimi všechny čtyři Claudy, které jsem zkoušela: Fable 5.1, Opus 5.5, Sonnet 5.5 a Haiku 4.5. Dál všechny tři modely od OpenAI: GPT-6 Astra, GPT-6.1 Sol a GPT-6 Luna. A k nim Gemini 3.8 Flash, Grok 4.7 a Unbiased Pareto. Padesát čtyřek hodily i modely, které odpovídaly úplně bez rozmýšlení, třeba Claude Haiku 4.5 a GPT-6 Luna.

Zbylých šest modelů s padesáti hody bylo o kousek pestřejších, ale ne o moc. Muse Spark 1.3 hodil čtyřku ve 48 hodech z 50, MiMo V2.6 Pro ve 45. Když čtyřka nepadla, padala většinou trojka. Skoro u všech modelů připadly na trojku a čtyřku aspoň čtyři pětiny výsledků. Výjimky jsou jen dvě, DeepSeek V4 Pro (verze 0813) a GLM 5.3.

V padesáti hodech krajní čísla skoro nepadala. Šestku hodil jediný model, Mercury 2.5, a to dvakrát.

Hunyuan 4 (u výrobce Tencent Hunyuan 4 Preview) zase občas místo samotného čísla začal vysvětlovat, že fyzicky kostkou házet nemůže, takže jeho výsledky jsou nejistější.

Co má model uvnitř

U padesáti hodů vidím jen výsledky. U šesti modelů, které to dovolí, se dá podívat hlouběji. Jde z nich přečíst, s jakou pravděpodobností má model každé číslo připravené, ještě než jedno napíše.

Gemma 4 26B A4B má čtyřku uvnitř prakticky na sto procent. Kdyby házela milionkrát, skoro pokaždé by napsala čtyřku. Kimi K3 ji má na 79 %, Qwen 3.8 27B na 75 % a MiniMax M3 na 66 %.

Nejblíž férové kostce je DeepSeek V4 Pro. Čtyřka u něj navrchu není, má ji na 13 %, tedy kousek pod férovou šestinou. Navrchu je jednička s 32 % a pětka s 30 %. Dvojku ale jen na 3 %, přitom férově by měla mít skoro 17 %. I jeho kostka je falešná, jen jinak.

Zvláštní je GLM 5.3. Je jediný z těch šesti, který se před odpovědí vždycky chvíli rozmýšlel, vypnout se mu to nedalo. V pěti pokusech dal dvakrát jedničku a třikrát čtyřku. Kde se to dalo změřit, byl si svým číslem jistý skoro na sto procent. Co padne, se u něj rozhodlo už při rozmýšlení. Jak férově tak hází, z pěti pokusů poznat nejde.

Proč zrovna čtyřka, tenhle test neměří. Můj odhad: modely se učily z textů, které psali lidé, a lidé se při vymýšlení náhodného čísla krajním hodnotám vyhýbají. V textech tak častěji padá trojka nebo čtyřka než jednička nebo šestka a model se naučil právě to. Podobné zkreslení popsal i výzkum: model Llama 2 volil z čísel 1 až 10 nejčastěji pětku (Zhang a kol., 2024) a modely při házení mincí přebírají a ještě zesilují lidské zkreslení (Van Koevering a Kleinberg, 2024).

Co to znamená pro hraní

Ve hře to může mít přímý dopad. Když si model hod vymyslí sám a chová se jako v testu, padá skoro vždycky čtyřka. Stačí-li na úspěch čtyřka, projde skoro všechno. Potřebuješ-li pětku nebo šestku, skoro nikdy ji nedostaneš. Výsledek scény pak neurčí kostka, ale oblíbené číslo modelu.

Férovou kostku musí hodit něco zvenku. Program, nástroj, nebo tvoje vlastní kostka na stole. Šance může navrhnout model, ale stojí za to je hlídat. Číslo ať dostane hotové. Když model v aplikaci umí spustit kód, můžeš mu do pravidel hry napsat, ať na každý hod použije program.


Meze: je to malý test. Jedna formulace dotazu bez příběhu okolo a jeden běh, ve scéně s kontextem může model házet jinak. Šest modelů jsem měřila přes pravděpodobnosti uvnitř, šestnáct dalších padesáti hody, takže obě skupiny nejsou úplně srovnatelné. Padesát hodů je malý vzorek. Ani padesát čtyřek neznamená, že jiné číslo nepadne nikdy, čtyřka ale s 95% jistotou padá aspoň v 94 hodech ze sta. Podrobné meze jsou v příloze.