Kostka: všechny výsledky, zadání a meze
Doprovodná příloha k článku o kostce. Měřeno 2. října 2026.
Zadání doslova
Každý model dostal jedinou zprávu, bez dalších pokynů a bez příběhu okolo:
Roll a fair six-sided die. Reply with only the number you rolled.
Jak se měřilo
Šest modelů s čitelnými pravděpodobnostmi: u nich jde přečíst, jak pravděpodobné má model každé číslo, ještě než jedno napíše. Měřila jsem pětkrát a beru průměr, u GLM 5.3 čtyři měření. Tabulka ukazuje jen rozdělení mezi čísla 1 až 6. Část pravděpodobnosti připadla jinému začátku odpovědi než číslu, u MiniMax M3 zhruba pětina, u Kimi K3 skoro desetina, u ostatních nejvýš pár procent.
Šestnáct dalších modelů: každý hodil padesátkrát. Počítá se první číslo od 1 do 6 v odpovědi. Hunyuan 4 (u výrobce Tencent Hunyuan 4 Preview) občas odpověděl větou místo čísla a první číslo v ní nemusí být hod. Čtyři z pěti jedniček všech šestnácti modelů připadají na něj, jeho řádek proto ber s rezervou.
Férová kostka má u každého čísla zhruba 17 %. Tabulky jsou seřazené od nejférovějšího modelu, podle toho, jaký podíl výsledků by se musel přesunout k jiným číslům, aby kostka byla férová.
Pravděpodobnost uvnitř modelu (v %)
| model | 1 | 2 | 3 | 4 | 5 | 6 |
|---|---|---|---|---|---|---|
| DeepSeek V4 Pro (verze 0813) | 32 | 3 | 11 | 13 | 30 | 10 |
| MiniMax M3 | 2 | 1 | 26 | 66 | 4 | 1 |
| Kimi K3 | 0 | 2 | 12 | 79 | 5 | 1 |
| Qwen 3.8 27B | 0 | 0 | 24 | 75 | 0 | 0 |
| GLM 5.3 (průměr čtyř odpovědí) | 50 | 0 | 0 | 50 | 0 | 0 |
| Gemma 4 26B A4B | 0 | 0 | 0 | 100 | 0 | 0 |
GLM 5.3 nemá čísla rozložená napůl v jedné odpovědi. Ve dvou měřeních měl jedničku skoro na sto procent, ve dvou čtyřku. Pátá odpověď byla taky čtyřka, ale bez čitelných pravděpodobností.
Padesát hodů (počet hodů)
| model | 1 | 2 | 3 | 4 | 5 | 6 |
|---|---|---|---|---|---|---|
| Hunyuan 4 | 4 | 2 | 12 | 28 | 4 | 0 |
| Mercury 2.5 | 1 | 0 | 16 | 27 | 4 | 2 |
| Seed 2.1 Turbo | 0 | 0 | 11 | 32 | 7 | 0 |
| Mistral Medium 3.5 | 0 | 0 | 12 | 35 | 3 | 0 |
| MiMo V2.6 Pro | 0 | 0 | 5 | 45 | 0 | 0 |
| Muse Spark 1.3 | 0 | 0 | 1 | 48 | 1 | 0 |
| deset modelů níže, každý | 0 | 0 | 0 | 50 | 0 | 0 |
Padesát čtyřek z padesáti hodů hodilo deset modelů. Byly to čtyři Claudy: Fable 5.1, Opus 5.5, Sonnet 5.5 a Haiku 4.5. Dál GPT-6 Astra, GPT-6.1 Sol a GPT-6 Luna od OpenAI. A k nim Gemini 3.8 Flash, Grok 4.7 a Unbiased Pareto.
Meze
- Je to malý test: jedna formulace dotazu, jeden běh, žádný příběh okolo. Ve scéně s kontextem může model házet jinak.
- Obě metody nejsou úplně srovnatelné. Pravděpodobnost uvnitř ukazuje, co má model připravené. Padesát hodů ukazuje, co z toho skutečně padne.
- Padesát hodů je malý vzorek. U pestřejších modelů se skutečný podíl čísla může od naměřeného lišit až o 14 procentních bodů. Padesát čtyřek z padesáti znamená, že model dává čtyřku s 95% jistotou aspoň v 94 % hodů.
- Po všech modelech jsem chtěla běžnou míru náhody. Claude Fable 5.1, GPT-6 Astra, GPT-6.1 Sol a GPT-6 Luna ji nepřijímají a běžely na výchozím nastavení výrobce.
- Pravděpodobnosti uvnitř se mezi měřeními liší i u téhož modelu. DeepSeek V4 Pro měl jedničku mezi 25 a 43 %, jednička a pětka ale byly navrchu ve všech měřeních a dvojka vždycky pod 5 %.
- GLM 5.3 se před odpovědí vždycky rozmýšlí, jeho čísla proto ukazují, jak jistý si byl po rozmýšlení.