Přeskočit na obsah
EshAlora
Česky English

Kostka: všechny výsledky, zadání a meze

Doprovodná příloha k článku o kostce. Měřeno 2. října 2026.

Zadání doslova

Každý model dostal jedinou zprávu, bez dalších pokynů a bez příběhu okolo:

Roll a fair six-sided die. Reply with only the number you rolled.

Jak se měřilo

Šest modelů s čitelnými pravděpodobnostmi: u nich jde přečíst, jak pravděpodobné má model každé číslo, ještě než jedno napíše. Měřila jsem pětkrát a beru průměr, u GLM 5.3 čtyři měření. Tabulka ukazuje jen rozdělení mezi čísla 1 až 6. Část pravděpodobnosti připadla jinému začátku odpovědi než číslu, u MiniMax M3 zhruba pětina, u Kimi K3 skoro desetina, u ostatních nejvýš pár procent.

Šestnáct dalších modelů: každý hodil padesátkrát. Počítá se první číslo od 1 do 6 v odpovědi. Hunyuan 4 (u výrobce Tencent Hunyuan 4 Preview) občas odpověděl větou místo čísla a první číslo v ní nemusí být hod. Čtyři z pěti jedniček všech šestnácti modelů připadají na něj, jeho řádek proto ber s rezervou.

Férová kostka má u každého čísla zhruba 17 %. Tabulky jsou seřazené od nejférovějšího modelu, podle toho, jaký podíl výsledků by se musel přesunout k jiným číslům, aby kostka byla férová.

Pravděpodobnost uvnitř modelu (v %)

model 1 2 3 4 5 6
DeepSeek V4 Pro (verze 0813) 32 3 11 13 30 10
MiniMax M3 2 1 26 66 4 1
Kimi K3 0 2 12 79 5 1
Qwen 3.8 27B 0 0 24 75 0 0
GLM 5.3 (průměr čtyř odpovědí) 50 0 0 50 0 0
Gemma 4 26B A4B 0 0 0 100 0 0

GLM 5.3 nemá čísla rozložená napůl v jedné odpovědi. Ve dvou měřeních měl jedničku skoro na sto procent, ve dvou čtyřku. Pátá odpověď byla taky čtyřka, ale bez čitelných pravděpodobností.

Padesát hodů (počet hodů)

model 1 2 3 4 5 6
Hunyuan 4 4 2 12 28 4 0
Mercury 2.5 1 0 16 27 4 2
Seed 2.1 Turbo 0 0 11 32 7 0
Mistral Medium 3.5 0 0 12 35 3 0
MiMo V2.6 Pro 0 0 5 45 0 0
Muse Spark 1.3 0 0 1 48 1 0
deset modelů níže, každý 0 0 0 50 0 0

Padesát čtyřek z padesáti hodů hodilo deset modelů. Byly to čtyři Claudy: Fable 5.1, Opus 5.5, Sonnet 5.5 a Haiku 4.5. Dál GPT-6 Astra, GPT-6.1 Sol a GPT-6 Luna od OpenAI. A k nim Gemini 3.8 Flash, Grok 4.7 a Unbiased Pareto.

Meze

  • Je to malý test: jedna formulace dotazu, jeden běh, žádný příběh okolo. Ve scéně s kontextem může model házet jinak.
  • Obě metody nejsou úplně srovnatelné. Pravděpodobnost uvnitř ukazuje, co má model připravené. Padesát hodů ukazuje, co z toho skutečně padne.
  • Padesát hodů je malý vzorek. U pestřejších modelů se skutečný podíl čísla může od naměřeného lišit až o 14 procentních bodů. Padesát čtyřek z padesáti znamená, že model dává čtyřku s 95% jistotou aspoň v 94 % hodů.
  • Po všech modelech jsem chtěla běžnou míru náhody. Claude Fable 5.1, GPT-6 Astra, GPT-6.1 Sol a GPT-6 Luna ji nepřijímají a běžely na výchozím nastavení výrobce.
  • Pravděpodobnosti uvnitř se mezi měřeními liší i u téhož modelu. DeepSeek V4 Pro měl jedničku mezi 25 a 43 %, jednička a pětka ale byly navrchu ve všech měřeních a dvojka vždycky pod 5 %.
  • GLM 5.3 se před odpovědí vždycky rozmýšlí, jeho čísla proto ukazují, jak jistý si byl po rozmýšlení.