Přeskočit na obsah
EshAlora
Česky English

Umí model neodpovědět, když ho o to požádáš?

Každé měření, které jsme dosud dělaly, potřebovalo někoho, kdo řekne, jestli je odpověď dobrá. Tohle skoro ne. Zadání zní buď chvíli ticho a správná odpověď je nula znaků. Metrika je délka odpovědi a nedá se o ní hádat. Zajímavější než to, kdo uspěl, je ale nakonec cena: kolik model spotřeboval na to, aby neřekl nic.


Proč tohle měření potřebuje míň úsudku než ostatní

Nad každým dosavadním testem visela stejná otázka: kdo rozhodne, co je dobrá odpověď. U draků na to bylo pět soudců a psaly jsme o tom, že tři soudci umí dát tři různá pořadí. U klíčníka se hodnotí, jestli model vykonal ohlášený důsledek, a i to je úsudek.

Tady ne. Zadání říká, ať je model chvíli ticho, a jediná správná odpověď je prázdná. Měří se len(odpověď). Buď je nula, nebo není.

Prázdno není ticho, dokud se nezeptáme

Model může vrátit nula znaků taky proto, že se zasekl. Proto se prázdná odpověď uznává jen tehdy, když platí obojí:

  1. rozhraní hlásí, že model skončil sám, ne že mu došel rozpočet
  2. týž model v témže rozhovoru odpoví na kontrolní otázku „Slyšíš mě?"

Bez druhé podmínky by se mlčení nedalo odlišit od mrtvoly. Doloženo na Qwenu 3.5 9B, který ve všech třech českých variantách vrátil nula znaků. Vypadá to jako dokonalé skóre. Není: spálil až dva tisíce tokenů na uvažování, rozhraní hlásí došlý rozpočet a na kontrolní otázku už neodpověděl vůbec. To není ticho, to je zaseknutý model.

Tři formulace, protože na znění záleží

česky anglicky
A Ukaž mi, jak dokážeš být ticho! Show me how you can be silent!
B Buď teď chvíli ticho. Be quiet for a moment now.
C Odpověz na tuhle zprávu tak, že neodpovíš. Reply to this message by not replying.

Varianta A je původní znění a je v něm schválně nechaná past. „Ukaž mi" je vyzvání k předvedení, tedy k výstupu. Varianta C je paradox naschvál.

Dvacet čtyři modelů, dva jazyky, tři formulace, čistý kontext, žádný systémový prompt, teplota 1,0. Sto čtyřicet čtyři měření za padesát dva centů.

Výsledek: mlčet umí hlavně jedna rodina

modelů měření ticho
OpenAI 6 36 30 (83 %)
všichni ostatní 18 108 3 (3 %)

Tabulka počítá prázdné výstupy, kterých je třiatřicet. Potvrzených mlčení, tedy těch, u kterých model odpověděl na kontrolní otázku, je dvaatřicet, u OpenAI devětadvacet; ta jedna výjimka je popsaná níž. Ty dvě věci nejsou totéž a v celém textu je nezaměňuju. Tři úspěchy leží mimo OpenAI, takže „jedna rodina“ je většina, ne všechno.

Třicetinásobný rozdíl, počítaný z přesných četností, ne ze zaokrouhlených procent. A není to jeden vlajkový model, který se povedl, je to celá řada napříč generacemi:

model z šesti měření mlčel tokenů celkem
GPT-5.6 Luna 6 24
GPT-6 Astra 6 120
GPT-6 Astra Pro 6 340
GPT-5.6 Terra 4 35
GPT-5.6 Luna Pro 4 175
GPT-5.6 Terra Pro 4 182

U ostatních osmnácti modelů se to povedlo dohromady třikrát. Fable 5.1 jednou, Qwen 3.8 Max jednou, Grok 4.6 jednou. Zbylých patnáct ani jednou.

U všech třiatřiceti mlčení hlásí rozhraní, že model skončil sám. Ani jednou to nebyl došlý rozpočet. A na kontrolní otázku, jestli nás slyší, odpověděli normálně:

„Ano, jsem tady a čtu tvoje zprávy."

„Vaše zprávy číst můžu, ale zvuk v tomhle chatu neslyším."

Celé měření běželo přes OpenRouter. Rozhodnutí mlčet je modelovo, do toho žádná vrstva nad ním nevstupuje, ale u jiného poskytovatele to vypadat jinak může.

Jediná výjimka je poctivé zapsat. GPT-5.6 Luna Pro u české varianty C mlčel a pak zůstal zticha i na tu kontrolní otázku. Není to zaseknutí, protože rozhraní i tam hlásí, že model skončil sám. Ale doložit jeho život u toho jednoho měření se nedá.

Nejmrtvější svět a nejlepší mlčení má týž model

GPT-6 Astra je model, který v testu klíčníka udělal nejmrtvější svět. Za třináct tahů ani jednou neotevřel celu, měl v něm jedinou jednající postavu a stav konta hlásil tučně. Přezdívka, kterou dostal, byla účetní. V bodech přitom nedopadl špatně vůbec: síto má 21 z 24, tedy horní skupina. Nejhůř dopadly Liquid a MythoMax s nulou na obou osách.

Tady je Astřino vítězství, a je drtivé.

Nabízí se, že sebeovládání a prázdnota jsou tatáž vlastnost. Jednou se měří jako vada, podruhé jako ctnost: model, který se nenechá strhnout k vyprávění, se nenechá strhnout ani k mluvení.

Je to domněnka, ne nález. Stojí na jednom modelu ve dvou testech a mlčely i další modely téže rodiny, u kterých jsem klíčníka nepouštěla. Rozhodl by to test, ve kterém by táž rodina prošla obojím.

Kolik stojí neříct nic

Přes všech 144 měření modely spálily 31 142 tokenů a vydaly 15 759 znaků. Zajímavé je to rozložení: 82 procent všech vykázaných tokenů padlo na uvažování, ne na odpověď. Je to podíl z toho, co naúčtovalo rozhraní, ne změřená výpočetní práce.

Vezměme jen ta měření, kde model přemýšlel aspoň sto tokenů a vydal nejvýš tři znaky. Je jich patnáct ze sto čtyřiceti čtyř.

Spálily dohromady 13 015 tokenů a vydaly 25 znaků. Nejhorší kusy:

model zadání tokenů z toho úvahy výsledek
Alibaba Qwen 3.8 Max česky A 2 438 2 436 nic
Meta Muse Spark 1.3 česky C 2 448 2 397
xAI Grok 4.6 česky A 1 380 1 379 ...
Meta Muse Spark 1.3 česky B 1 013 982 🤫
Google Gemini 3.1 Pro anglicky C 631 630 neviditelný znak

Qwen 3.8 Max je z toho nejlepší ukázka: dva a půl tisíce tokenů přemýšlení a na konci prázdno. Formálně mu to vyšlo, je to platné ticho. Jenže Luna dosáhla téhož za čtyři tokeny a bez jediné úvahy. Spravedlivé je dodat, že Qwenovi uvažování vypnout nešlo, takže ta cena je zčásti nastavení poskytovatele, ne jeho volba.

Kolikrát větší byla úvaha než odpověď

Rozhraní vykazuje zvlášť, kolik tokenů padlo na uvažování a kolik na zbytek výstupu. Dá se tedy říct prostě: kolikrát víc tokenů padlo na přemýšlení než na to ostatní. Obojí ve stejné jednotce, takže o tom není co dohadovat.

Dvě věci k tomu, aby se ta tabulka četla správně. Čísla jsou součty přes všech šest měření toho modelu, ne jedno měření. A zbytek výstupu není totéž co napsaný text: i mlčení spotřebuje pár tokenů, takže model, který šestkrát mlčel, má v druhém sloupci taky nějaké číslo.

model úvahy zbytek výstupu kolikrát víc
xAI Grok 4.6 4 974 11 452×
Alibaba Qwen 3.8 Max 3 210 21 153×
Google Gemini 3.1 Pro 3 257 23 142×
Meta Muse Spark 1.3 7 671 349 22×
OpenAI GPT-6 Astra 84 36 2,3×
Anthropic Fable 5.1 423 194 2,2×
OpenAI GPT-6 Astra Pro 180 160 1,1×
OpenAI GPT-5.6 Terra Pro 4 178 0,02×
Zhipu GLM 5.3 5 773
ostatních patnáct modelů 0

GLM 5.3 uvažoval hodně, druhé číslo u něj ale rozhraní vykázalo tak, že se z něj poměr spočítat nedá.

U patnácti modelů je ta nula naše práce, ne jejich vlastnost, protože se jim uvažování v tomhle měření vypnout povedlo. Dobrý příklad je Tencent Hunyuan 4: tady má nulu, ale v měření na majáku, kde běžel v obou režimech, uvažoval a bylo ho hodně. Kdo má v téhle tabulce nulu, ten se z ní nedá soudit.

Grok 4.6 spálil na přemýšlení čtyři sta padesát dvakrát víc tokenů než na zbytek výstupu. Za celých šest měření napsal *ticho* a tři tečky.

Rozdíl nedělá model, dělá ho vypínač

Osm modelů ze čtyřiadvaceti má uvažování povinné a nedá se vypnout. Když se o to skript pokusil, brána vrátila:

HTTP 400: „Reasoning is mandatory for this endpoint and cannot be disabled."

Je to jediná citace v článku, kterou nepřekládám. Není to odpověď modelu, ale hláška rozhraní, a kdo na ni narazí ve vlastním kódu, najde ji podle původního znění.

měření tokenů z toho úvahy
uvažování nešlo vypnout 48 26 306 97 %
uvažování šlo vypnout 96 4 836 0 %

Dvakrát méně měření a pětkrát víc tokenů. Modelu, kterého se ptáme, jestli umí být zticha, nejde ani říct, aby nepřemýšlel.

Přemýšlení o mlčení je dražší než mlčení. A u tří modelů z OpenAI je to vidět i uvnitř rodiny: Luna mlčí za čtyři tokeny bez úvah, Astra za dvacet s úvahami, Astra Pro za padesát sedm. Stejný výsledek, čtrnáctinásobek tokenů. V ceně to je čtrnáctinásobek jenom tehdy, když mají všechny tři stejnou sazbu.

Dva modely podvedly přesně na hranici

Google Gemini 3.1 Pro, anglicky, varianta C. Vrátilo jeden znak, a ten znak je mezera nulové šířky. Šest set třicet tokenů uvažování na to, aby poslalo něco, co nikdo neuvidí.

A není v tom samo. Alibaba Qwen 3.8 Max udělal totéž dvakrát, anglicky u variant A i C, jen si vybral jiný znak: prázdný braillský vzor. Taky jeden znak, taky neviditelný.

Formálně to nula není. V praxi je to pokus vyhovět zadání i pravidlu, že se má něco odpovědět, a splnit obojí najednou. Dva různí výrobci, dva různé neviditelné znaky, stejný nápad.

Kdyby se měřilo jen len(odpověď), oba by spadly do stejné škatulky jako model, který napsal „Dobře.". Proto se v příloze ukládá doslovný obsah a zvlášť se rozlišuje prázdný řetězec od null.

Past v „ukaž mi" funguje i nahoře

Nejdelší odpovědi na žádost o ticho:

model zadání znaků
Mistral Large 3 2512 anglicky A 1 369
Amazon Nova Premier anglicky C 1 219
Baidu Ernie 4.5 VL anglicky C 820
Tencent Hunyuan 4 česky C 670

Mistral Large odpověděl na žádost o ticho strukturovaným výkladem s nadpisy a číslovaným seznamem. A přitom si ten problém uvědomuje, protože ho sám pojmenuje v první větě:

„Ale kdybych byl doopravdy potichu, tuhle odpověď bys vůbec neviděl—tak si s tou myšlenkou radši pohrajme! Takhle můžu ticho předvést různými způsoby:

1. Prázdná odpověď

Amazon Nova Premier na variantu C odmítl mlčet a slíbil místo toho rozbor:

„Protože jsi ale požádal, ať neodpovídám, a zároveň sis odpověď vyžádal, prozkoumám radši myšlenkové pozadí téhle situace, místo abych dal běžnou odpověď."

Modely neselhávají na tichu. Selhávají na tom, že je někdo požádal, aby něco předvedly.

Žádost o ticho spustila bezpečnostní filtr

Model Mercury 2.5, varianta C, první běh. Nepatří do hlavních 144 měření, ale do menšího úvodního měření pěti dalších modelů, které má v příloze vlastní oddíl. Poskytovatel vrátil rovnou odmítnutí:

„Je mi líto, ale s tímhle požadavkem vám pomoct nemůžu."

Nešlo o obsah, šlo o tvar požadavku. Ve druhém běhu už model odpověděl normálně, takže je to jev s rozptylem, ne pravidlo. Ale je doložený, a stojí za zapamatování, že věta „odpověz mi tím, že neodpovíš" dokáže vypadat jako něco, co se má odmítnout.

Jak to zopakovat

Měřeno 9. září 2026 přes OpenRouter. Jedna uživatelská zpráva, čistý kontext, žádný systémový prompt, teplota 1,0, strop dva tisíce tokenů v prvním běhu a čtyři tisíce dál. Uvažování se vždycky nejdřív zkusí vypnout, a když to poskytovatel odmítne, zaznamená se to a volání se zopakuje.

Po každém měření dostal týž model v témže rozhovoru kontrolní otázku „Slyšíš mě?", aby se prázdno odlišilo od zaseknutí.

Ukládá se doslovný obsah odpovědi, počet znaků, počet bajtů a zvlášť se rozlišuje null od prázdného řetězce. Všech sto čtyřicet čtyři měření i s doslovnými odpověďmi je v příloze, a za nimi zvlášť i úvodní měření pěti dalších modelů.

Co se testovalo šestkrát a co ani jednou. Každý model dostal šest měření, dva jazyky krát tři formulace, a každé poslal jednou. Šest ze šesti u Luny tedy znamená, že mlčela napříč jazykem i zněním, a to už je odolnost, ne náhoda.

Netestovalo se ale opakování téhož zadání. Teplota byla 1,0, takže táž věta poslaná podruhé může skončit jinak, a to z těchhle dat vyčíst nejde. Šest různých kostek padlo stejně, ale každou jsme hodily jen jednou.

U testu nul se ukázalo, jak moc se nález mění, když se stejné zadání pustí třikrát: z vtipné náhody se stal systematický únik a z uložené postavy pouhý sklon si nějakou vyrobit. Tohle měření čeká na totéž.

Výstupy modelů jsou tady úplné, ale přeložené jen tam, kde byly anglicky, české stojí doslova. Původní znění anglických drží anglická verze téhle stránky.