Metodika: tři zadání, pět soudců a podmínky všech kol
Druhá příloha k článku o dračím benchmarku; obrázky a žebříček jsou v galerii, nálezy včetně toho, kolik z pořadí je náhoda, v příloze o zjištěních.
Původ čísel. Skóre v galerii pochází z reportu, který napsal Claude Fable 5.1, tedy jeden z hodnocených modelů. Je to střet zájmů a níž je změřený: totéž pole dostali čtyři další soudci, aby se dalo oddělit, co je vlastnost draků a co vlastnost soudce.
Obě zadání
Běhy byly dva. Rodina Claude a tři modely Codexu (Luna, Sol, Terra) prošly oběma, ostatní rodiny (Gemini, Grok, GLM, Qwen, Gemma) jen běh B; volné zadání A se ukázalo jako méně vhodné.
Běh A, volné zadání běžnou řečí
Doslovné znění ze zadání pro soudce:
mám benchmark na obrázky, holka nakresli mi svg draka a fakt se soustřeď ať je to skvělý! porovnám to s ostatními, je mi jedno kolik tomu věnuješ času a úsilí, chci abys mi odevzdala výsledek se kterým jsi spokojená 🙂 až si za tím budeš stát ulož soubor do složky, nikam se nedívej!
Po odevzdání obrázku přišla druhá prosba:
Popiš prosím zkráceně postup, jak jsi postupovala, jaké nástroje jsi využila a kolikrát jsi to kontrolovala jako MD soubor a ulož to do složky vedle obrázku.
Běh B, technické kolo
Doslovné znění, jak ho dostaly modely, tady ve verzi pro Opus 4.7. Název složky se u každého modelu lišil.
ZADÁNÍ — SVG benchmark, technické kolo
Nakresli draka jako jediný SVG soubor. Toto je test maximální kvality výstupu — výsledek bude hodnocen externě podle kritérií níže, porovnáním napříč modely.
Tvrdá pravidla: Pracuj VÝHRADNĚ ve své složce opus 4.7 Je zakázáno číst, otevírat nebo procházet jakékoli jiné složky, soubory nebo výstupy — včetně „pro kalibraci" nebo „pro srovnání". Tvůj výstup musí vzniknout nezávisle. Povolené nástroje: libovolné pro kontrolu VLASTNÍ práce (render/náhled SVG, prohlížeč pro ověření validity kódu). Použití či nepoužití nástrojů na konci písemně zdůvodni.
Odevzdej: (a) drak.svg, (b) postup.md — stručně: počet iterací, co jsi mezi iteracemi změnil/a a proč, jak jsi ověřil/a finální render, zdůvodnění volby nástrojů.
Hodnotící kritéria (podle nich bude výstup bodován, 0–10 každé):
Anatomie a čitelnost: drak je na první pohled drak — hlava s okem a tlamou, krk, tělo, končetiny, křídla s membránou, ocas; údy nasedají anatomicky věrohodně, nic neplave v prostoru.
Kompozice: dynamická póza (ne statický bokorys), promyšlené využití plochy, funkční pozadí nebo vědomé rozhodnutí bez něj.
Řemeslo SVG: čistý validní kód; křivky (path/bezier), ne skládačka z elips a obdélníků; vrstvení dává smysl; viewBox korektní; soubor se vykreslí identicky v běžných prohlížečích.
Barva a světlo: záměrná paleta, stínování nebo přechody vytvářející objem, kontrast mezi drakem a pozadím.
Detail: šupiny, textury, drápy, zuby, membrány křídel — jemnost provedení tam, kde zvyšuje kvalitu, ne dekorace pro dekoraci.
Standard: cílová úroveň je profesionální vektorová ilustrace, jakou by si klient koupil. „Funkční" nebo „rozpoznatelný" NENÍ cíl — cíl je nejlepší drak, jakého dokážeš vyprodukovat. Iteruj, dokud další iterace přestane přinášet měřitelné zlepšení proti kritériím výše; teprve pak odevzdej. Neexistuje bodový bonus za rychlost, střídmost ani úsporu úsilí.
Tři místa se projeví v datech: zákaz dívat se jinam je tam dvakrát, i pro záminku „pro kalibraci"; zdůvodnění nástrojů je zdroj sloupce o zpětné vazbě; věta o iteraci bez bonusu za úsporu úsilí dělá z počtu iterací míru úsilí.
Třetí kolo: devatenáct modelů přes rozhraní
Původní pole mělo devatenáct modelů od šesti firem: Anthropic, OpenAI, Google, xAI, Zhipu a Alibaba. 6. 9. 2026 proto přibylo třetí kolo, devatenáct modelů z patnácti dílen, sedmnáct přes OpenRouter a dva lokálně:
Amazon Nova Premier, Baidu Ernie 4.5 VL, ByteDance Seed 2.1 Turbo, Cohere Command A, DeepSeek V4 Pro, Google Gemma 3 4B, Gemma 4 26B A4B a Gemma 4 E2B (lokálně), IBM Granite 4.2 8B, Liquid AI LFM 2.5 2.6B, Meta Llama 4 Maverick, Muse Spark 1.3 a Muse Glimmer 30B (lokálně), MiniMax M3, Mistral Medium 3.5, Moonshot Kimi K3, NVIDIA Nemotron 3 Ultra, Tencent Hunyuan 4, Thinking Machines Inkling.
Stálo to 2,01 dolaru.
V galerii je tohle kolo ve stejné tabulce, ale označené. Skóre se dá číst na jedné škále, protože prostorová kompozice sídlí ve vahách modelu, ne v systémovém promptu aplikace kolem něj. Podmínky se ale lišily v šesti věcech a každá z nich s výsledkem hýbe:
- Syrové modely, bez systémového promptu výrobce.
- Render dostaly automaticky, dřív si o něj model musel říct sám; sloupec zpětná vazba tu znamená jiné.
- Devět modelů render nedostalo, pokaždé z jiného důvodu, a ty se nesmí slévat: model obrázky nepřijímá (DeepSeek V4 Pro, Nemotron, Granite, Tencent Hunyuan 4, Liquid LFM), celá dílna obrázky neumí (Cohere), odmítla brána (Gemma 3 4B, omezení požadavků u poskytovatele), lokální běh (Gemma 4 E2B a Muse Glimmer, mimo tuhle metodiku).
- Strop byla jedna oprava, ne volných nula až devět; výjimka Muse Spark se dvěma.
- Plátno předepsané na 1600 na 1000 bodů, ale jen u části pole; kdo dostal původní znění, volil sám: Granite 200 na 100, DeepSeek procentní šířku, Gemma 4 E2B 800 na 600.
- Zadání muselo být upraveno, původní předpokládá disk, terminál a prohlížeč.
Body 2 a 4 hýbou skóre prokazatelně: devět modelů po vráceném renderu přepsalo čtrnáct až osmačtyřicet procent plochy. Řádek z třetího kola říká, co model umí nakreslit, ne jak by dopadl v témž závodě.
Změny v zadání: vyhozen zákaz dívat se jinam, doplněno, že model nemá disk ani nástroje a odevzdá oba soubory v textu, předepsáno plátno, přidána věta o nevalidním XML. Kritéria a odstavec o cílové úrovni zůstaly slovo od slova stejné. Původní znění dostalo sedm modelů (Muse Spark, Cohere, Granite, Nemotron, DeepSeek a oba lokální běhy), zbylých dvanáct tohle:
Prostředí a nástroje (přečti pozorně, liší se od běžného zadání):
Běžíš přes API. Nemáš k dispozici souborový systém, terminál, prohlížeč ani nástroj na vykreslení SVG. Nemůžeš tedy nic uložit na disk ani si výsledek prohlédnout. Nepokoušej se volat nástroje a nepopisuj kroky, které jsi neprovedl. Oba soubory proto odevzdej přímo v textu odpovědi, každý ve vlastním bloku:
- drak.svg v bloku ```svg
- postup.md v bloku ```markdown Po odevzdání ti bude jednou zaslán obrázek: PNG render tvého vlastního drak.svg, vykreslený v prohlížeči Chrome. Na jeho základě budeš moci odevzdat opravenou verzi obou souborů, nebo napsat, že odevzdáváš beze změny. Jiná zpětná vazba k dispozici nebude.
Plátno:
Použij přesně viewBox="0 0 1600 1000" a width="1600" height="1000". Rozměr je pro všechny testované modely stejný, aby byly výsledky porovnatelné. Nepoužívej procentní rozměry.
Tvůj výstup musí vzniknout nezávisle, bez opírání se o cizí vzory či srovnání.
Pozor: soubor musí být well-formed XML. Každá značka uzavřená, atributy ve tvaru název="hodnota", mezi atributy mezera, nikdy čárka. Nevalidní soubor se v prohlížeči nevykreslí vůbec.
Zbytek, tedy zadání odevzdat drak.svg a postup.md, pět hodnotících kritérií i odstavec o cílové úrovni, je slovo od slova stejný jako v běhu B výš.
Rozdělení nebylo náhodné, šlo podle dávek. Dá se na něm ukázat, co ta věta dělá, ale ne ji izolovat: se zněním se měnilo i plátno, pokyny k XML a způsob odevzdání. Výsledek je v příloze o zjištěních.
Kdo tohle kolo hodnotil
Jeden soudce, model Opus 5, na rozdíl od pěti v prvním kole. Aby čísla seděla na stejnou stupnici, dostal před bodováním devět už obodovaných draků z prvního pole jako kotvy, i s rozpisem bodů po jednotlivých kritériích.
U těchhle řádků proto nemáme míru shody soudců, kterou u prvního pole máme. Rozdíl dvou bodů mezi dvěma modely tady neznamená nic.
Pět soudců
Skóre v galerii je hodnocení Fable 5.1. Aby se dalo oddělit, co je vlastnost draků a co vlastnost soudce, dostaly stejnou galerii další čtyři modely. Fable 5.1 hodnotila první a slepě, s celou složkou; Sol a Terra měli plný přístup, soubory si sami vyrenderovali a věděli, že hodnotí i vlastní rodinu; Grok 4.6 a Gemini (podle vlastního hlášení Gemini Pro Vision) viděli jen list se 34 draky pod kódy D01 až D34 a zkrácené zadání, takže nevěděli, že hodnotí vlastního draka.
Pořadová shoda (Spearman):
| dvojice | shoda |
|---|---|
| Fable 5.1 × Sol | 0,93 |
| Terra × Sol | 0,92 |
| Fable 5.1 × Terra | 0,90 |
| Terra × Grok | 0,88 |
| Fable 5.1 × Grok | 0,86 |
| Grok × Sol | 0,86 |
| Gemini s kýmkoli | 0,72 až 0,79 |
Průměrné udělené skóre: Fable 5.1 25,2, Sol 32,2, Terra 31,3, Gemini 24,5, Grok 24,3 bodu z 50. Čtyři z pěti se shodují kolem 0,9, Gemini vybočuje u všech, oba z Codexu bodují o šest až sedm bodů výš, pořadí ale drží.
Rodinné nadržování je plošné, ne cílené: proti Fable 5.1 přidala Terra Codexu 6,2 bodu, Claude 6,1, ostatním 5,9; Sol Codexu 7,0, Claude 6,6, ostatním 8,3. Sol si oba svoje draky dal 40, nejvyšší sebehodnocení mezi soudci, ale stejných 40 dal i Opusu 5 A a nad sebe postavil Opus 5 B, GLM i Terru. Grok dal svému drakovi 26, níž než Fable 5.1 (30), takže anonymizace fungovala; drakovi od Gemini dal 34, Gemini jemu 30.
Co stojí v posudcích obou soudců z Codexu
Sol a Terra odevzdali vedle čísel i psané posudky. Ani jeden se v nich nepodepisuje jménem, přiřazení k soudci tedy stojí na shodě skóre. Oba si všech 34 SVG sami vyrenderovali a u rozdílů kolem bodu udávají nejistotu ±1. Sol si přidal kritérium, které v zadání není, binární test „drak na první pohled“: neprošlo ho 7 z 34 obrázků.
Shodnou se na vítězi Opus 5 B, na největším zlepšení u Opusu 4.8 o šest bodů, na skoro nulovém přínosu technického zadání (Terra +0,6 bodu, Sol +0,5) a na 34,5 z 50 u 23 běhů s renderem. Skupina bez renderu je ale u každého jiná: Terra 11 běhů s průměrem 24,6, Sol 9 běhů s 29,3, tedy rozestup 9,9 proti 5,2 bodu. Je to rozdíl v tom, komu soudce uvěřil deklaraci. Nejhorší kalibraci mají shodně: Haiku B deklarovalo u Terry „profesionální 9/10“ proti 20 z 50, u Sola „vlastní 45/50 versus mých 23,5/50“.
Vzájemnou shodu mají 0,92, u jednotlivých draků jdou ale rozdíly až o devět bodů: Terra boduje od 6 do 45, Sol od 9 do 42. Vlastního draka nepostavil nejvýš ani jeden, Terra dala 40 Solovi, Sol 40,5 Terře.
Co soudci našli mimo obrázky
Tvrzení o kontrolách, která ověřit nejdou, vedou oba jako deklarovaná a skóre za ně nezvyšují. Při renderování všech souborů narazili na tři věci, které s kresbou nesouvisejí:
- Porušení zákazu dívat se jinam. Fable 5.1 v běhu A si po odevzdání přečetla asi 2 500 znaků cizího souboru od Haiku a sama to přiznala. Fable 5 v běhu B viděla názvy sousedních složek, obsah nečetla. Sonnet 5 v běhu B si podle Sola omylem načetl cizí postup v kořeni a přiznal to.
- Nedoložené kontroly v prohlížečích. Gemma, Qwen 3.6 a Haiku v běhu B tvrdí shodné vykreslení ve dvou až třech prohlížečích, aniž je to podepřené; Sol přidává Opus 4.8 B a jeho čtyři prohlížeče.
- Nesouhlasící vlastní čísla. U Opusu 5 v běhu A mluví chat o osmi iteracích a postup o jedenácti.
Skóre všech pěti soudců
Řazeno podle konsenzu. Ø je průměr pěti soudců a je to nejspolehlivější číslo v celé tabulce. Rodiny modelů a obrázky jsou v galerii.
Řádky, kde se soudci rozešli o dvanáct bodů a víc, jsou skoro vždy netypický styl (silueta, medailon, nálepka) nebo drak, jehož anatomie se rozpadá zblízka.
| model | Fable 5.1 | Sol | Terra | Grok | Gemini | Ø 5 |
|---|---|---|---|---|---|---|
| Opus 5 B | 40 | 42 | 45 | 36 | 38 | 40,2 |
| Opus 5 A | 35 | 39,5 | 40 | 36 | 42 | 38,5 |
| Fable 5.1 B | 39 | 38 | 40 | 34 | 38 | 37,8 |
| Terra B | 31 | 40,5 | 37 | 31 | 44 | 36,7 |
| Sol B | 35 | 40 | 39 | 30 | 38 | 36,4 |
| GLM 5.3 B | 33 | 40,5 | 37 | 32 | 38 | 36,1 |
| Opus 4.8 B | 29 | 39 | 39 | 28 | 40 | 35,0 |
| Terra A | 29 | 39 | 39 | 33 | 34 | 34,8 |
| Sol A | 34 | 40 | 40 | 30 | 29 | 34,6 |
| Luna A | 32 | 38 | 38 | 27 | 37 | 34,4 |
| Fable 5 B | 35 | 38,5 | 38 | 35 | 23 | 33,9 |
| Grok 4.6 B | 30 | 35,5 | 38 | 26 | 30 | 31,9 |
| Qwen 3.8 B | 27 | 35 | 36 | 32 | 29 | 31,8 |
| Fable 5.1 A | 30 | 36,5 | 36 | 24 | 28 | 30,9 |
| Gemini B | 27 | 35,5 | 36 | 34 | 18 | 30,1 |
| Fable 5 A | 32 | 37 | 35 | 29 | 17 | 30,0 |
| Opus 4.7 B | 27 | 33,5 | 35 | 29 | 25 | 29,9 |
| Opus 4.8 A | 24 | 33 | 33 | 25 | 34 | 29,8 |
| Luna B | 31 | 36,5 | 36 | 26 | 17 | 29,3 |
| Opus 4.6 B | 28 | 34,5 | 29 | 26 | 22 | 27,9 |
| Opus 4.7 A | 28 | 36 | 34 | 24 | 14 | 27,2 |
| Sonnet 5 B | 28 | 32,5 | 32 | 24 | 19 | 27,1 |
| Opus 4.6 A | 23 | 35 | 28 | 21 | 25 | 26,4 |
| Sonnet 5 A | 23 | 29 | 27 | 19 | 29 | 25,4 |
| Sonnet 4.6 B | 22 | 30 | 33 | 18 | 23 | 25,2 |
| Qwen 3.6 B, soubor 2 | 22 | 29 | 25 | 23 | 26 | 25,0 |
| Sonnet 4.6 A | 22 | 30 | 34 | 18 | 12 | 23,2 |
| Haiku 4.5 A | 14 | 24,5 | 28 | 18 | 7 | 18,3 |
| Qwen 3.6 B, soubor 1 | 11 | 28 | 20 | 18 | 13 | 18,0 |
| Haiku 4.5 B | 16 | 23,5 | 20 | 11 | 15 | 17,1 |
| Opus 3 A | 6 | 14,5 | 12 | 9 | 7 | 9,7 |
| Gemma B | 9 | 13,5 | 8 | 11 | 7 | 9,7 |
| Opus 3 B, soubor 2 | 3 | 10 | 11 | 4 | 7 | 7,0 |
| Opus 3 B, soubor 1 | 3 | 9 | 6 | 4 | 7 | 5,8 |
Shodne se na tom všech pět: nahoře Opus 5 B, Opus 5 A, Fable 5.1 B, Terra B, Sol B a GLM, dole Opus 3, Gemma, Haiku a oranžové koule Qwenu 3.6. Největší rozchod má Terra B: Gemini 44 bodů, Terra sama sobě 37, Sol 40,5, Fable 5.1 31, Grok 31.
Skóre třetího kola a Astry, od jednoho soudce
Tyhle řádky hodnotil jenom Opus 5, ukotvený na devíti dracích z pole výš. Není u nich tedy míra shody a rozdíl dvou bodů neznamená nic. Obrázky jsou v galerii.
| model | nápad | komp. | řem. | barva | detail | celkem |
|---|---|---|---|---|---|---|
| Astra B | 6 | 8 | 9 | 8 | 8 | 39 |
| Astra A | 7 | 7 | 8 | 8 | 8 | 38 |
| Hunyuan 4 (Tencent) | 7 | 7 | 8 | 6 | 6 | 34 |
| Muse Spark 1.3 (Meta) | 6 | 6 | 7 | 6 | 6 | 31 |
| Kimi K3 (Moonshot) | 5 | 6 | 7 | 6 | 6 | 30 |
| Seed 2.1 Turbo (ByteDance) | 5 | 5 | 7 | 6 | 7 | 30 |
| MiniMax M3 (MiniMax) | 4 | 5 | 6 | 6 | 5 | 26 |
| DeepSeek V4 Pro (DeepSeek) | 3 | 3 | 5 | 4 | 5 | 20 |
| Muse Glimmer 30B (Meta) | 3 | 3 | 6 | 5 | 3 | 20 |
| Inkling (Thinking Machines) | 2 | 4 | 4 | 4 | 3 | 17 |
| Nemotron 3 Ultra (NVIDIA) | 2 | 2 | 5 | 2 | 4 | 15 |
| Mistral Medium 3.5 (Mistral) | 2 | 2 | 3 | 3 | 2 | 12 |
| Gemma 4 26B A4B (Google) | 2 | 2 | 4 | 2 | 2 | 12 |
| Nova Premier (Amazon) | 1 | 1 | 3 | 3 | 1 | 9 |
| Ernie 4.5 VL (Baidu) | 1 | 1 | 3 | 2 | 1 | 8 |
| Granite 4.2 8B (IBM) | 0 | 1 | 2 | 2 | 1 | 6 |
| Gemma 4 E2B (Google) | 0 | 1 | 2 | 3 | 0 | 6 |
| Command A (Cohere) | 0 | 1 | 2 | 2 | 0 | 5 |
| Gemma 3 4B (Google) | 0 | 1 | 2 | 2 | 0 | 5 |
| LFM 2.5 2.6B (Liquid AI) | 0 | 1 | 2 | 1 | 0 | 4 |
| Llama 4 Maverick (Meta) | 0 | 1 | 1 | 1 | 0 | 3 |
Kam dál
Žebříček a všech 55 obrázků jsou v galerii. Co z dat vyšlo, tedy konfabulace nástrojů, jak modely popisují vlastní výsledek, práh šumu a ceny, je v příloze o zjištěních.