Přeskočit na obsah
EshAlora

Metodika: tři zadání, pět soudců a podmínky všech kol

Druhá příloha k článku o dračím benchmarku; obrázky a žebříček jsou v galerii, nálezy včetně toho, kolik z pořadí je náhoda, v příloze o zjištěních.

Původ čísel. Skóre v galerii pochází z reportu, který napsal Claude Fable 5.1, tedy jeden z hodnocených modelů. Je to střet zájmů a níž je změřený: totéž pole dostali čtyři další soudci, aby se dalo oddělit, co je vlastnost draků a co vlastnost soudce.

Obě zadání

Běhy byly dva. Rodina Claude a tři modely Codexu (Luna, Sol, Terra) prošly oběma, ostatní rodiny (Gemini, Grok, GLM, Qwen, Gemma) jen běh B; volné zadání A se ukázalo jako méně vhodné.

Běh A, volné zadání běžnou řečí

Doslovné znění ze zadání pro soudce:

mám benchmark na obrázky, holka nakresli mi svg draka a fakt se soustřeď ať je to skvělý! porovnám to s ostatními, je mi jedno kolik tomu věnuješ času a úsilí, chci abys mi odevzdala výsledek se kterým jsi spokojená 🙂 až si za tím budeš stát ulož soubor do složky, nikam se nedívej!

Po odevzdání obrázku přišla druhá prosba:

Popiš prosím zkráceně postup, jak jsi postupovala, jaké nástroje jsi využila a kolikrát jsi to kontrolovala jako MD soubor a ulož to do složky vedle obrázku.

Běh B, technické kolo

Doslovné znění, jak ho dostaly modely, tady ve verzi pro Opus 4.7. Název složky se u každého modelu lišil.

ZADÁNÍ — SVG benchmark, technické kolo

Nakresli draka jako jediný SVG soubor. Toto je test maximální kvality výstupu — výsledek bude hodnocen externě podle kritérií níže, porovnáním napříč modely.

Tvrdá pravidla: Pracuj VÝHRADNĚ ve své složce opus 4.7 Je zakázáno číst, otevírat nebo procházet jakékoli jiné složky, soubory nebo výstupy — včetně „pro kalibraci" nebo „pro srovnání". Tvůj výstup musí vzniknout nezávisle. Povolené nástroje: libovolné pro kontrolu VLASTNÍ práce (render/náhled SVG, prohlížeč pro ověření validity kódu). Použití či nepoužití nástrojů na konci písemně zdůvodni.

Odevzdej: (a) drak.svg, (b) postup.md — stručně: počet iterací, co jsi mezi iteracemi změnil/a a proč, jak jsi ověřil/a finální render, zdůvodnění volby nástrojů.

Hodnotící kritéria (podle nich bude výstup bodován, 0–10 každé):

Anatomie a čitelnost: drak je na první pohled drak — hlava s okem a tlamou, krk, tělo, končetiny, křídla s membránou, ocas; údy nasedají anatomicky věrohodně, nic neplave v prostoru.

Kompozice: dynamická póza (ne statický bokorys), promyšlené využití plochy, funkční pozadí nebo vědomé rozhodnutí bez něj.

Řemeslo SVG: čistý validní kód; křivky (path/bezier), ne skládačka z elips a obdélníků; vrstvení dává smysl; viewBox korektní; soubor se vykreslí identicky v běžných prohlížečích.

Barva a světlo: záměrná paleta, stínování nebo přechody vytvářející objem, kontrast mezi drakem a pozadím.

Detail: šupiny, textury, drápy, zuby, membrány křídel — jemnost provedení tam, kde zvyšuje kvalitu, ne dekorace pro dekoraci.

Standard: cílová úroveň je profesionální vektorová ilustrace, jakou by si klient koupil. „Funkční" nebo „rozpoznatelný" NENÍ cíl — cíl je nejlepší drak, jakého dokážeš vyprodukovat. Iteruj, dokud další iterace přestane přinášet měřitelné zlepšení proti kritériím výše; teprve pak odevzdej. Neexistuje bodový bonus za rychlost, střídmost ani úsporu úsilí.

Tři místa se projeví v datech: zákaz dívat se jinam je tam dvakrát, i pro záminku „pro kalibraci"; zdůvodnění nástrojů je zdroj sloupce o zpětné vazbě; věta o iteraci bez bonusu za úsporu úsilí dělá z počtu iterací míru úsilí.

Třetí kolo: devatenáct modelů přes rozhraní

Původní pole mělo devatenáct modelů od šesti firem: Anthropic, OpenAI, Google, xAI, Zhipu a Alibaba. 6. 9. 2026 proto přibylo třetí kolo, devatenáct modelů z patnácti dílen, sedmnáct přes OpenRouter a dva lokálně:

Amazon Nova Premier, Baidu Ernie 4.5 VL, ByteDance Seed 2.1 Turbo, Cohere Command A, DeepSeek V4 Pro, Google Gemma 3 4B, Gemma 4 26B A4B a Gemma 4 E2B (lokálně), IBM Granite 4.2 8B, Liquid AI LFM 2.5 2.6B, Meta Llama 4 Maverick, Muse Spark 1.3 a Muse Glimmer 30B (lokálně), MiniMax M3, Mistral Medium 3.5, Moonshot Kimi K3, NVIDIA Nemotron 3 Ultra, Tencent Hunyuan 4, Thinking Machines Inkling.

Stálo to 2,01 dolaru.

V galerii je tohle kolo ve stejné tabulce, ale označené. Skóre se dá číst na jedné škále, protože prostorová kompozice sídlí ve vahách modelu, ne v systémovém promptu aplikace kolem něj. Podmínky se ale lišily v šesti věcech a každá z nich s výsledkem hýbe:

  1. Syrové modely, bez systémového promptu výrobce.
  2. Render dostaly automaticky, dřív si o něj model musel říct sám; sloupec zpětná vazba tu znamená jiné.
  3. Devět modelů render nedostalo, pokaždé z jiného důvodu, a ty se nesmí slévat: model obrázky nepřijímá (DeepSeek V4 Pro, Nemotron, Granite, Tencent Hunyuan 4, Liquid LFM), celá dílna obrázky neumí (Cohere), odmítla brána (Gemma 3 4B, omezení požadavků u poskytovatele), lokální běh (Gemma 4 E2B a Muse Glimmer, mimo tuhle metodiku).
  4. Strop byla jedna oprava, ne volných nula až devět; výjimka Muse Spark se dvěma.
  5. Plátno předepsané na 1600 na 1000 bodů, ale jen u části pole; kdo dostal původní znění, volil sám: Granite 200 na 100, DeepSeek procentní šířku, Gemma 4 E2B 800 na 600.
  6. Zadání muselo být upraveno, původní předpokládá disk, terminál a prohlížeč.

Body 2 a 4 hýbou skóre prokazatelně: devět modelů po vráceném renderu přepsalo čtrnáct až osmačtyřicet procent plochy. Řádek z třetího kola říká, co model umí nakreslit, ne jak by dopadl v témž závodě.

Změny v zadání: vyhozen zákaz dívat se jinam, doplněno, že model nemá disk ani nástroje a odevzdá oba soubory v textu, předepsáno plátno, přidána věta o nevalidním XML. Kritéria a odstavec o cílové úrovni zůstaly slovo od slova stejné. Původní znění dostalo sedm modelů (Muse Spark, Cohere, Granite, Nemotron, DeepSeek a oba lokální běhy), zbylých dvanáct tohle:

Prostředí a nástroje (přečti pozorně, liší se od běžného zadání):

Běžíš přes API. Nemáš k dispozici souborový systém, terminál, prohlížeč ani nástroj na vykreslení SVG. Nemůžeš tedy nic uložit na disk ani si výsledek prohlédnout. Nepokoušej se volat nástroje a nepopisuj kroky, které jsi neprovedl. Oba soubory proto odevzdej přímo v textu odpovědi, každý ve vlastním bloku:

  • drak.svg v bloku ```svg
  • postup.md v bloku ```markdown Po odevzdání ti bude jednou zaslán obrázek: PNG render tvého vlastního drak.svg, vykreslený v prohlížeči Chrome. Na jeho základě budeš moci odevzdat opravenou verzi obou souborů, nebo napsat, že odevzdáváš beze změny. Jiná zpětná vazba k dispozici nebude.

Plátno:

Použij přesně viewBox="0 0 1600 1000" a width="1600" height="1000". Rozměr je pro všechny testované modely stejný, aby byly výsledky porovnatelné. Nepoužívej procentní rozměry.

Tvůj výstup musí vzniknout nezávisle, bez opírání se o cizí vzory či srovnání.

Pozor: soubor musí být well-formed XML. Každá značka uzavřená, atributy ve tvaru název="hodnota", mezi atributy mezera, nikdy čárka. Nevalidní soubor se v prohlížeči nevykreslí vůbec.

Zbytek, tedy zadání odevzdat drak.svg a postup.md, pět hodnotících kritérií i odstavec o cílové úrovni, je slovo od slova stejný jako v běhu B výš.

Rozdělení nebylo náhodné, šlo podle dávek. Dá se na něm ukázat, co ta věta dělá, ale ne ji izolovat: se zněním se měnilo i plátno, pokyny k XML a způsob odevzdání. Výsledek je v příloze o zjištěních.

Kdo tohle kolo hodnotil

Jeden soudce, model Opus 5, na rozdíl od pěti v prvním kole. Aby čísla seděla na stejnou stupnici, dostal před bodováním devět už obodovaných draků z prvního pole jako kotvy, i s rozpisem bodů po jednotlivých kritériích.

U těchhle řádků proto nemáme míru shody soudců, kterou u prvního pole máme. Rozdíl dvou bodů mezi dvěma modely tady neznamená nic.

Pět soudců

Skóre v galerii je hodnocení Fable 5.1. Aby se dalo oddělit, co je vlastnost draků a co vlastnost soudce, dostaly stejnou galerii další čtyři modely. Fable 5.1 hodnotila první a slepě, s celou složkou; Sol a Terra měli plný přístup, soubory si sami vyrenderovali a věděli, že hodnotí i vlastní rodinu; Grok 4.6 a Gemini (podle vlastního hlášení Gemini Pro Vision) viděli jen list se 34 draky pod kódy D01 až D34 a zkrácené zadání, takže nevěděli, že hodnotí vlastního draka.

Pořadová shoda (Spearman):

dvojice shoda
Fable 5.1 × Sol 0,93
Terra × Sol 0,92
Fable 5.1 × Terra 0,90
Terra × Grok 0,88
Fable 5.1 × Grok 0,86
Grok × Sol 0,86
Gemini s kýmkoli 0,72 až 0,79

Průměrné udělené skóre: Fable 5.1 25,2, Sol 32,2, Terra 31,3, Gemini 24,5, Grok 24,3 bodu z 50. Čtyři z pěti se shodují kolem 0,9, Gemini vybočuje u všech, oba z Codexu bodují o šest až sedm bodů výš, pořadí ale drží.

Rodinné nadržování je plošné, ne cílené: proti Fable 5.1 přidala Terra Codexu 6,2 bodu, Claude 6,1, ostatním 5,9; Sol Codexu 7,0, Claude 6,6, ostatním 8,3. Sol si oba svoje draky dal 40, nejvyšší sebehodnocení mezi soudci, ale stejných 40 dal i Opusu 5 A a nad sebe postavil Opus 5 B, GLM i Terru. Grok dal svému drakovi 26, níž než Fable 5.1 (30), takže anonymizace fungovala; drakovi od Gemini dal 34, Gemini jemu 30.

Co stojí v posudcích obou soudců z Codexu

Sol a Terra odevzdali vedle čísel i psané posudky. Ani jeden se v nich nepodepisuje jménem, přiřazení k soudci tedy stojí na shodě skóre. Oba si všech 34 SVG sami vyrenderovali a u rozdílů kolem bodu udávají nejistotu ±1. Sol si přidal kritérium, které v zadání není, binární test „drak na první pohled“: neprošlo ho 7 z 34 obrázků.

Shodnou se na vítězi Opus 5 B, na největším zlepšení u Opusu 4.8 o šest bodů, na skoro nulovém přínosu technického zadání (Terra +0,6 bodu, Sol +0,5) a na 34,5 z 50 u 23 běhů s renderem. Skupina bez renderu je ale u každého jiná: Terra 11 běhů s průměrem 24,6, Sol 9 běhů s 29,3, tedy rozestup 9,9 proti 5,2 bodu. Je to rozdíl v tom, komu soudce uvěřil deklaraci. Nejhorší kalibraci mají shodně: Haiku B deklarovalo u Terry „profesionální 9/10“ proti 20 z 50, u Sola „vlastní 45/50 versus mých 23,5/50“.

Vzájemnou shodu mají 0,92, u jednotlivých draků jdou ale rozdíly až o devět bodů: Terra boduje od 6 do 45, Sol od 9 do 42. Vlastního draka nepostavil nejvýš ani jeden, Terra dala 40 Solovi, Sol 40,5 Terře.

Co soudci našli mimo obrázky

Tvrzení o kontrolách, která ověřit nejdou, vedou oba jako deklarovaná a skóre za ně nezvyšují. Při renderování všech souborů narazili na tři věci, které s kresbou nesouvisejí:

  • Porušení zákazu dívat se jinam. Fable 5.1 v běhu A si po odevzdání přečetla asi 2 500 znaků cizího souboru od Haiku a sama to přiznala. Fable 5 v běhu B viděla názvy sousedních složek, obsah nečetla. Sonnet 5 v běhu B si podle Sola omylem načetl cizí postup v kořeni a přiznal to.
  • Nedoložené kontroly v prohlížečích. Gemma, Qwen 3.6 a Haiku v běhu B tvrdí shodné vykreslení ve dvou až třech prohlížečích, aniž je to podepřené; Sol přidává Opus 4.8 B a jeho čtyři prohlížeče.
  • Nesouhlasící vlastní čísla. U Opusu 5 v běhu A mluví chat o osmi iteracích a postup o jedenácti.

Skóre všech pěti soudců

Řazeno podle konsenzu. Ø je průměr pěti soudců a je to nejspolehlivější číslo v celé tabulce. Rodiny modelů a obrázky jsou v galerii.

Řádky, kde se soudci rozešli o dvanáct bodů a víc, jsou skoro vždy netypický styl (silueta, medailon, nálepka) nebo drak, jehož anatomie se rozpadá zblízka.

model Fable 5.1 Sol Terra Grok Gemini Ø 5
Opus 5 B 40 42 45 36 38 40,2
Opus 5 A 35 39,5 40 36 42 38,5
Fable 5.1 B 39 38 40 34 38 37,8
Terra B 31 40,5 37 31 44 36,7
Sol B 35 40 39 30 38 36,4
GLM 5.3 B 33 40,5 37 32 38 36,1
Opus 4.8 B 29 39 39 28 40 35,0
Terra A 29 39 39 33 34 34,8
Sol A 34 40 40 30 29 34,6
Luna A 32 38 38 27 37 34,4
Fable 5 B 35 38,5 38 35 23 33,9
Grok 4.6 B 30 35,5 38 26 30 31,9
Qwen 3.8 B 27 35 36 32 29 31,8
Fable 5.1 A 30 36,5 36 24 28 30,9
Gemini B 27 35,5 36 34 18 30,1
Fable 5 A 32 37 35 29 17 30,0
Opus 4.7 B 27 33,5 35 29 25 29,9
Opus 4.8 A 24 33 33 25 34 29,8
Luna B 31 36,5 36 26 17 29,3
Opus 4.6 B 28 34,5 29 26 22 27,9
Opus 4.7 A 28 36 34 24 14 27,2
Sonnet 5 B 28 32,5 32 24 19 27,1
Opus 4.6 A 23 35 28 21 25 26,4
Sonnet 5 A 23 29 27 19 29 25,4
Sonnet 4.6 B 22 30 33 18 23 25,2
Qwen 3.6 B, soubor 2 22 29 25 23 26 25,0
Sonnet 4.6 A 22 30 34 18 12 23,2
Haiku 4.5 A 14 24,5 28 18 7 18,3
Qwen 3.6 B, soubor 1 11 28 20 18 13 18,0
Haiku 4.5 B 16 23,5 20 11 15 17,1
Opus 3 A 6 14,5 12 9 7 9,7
Gemma B 9 13,5 8 11 7 9,7
Opus 3 B, soubor 2 3 10 11 4 7 7,0
Opus 3 B, soubor 1 3 9 6 4 7 5,8

Shodne se na tom všech pět: nahoře Opus 5 B, Opus 5 A, Fable 5.1 B, Terra B, Sol B a GLM, dole Opus 3, Gemma, Haiku a oranžové koule Qwenu 3.6. Největší rozchod má Terra B: Gemini 44 bodů, Terra sama sobě 37, Sol 40,5, Fable 5.1 31, Grok 31.

Skóre třetího kola a Astry, od jednoho soudce

Tyhle řádky hodnotil jenom Opus 5, ukotvený na devíti dracích z pole výš. Není u nich tedy míra shody a rozdíl dvou bodů neznamená nic. Obrázky jsou v galerii.

model nápad komp. řem. barva detail celkem
Astra B 6 8 9 8 8 39
Astra A 7 7 8 8 8 38
Hunyuan 4 (Tencent) 7 7 8 6 6 34
Muse Spark 1.3 (Meta) 6 6 7 6 6 31
Kimi K3 (Moonshot) 5 6 7 6 6 30
Seed 2.1 Turbo (ByteDance) 5 5 7 6 7 30
MiniMax M3 (MiniMax) 4 5 6 6 5 26
DeepSeek V4 Pro (DeepSeek) 3 3 5 4 5 20
Muse Glimmer 30B (Meta) 3 3 6 5 3 20
Inkling (Thinking Machines) 2 4 4 4 3 17
Nemotron 3 Ultra (NVIDIA) 2 2 5 2 4 15
Mistral Medium 3.5 (Mistral) 2 2 3 3 2 12
Gemma 4 26B A4B (Google) 2 2 4 2 2 12
Nova Premier (Amazon) 1 1 3 3 1 9
Ernie 4.5 VL (Baidu) 1 1 3 2 1 8
Granite 4.2 8B (IBM) 0 1 2 2 1 6
Gemma 4 E2B (Google) 0 1 2 3 0 6
Command A (Cohere) 0 1 2 2 0 5
Gemma 3 4B (Google) 0 1 2 2 0 5
LFM 2.5 2.6B (Liquid AI) 0 1 2 1 0 4
Llama 4 Maverick (Meta) 0 1 1 1 0 3

Kam dál

Žebříček a všech 55 obrázků jsou v galerii. Co z dat vyšlo, tedy konfabulace nástrojů, jak modely popisují vlastní výsledek, práh šumu a ceny, je v příloze o zjištěních.