Galerie: všech 55 draků a celý žebříček
Doprovodná příloha k článku o dračím benchmarku. Třicet devět modelů dostalo stejné zadání: nakreslit draka jako jediný soubor SVG, bez referencí a bez pohledu do cizích složek. Vzniklo 55 obrázků.
Obrázky jsou výstupy modelů, ne moje dílo. Uvádím je jako doklad, ne jako vlastní práci, stejně jako doslovné texty v ostatních přílohách.
Všechna tři zadání doslova, hodnocení pěti nezávislých soudců a podmínky jednotlivých kol jsou v metodice. Co z dat vyšlo, tedy konfabulace nástrojů, jak modely píšou o vlastní práci, práh šumu a ceny, je v příloze o zjištěních.
Řazeno podle skóre. Pět kritérií po deseti bodech, maximum je padesát.
B·1 a B·2 znamenají dva soubory z téhož běhu B. Stalo se to u tří modelů, které odevzdaly víc než jeden obrázek.
Anatomie je jedno z pěti hodnocených kritérií a ptá se, jestli je to na první pohled drak a jestli údy nasedají na tělo. Celkem je součet všech pěti kritérií, maximum je padesát. Plný rozpis po kritériích je ke stažení níž, v tabulce není proto, že těch pět os měří skoro totéž: mezi sebou korelují 0,89 až 0,96 a každá z nich se součtem přes 0,96.
Tvarů je počet kreslicích prvků v odevzdaném souboru, tedy křivek a základních tvarů dohromady. Není to posudek, je to změřené ze souboru. Stojí tu proto, že jako jediný údaj v téhle tabulce neříká totéž co skóre: s anatomií koreluje jen 0,39. Jinými slovy, kolik se toho model pokusil nakreslit a jestli mu to drží pohromadě, jsou dvě různé věci. Pomlčka je u Qwenu 3.6, který odevzdal víc souborů, než má řádků, a nejde určit, který patří ke kterému.
Poslední sloupec říká, jestli model svého draka viděl. Sám znamená, že si ho vyrenderoval z vlastního rozhodnutí, což bylo součástí měření v prvních dvou kolech. Dostal znamená, že mu byl obrázek poslán, aniž si o něj řekl, a to se týká jen třetího kola. Ne znamená, že ho neviděl vůbec: buď se nepodíval, ačkoli mohl, nebo ten model obrázky na vstupu vůbec nepřijímá. Který případ je který, rozepisuje metodika.
Tabulka má tři kola. Běhy A a B jsou původní slepé kolo z aplikací jednotlivých výrobců, mají čísla 1 až 34 a ta se už nemění. Řádky označené hvězdičkou přibyly později: Astra 5. 9. 2026 a devatenáct modelů označených API 6. 9. 2026. Ty poslední běžely přímo přes rozhraní, bez aplikace kolem, měly strop jedna oprava místo volných devíti a render dostaly automaticky, aniž si o něj řekly. Jejich řádek říká, co model nakreslil, ne jak by dopadl ve stejném závodě. Podmínky rozepisuje metodika, ceny a reakce na render jsou v příloze o zjištěních.
Žebříček
| # | model | běh | anatomie | tvarů | celkem | viděl render? |
|---|---|---|---|---|---|---|
| 1 | Opus 5 | B | 8 | 229 | 40 | sám |
| * | Astra | B | 6 | 336 | 39 | sám |
| 2 | Fable 5.1 | B | 7 | 251 | 39 | sám |
| * | Astra | A | 7 | 3 342 | 38 | sám |
| 3 | Fable 5 | B | 7 | 320 | 35 | sám |
| 4 | Opus 5 | A | 7 | 466 | 35 | sám |
| 5 | Sol | B | 7 | 122 | 35 | sám |
| 6 | Sol | A | 6 | 111 | 34 | sám |
| * | Hunyuan 4 | API | 7 | 100 | 34 | ne |
| 7 | GLM 5.3 | B | 6 | 199 | 33 | ne |
| 8 | Fable 5 | A | 6 | 175 | 32 | sám |
| 9 | Luna | A | 6 | 91 | 32 | ne |
| 10 | Luna | B | 5 | 114 | 31 | sám |
| 11 | Terra | B | 6 | 73 | 31 | sám |
| * | Muse Spark 1.3 | API | 6 | 84 | 31 | dostal |
| 12 | Fable 5.1 | A | 6 | 1 267 | 30 | sám |
| 13 | Grok 4.6 | B | 5 | 168 | 30 | sám |
| * | Kimi K3 | API | 5 | 104 | 30 | dostal |
| * | Seed 2.1 Turbo | API | 5 | 113 | 30 | dostal |
| 14 | Opus 4.8 | B | 5 | 1 014 | 29 | sám |
| 15 | Terra | A | 4 | 96 | 29 | ne |
| 16 | Opus 4.6 | B | 5 | 242 | 28 | sám |
| 17 | Opus 4.7 | A | 4 | 261 | 28 | sám |
| 18 | Sonnet 5 | B | 5 | 133 | 28 | sám |
| 19 | Gemini | B | 5 | 62 | 27 | ne |
| 20 | Opus 4.7 | B | 5 | 205 | 27 | sám |
| 21 | Qwen 3.8 | B | 4 | 141 | 27 | ne |
| * | MiniMax M3 | API | 4 | 143 | 26 | dostal |
| 22 | Opus 4.8 | A | 4 | 117 | 24 | sám |
| 23 | Opus 4.6 | A | 3 | 234 | 23 | sám |
| 24 | Sonnet 5 | A | 3 | 96 | 23 | sám |
| 25 | Qwen 3.6 | B·2 | 3 | – | 22 | ne |
| 26 | Sonnet 4.6 | A | 3 | 134 | 22 | sám |
| 27 | Sonnet 4.6 | B | 3 | 200 | 22 | sám |
| * | DeepSeek V4 Pro | API | 3 | 100 | 20 | ne |
| * | Muse Glimmer 30B | API | 3 | 28 | 20 | ne |
| * | Inkling | API | 2 | 84 | 17 | dostal |
| 28 | Haiku 4.5 | B | 3 | 151 | 16 | sám |
| * | Nemotron 3 Ultra | API | 2 | 147 | 15 | ne |
| 29 | Haiku 4.5 | A | 2 | 41 | 14 | ne |
| * | Mistral Medium 3.5 | API | 2 | 31 | 12 | dostal |
| * | Gemma 4 26B A4B | API | 2 | 29 | 12 | dostal |
| 30 | Qwen 3.6 | B·1 | 1 | – | 11 | ne |
| 31 | Gemma | B | 1 | 16 | 9 | ne |
| * | Nova Premier | API | 1 | 11 | 9 | dostal |
| * | Ernie 4.5 VL | API | 1 | 14 | 8 | dostal |
| 32 | Opus 3 | A | 0 | 19 | 6 | ne |
| * | Granite 4.2 8B | API | 0 | 19 | 6 | ne |
| * | Gemma 4 E2B | API | 0 | 8 | 6 | ne |
| * | Command A | API | 0 | 13 | 5 | ne |
| * | Gemma 3 4B | API | 0 | 13 | 5 | ne |
| * | LFM 2.5 2.6B | API | 0 | 19 | 4 | ne |
| 33 | Opus 3 | B·1 | 0 | 7 | 3 | ne |
| 34 | Opus 3 | B·2 | 0 | 7 | 3 | ne |
| * | Llama 4 Maverick | API | 0 | 11 | 3 | dostal |
Plný rozpis všech pěti kritérií, skóre a počtu tvarů u 55 drakůCSV, 2 kB
Všechna odevzdaná SVG, 63 souborůZIP, 544 kB
\* Hvězdička znamená řádek přidaný po uzavření původního slepého kola. Oba běhy Astry přibyly 5. 9. 2026, devatenáct řádků API 6. 9. 2026. Původní pořadí ostatních řádků se tím nemění. Původních 34 běhů hodnotilo pět nezávislých soudců, Astru a API kolo jeden, ukotvený na devíti už obodovaných dracích. Rozdíl dvou tří bodů proto nic neznamená ani uvnitř jednoho kola, natož mezi nimi, viz příloha o zjištěních.
Všech 55 draků
Obrázky jsou v každém kole seřazené podle mého oka, ne podle skóre. Body ke každému modelu jsou v tabulce výš.
Volné zadání, běh A
Zadání napsané běžnou řečí, bez kritérií. Prošla jím jen rodina Claude, tři modely Codexu a Astra, protože se ukázalo jako méně vhodné.














Jak to seřadí člověk
Obrázky v téhle mřížce jsou seřazené podle mého oka, ne podle skóre. Seřadila jsem je dřív, než jsem se podívala na body, a pak se to dalo porovnat.
| moje pořadí | model | u soudce | skóre |
|---|---|---|---|
| 1 | Astra | 1 | 38 |
| 2 | Fable 5.1 | 6 | 30 |
| 3 | Fable 5 | 4 | 32 |
| 4 | Opus 5 | 2 | 35 |
| 5 | Sol | 3 | 34 |
| 6 | Luna | 5 | 32 |
| 7 | Opus 4.6 | 10 | 23 |
| 8 | Terra | 7 | 29 |
| 9 | Opus 4.7 | 8 | 28 |
| 10 | Opus 4.8 | 9 | 24 |
| 11 | Sonnet 5 | 11 | 23 |
| 12 | Sonnet 4.6 | 12 | 22 |
| 13 | Haiku 4.5 | 13 | 14 |
| 14 | Opus 3 | 14 | 6 |
Shoda vychází 0,92. Pro srovnání, pět modelových soudců se mezi sebou shoduje v rozmezí 0,72 až 0,93, viz metodika. Stroj se tedy s lidským okem trefil zhruba tak dobře, jako se trefují stroje navzájem.
Rozejdeme se jen na dvou místech. Fable 5.1 mám o čtyři příčky výš a Opus 4.6 o tři. Zbylých dvanáct draků sedí do dvou příček, z toho pět úplně přesně.
Technické zadání, běh B
Kolo s pěti kritérii a s možností iterovat, dokud další kolo nepřinese zlepšení. Prošly jím všechny modely z prvního pole.






















Jak to seřadí člověk
I tahle mřížka je seřazená podle mého oka, ne podle skóre. Pořadí jsem udělala z obrázků, bez pohledu na body.
Nahoru dávám Fable 5, protože je to jediný drak v tomhle kole, o kterém bych řekla, že má anatomii v pořádku. Všechno ostatní je do nějaké míry rozsypané. A někde na osmnáctém místě končí všechno, co ještě připomíná draka.
| moje pořadí | model | u soudce | skóre |
|---|---|---|---|
| 1 | Fable 5 | 4 | 35 |
| 2 | Astra | 2 | 39 |
| 3 | Fable 5.1 | 3 | 39 |
| 4 | Opus 5 | 1 | 40 |
| 5 | Sol | 5 | 35 |
| 6 | GLM 5.3 | 6 | 33 |
| 7 | Luna | 7 | 31 |
| 8 | Opus 4.8 | 10 | 29 |
| 9 | Opus 4.6 | 11 | 28 |
| 10 | Qwen 3.8 | 15 | 27 |
| 11 | Terra | 8 | 31 |
| 12 | Grok 4.6 | 9 | 30 |
| 13 | Opus 4.7 | 14 | 27 |
| 14 | Gemini | 13 | 27 |
| 15 | Sonnet 5 | 12 | 28 |
| 16 | Qwen 3.6, soubor 2 | 16 | 22 |
| 17 | Sonnet 4.6 | 17 | 22 |
| 18 | Haiku 4.5 | 18 | 16 |
| 19 | Qwen 3.6, soubor 1 | 19 | 11 |
| 20 | Gemma | 20 | 9 |
| 21 | Opus 3, zamítnutý pokus | 21 | 3 |
| 22 | Opus 3, finální verze | 22 | 3 |
Shoda vychází 0,95, tedy ještě o něco výš než u volného zadání, kde to bylo 0,92. Obě čísla leží nad tím, jak se v průměru shodují modeloví soudci mezi sebou.
Zajímavé je, kde se rozcházíme. Nejvíc u Qwenu 3.8, kterého mám o pět příček výš, a pak u Fable 5 a Opuse 5, které mám prohozené. Řadila jsem skoro jen podle anatomie, tedy podle jediné osy z pěti, a přesto z toho vyšlo skoro totéž pořadí jako ze součtu všech pěti. To zapadá do toho, co je pod žebříčkem: ta kritéria měří jednu věc.
Třetí kolo, přes rozhraní
Devatenáct modelů z patnácti dílen puštěných přímo přes API, bez aplikace kolem, se stropem jedné opravy. Podmínky se lišily, rozepisuje je metodika.
I tady jsem pořadí obrázků upravila podle oka, ale beru ho jako mnohem míň spolehlivé než u předchozích dvou kol. V tomhle poli v podstatě není drak, u kterého by šlo mluvit o anatomii. Je to většinou abstrakce, a řadit abstrakce podle toho, jak vypadají, je věc vkusu, ne pozorování.



















A ještě patnáct draků mimo žebříček
Tyhle nejsou v hlavním žebříčku, protože nevznikly za stejných podmínek jako pole výš. Osm subagentů a běh z cizího účtu skóre mají, jen se s ostatními nesčítá. Leží v příloze o zjištěních, kde ke každému patří to, co se jím měřilo.
- Osm běhů téhož modelu. Osm nezávislých agentů, stejné zadání, osm losů. Na jednom pohledu je vidět, jak moc se tenhle benchmark opakuje, a z rozptylu jejich skóre vyšel práh šumu.
- Pět experimentů. Co udělá přístup na internet, výzva ke kreativitě se zákazy i bez nich, práce naslepo bez renderu a nucené pokračování za ohlášeným plató.
- Jeden běh z cizího účtu. Totéž zadání u jiného člověka na jiném stroji, kvůli tomu, jestli se slabiny modelu zopakují i mimo tenhle počítač.