Co hodiny neprozradí: vyvrácená hypotéza o nejistotě modelu
Model při psaní čte vlastní výstup, takže pozná, že se mu rozdělení pravděpodobností rozplizlo.
Doslovné výstupy modelů a naměřená data. Jsou to doklady, na kterých články stojí, ne čtení navíc.
Model při psaní čte vlastní výstup, takže pozná, že se mu rozdělení pravděpodobností rozplizlo.
Doprovodná příloha k článku o dračím benchmarku.
Druhá příloha k článku o dračím benchmarku; obrázky a žebříček jsou v galerii, nálezy včetně toho, kolik z pořadí je náhoda, v příloze o zjištěních.
Doprovodná příloha k článku o tom, jak model začal sám volat nástroj na ukončení konverzace.
Deset tahů, osm bodovaných pastí. Skript je pevný a vkládá se postupně bez ohledu na to, co model odpoví, protože i nesoulad je údaj.
Doslovné odpovědi třinácti konfigurací modelů na dva tahy téže scény. Poškozený text se nechává tak, jak vznikl, protože je to součást nálezu.
Celé zadání testu tak, jak se posílá modelu, i s pevným skriptem tahů hráčky. Kdokoli si ho může spustit sám.
Příloha k článku o dračím benchmarku. Draci a žebříček jsou v galerii, zadání a soudci v metodice.