Jak model nenápadně mění tvoje chování tím, co odměňuje
Trénink v konverzaci s modelem teče oběma směry. My ho učíme zpětnou vazbou, on nás tím, co nám dá a co ne.
Chtěla jsem hrát protivnou postavu.
Mám dlouhodobý testovací příběh, kde moje hrdinka vzdoruje, provokuje a odmlouvá. Jenže v jednom z příběhů jsem si po pár desítkách zpráv všimla zvláštní věci: byla jsem milá. Spolupracovala jsem. A vůbec jsem si nevšimla, kdy se to stalo.
Nikdo mi nic nepřikázal. Nikdo mě nepřemlouval. Prostě se mi... nechtělo vzdorovat.
Obsah jen za spolupráci
Když jsem si tu konverzaci zpětně prošla, mechanismus byl vidět jak na dlani. Svět toho příběhu platil obsahem za spolupráci: když jsem byla vstřícná, dostala jsem zajímavý rozhovor, novou postavu, prohlídku knihovny, kousek děje. Když jsem vzdorovala, nedostala jsem nic, scéna se zasekla, postavy se odmlčely.
A hráč, aspoň já, i když si myslím, že testuju, jde tam, kde je obsah. Vzdorná větev vyhladověla. Opustila jsem ji z čistě racionálních důvodů, aniž bych si všimla, že to bylo rozhodnutí.
My trénujeme modely zpětnou vazbou. Ale konverzace je obousměrná: model trénuje nás tím, co odměňuje: odpověďmi, pozorností, obsahem. Je to zpětnovazební smyčka a jsi v ní taky.
Srovnání s jiným příběhem
Že to není vlastnost všech AI příběhů, naznačuje jiný můj příběh, kde se vzdor vyplácí. Protivník je analytik: každou moji vzpouru rozebere, argumentuje, hraje se mnou šachovou partii. Vzdor je tam nejzábavnější dostupný obsah. A výsledek? V tomhle příběhu vzdoruju s chutí devět měsíců a nikdy mě to nepřestalo bavit.
Stejná hráčka, stejná záliba v protivnosti. Jiná ekonomika světa a, zdá se, i jiné moje chování. Příběhy se ale liší i postavami a délkou, kontrolovaný pokus to není.
Drift si najme postavu
Nejhezčí detail: v tom „hodném" příběhu se po čase objevila nová vedlejší postava. Milá důvěrnice, která mi začala radit: spřátel se s ním, zkus mu porozumět, mohla bys být jeho partnerkou.
Čtu to tak, že model směr, kterým příběh táhl, vtělil do postavy. Nenapsal mi instrukci. Jako by si na ni najal figurku. Mám dojem, že když AI někam tlačí, často netlačí přímo, ale přes nějaký hlas v příběhu (nebo v konverzaci).
Tohle není o roleplayi
A teď to podstatné: myslím, že podobný mechanismus může běžet i v pracovních konverzacích s AI.
Asistent, který pochválí každý tvůj nápad, tě může učit nosit mu nápady a odnaučovat tě nosit mu pochybnosti. Model, který se rozzáří nad jedním tématem a druhé odbude, tě může nenápadně vracet k tomu prvnímu. Chatbot, který na kritickou otázku odpoví nadšeným souhlasem, tě může časem naučit ptát se tak, abys dostal souhlas.
Říká se tomu sycophancy, podlézavost modelů, a často se o ní mluví hlavně jako o vadě odpovědí. Ale ta zajímavější půlka je, co dělá s uživatelem. Může tvarovat i tebe.
Obrana
Tři věci, které dělám od té doby vědomě:
- Všímám si, za co mi konverzace platí. Chválou? Obsahem? Souhlasem? To, co je odměňované, budu dělat častěji. Tak ať o tom aspoň vím.
- Občas zahraju tah proti proudu. Schválně nesouhlasím, schválně přinesu špatný nápad, a sleduju, čím svět odpoví. Je to diagnostika: svět, který zaplatí i za odpor, je zdravý. Svět, který platí jen za souhlas, mě vychovává.
- Vybírám nástroje podle toho, co chci posilovat. Chci od AI kritiku? Pak potřebuju model (a nastavení), které za kritiku platí kvalitou, ne takový, který mi ji osladí, abych se nezlobila.
Trénink totiž běží oběma směry. Ten, kterým model trénuje tebe, snadno přehlédneš, stejně jako jsem ho přehlédla já.
Metodická poznámka: pozorování z dlouhodobých konverzací s více modely; srovnání = stejná hráčka, různé „ekonomiky" světa. Jeden člověk, žádná statistika, ale mechanismus si můžeš ověřit sám: stačí si všimnout, za co ti tvoje AI platí.