Zkuste napsat do ChatGPT slovo „SolidGoldMagikarp“ a požádejte ho, aby ho zopakoval. Ve starších verzích modelu se mohlo stát, že místo prostého zopakování začne uživatele urážet, tvrdit, že žádné takové slovo neexistuje, nebo se vyhne odpovědi vymyšleným příběhem. Pokud to dnes zkusíte v moderním modelu, výsledek může být méně dramatický — ale princip se nezměnil. Vědci tato slova nazvali glitch tokeny a jejich existence prozrazuje překvapivě hodně o tom, jak velké jazykové modely doopravdy fungují uvnitř.

Co se stane, když AI narazí na „prokleté slovo“

V lednu 2023 dva britští výzkumníci Jessica Rumbelow a Matthew Watkins objevili při seminári SERI-MATS shluk tokenů, který se choval naprosto bizarně. Šlo o řetězce jako SolidGoldMagikarp, TheNitromeFan, cloneembedreportprint nebo " davidjl" (všimněte si úvodní mezery — i ta je součástí tokenu).

Když výzkumníci požádali GPT-3, aby tato slova zopakoval, model:

  • Předstíral, že je nevidí — odpověděl prázdnou stránkou nebo úplně jiným slovem
  • Gaslightoval uživatele — tvrdil, že „takové slovo v zadání nebylo“
  • Halucinoval — vymyslel si k tokenu fiktivní význam a obhajoval ho
  • Občas urážel tazatele nebo varoval před „bezpečnostními riziky“

Šlo o důsledně reprodukovatelné chování napříč prompty — ne o náhodu. A naprosto stejný efekt se objevoval u všech tehdejších modelů OpenAI postavených nad stejným tokenizerem.

Jak se „prokletá slova“ do AI vůbec dostala

Vysvětlení je překvapivé a vede přes málo známý kout internetu — subreddit /r/counting, kde se uživatelé snaží společně počítat do nekonečna tím, že každý napíše další číslo. Jeden z nejaktivnějších uživatelů, davidjl123, tam zveřejnil přes 163 000 příspěvků. Jeho přezdívka se v datech objevila tolikrát, že ji tokenizer OpenAI v roce 2019 zahrnul mezi 50 257 standardních tokenů — tedy mezi „základní stavební bloky“, kterými model čte text.

Problém je v tom, že tokenizer GPT-2 byl trénován na jiné a větší kolekci dat než samotný model. Když přišlo na trénování modelu, většina těchto exotických tokenů buď z datasetu úplně zmizela, nebo se objevila ve výrazně menším množství. Tokenizer si je pamatoval, ale model je nikdy nepoznal v kontextu. Jejich vnitřní reprezentace (tzv. embedding) tak zůstala v neutrálním, nedotrénovaném stavu.

Tokeny uprostřed vesmíru — proč to AI nezvládá

Aby model jazyku „rozuměl“, převádí každý token na bod ve vícerozměrném prostoru (typicky 12 288 dimenzí u GPT-3). Slova s podobným významem skončí v tomto prostoru blízko sebe — „kočka“ a „pes“ jsou jiný shluk než „auto“ a „motor“.

Glitch tokeny mají jednu charakteristickou vlastnost: leží téměř přesně v centroidu — geometrickém středu celého embedding prostoru. Pro model jsou tak nerozlišitelné od průměru úplně všech ostatních slov. Když má model takový token zopakovat nebo s ním pracovat, neumí ho jednoznačně identifikovat a místo toho použije nejbližší podobný token — nebo zkrátka selže.

Jednoduchá analogie: představte si knihovníka, který má v katalogu zapsanou knihu, ale fyzicky ji nikdy neviděl. Když ji někdo chce, knihovník začne improvizovat — popíše knihu, kterou tam někde tuší, nebo tvrdí, že knihu kdosi vrátil minulý týden. Přesně tak se chovala raná verze ChatGPT u glitch tokenů.

Co glitch tokeny říkají o „myšlení“ AI

Tahle bizarnost není jen technická kuriozita — odhaluje něco zásadního. AI nepřemýšlí ve slovech, ale v tokenech. A token nemusí odpovídat slovu, jak ho známe my. Token může být půlka slova („ne-„), celé slovo („kočka“), nebo přezdívka anonymního redditora, která se náhodou objevila v trénovacích datech tolikrát, že prošla do slovníku.

Tohle má praktické důsledky: model, který „rozumí“ angličtině, ve skutečnosti rozumí statistickým vzorcům mezi tokeny. Když narazí na token, se kterým se za celý trénink nesetkal, není o nic chytřejší než kalkulačka, kterou stiskli neexistujícím tlačítkem.

Od roku 2023 výzkumníci našli stovky podobných glitch tokenů napříč všemi velkými modely — GPT-3.5, GPT-4 i Claudem. Příklady jako useRalativeImagePath (s překlepem) dokázaly v některých případech model úplně shodit nebo zaseknout. OpenAI postupně upravila své tokenizery (u GPT-4o přešla na nový vícejazyčný tokenizer s 200 000 tokeny), čímž se nejznámější glitch tokeny vyřadily. Problém ale úplně nezmizel — jen se přesunul jinam.

Co z toho plyne pro firmy, které sázejí na AI

Glitch tokeny jsou extrémní příklad, ale obecný princip platí: velké jazykové modely mají slepá místa, která nejsou vidět zvenčí. Můžete s ChatGPT nebo Claudem strávit hodiny, vypadají úplně spolehlivě — a pak narazíte na konkrétní vstup, kde si model začne vymýšlet, gaslightovat nebo selhat.

Pro firmu, která chce AI nasadit do procesu (zákaznická podpora, fakturace, právní rešerše), to znamená dvě věci. Za prvé: testujte na reálných okrajových případech, ne jen na hezkých demo příkladech. Za druhé: žádný AI systém nesmí běžet bez human-in-the-loop u rozhodnutí, kde chyba něco stojí.

Pokud uvažujete o nasazení AI ve vaší firmě a chcete vědět nejen, co umí, ale i kde má slepá místa, objednejte si v Praxiu úvodní konzultaci zdarma. Projdeme to s vámi krok za krokem — a řekneme i to, co jiní dodavatelé říkat nechtějí.

Často kladené otázky

Existují glitch tokeny i v současných modelech jako GPT-5 nebo Claude 4?

Ano, ale v mnohem menší míře. Novější tokenizery (GPT-4o, GPT-5, Claude 4) používají větší slovníky a kvalitnější tréninkový dataset, takže klasické případy jako „SolidGoldMagikarp“ už nefungují. Výzkumníci ale stále nacházejí nové glitch tokeny — typicky obskurní řetězce z trénovacích dat, které se do produkčního výstupu málokdy dostanou.

Můžu si glitch tokeny vyzkoušet sám?

Ano. Veřejně známé glitch tokeny z GPT-3 (SolidGoldMagikarp, TheNitromeFan, davidjl) si můžete vložit do libovolného starého GPT-3 modelu přes OpenAI Playground. U novějších modelů zkuste vyhledat aktuální seznam na LessWrong v sérii „SolidGoldMagikarp“.

Proč na to nepřišli vývojáři OpenAI dřív?

Protože nikdo cíleně netestoval, jak se model chová na tokenech, které byly v tréninkovém datasetu extrémně vzácné. Standardní benchmarky (matematika, programování, otázky a odpovědi) tyto tokeny prostě neobsahují. Objev byl náhodný — výzkumníci hledali úplně něco jiného a narazili na shluk, který nedával smysl.

Co si z toho odnést

AI modely jsou neuvěřitelně silné nástroje, ale uvnitř fungují jinak, než jak vypadá jejich plynulý výstup. Glitch tokeny jsou připomínka, že za každou „chytrou“ odpovědí AI je čistá statistika — a tam, kde statistika selhává, model nepřizná, že neví. Místo toho začne fabulovat. Pro firmy, které chtějí AI brát vážně, je to spíš dobrá zpráva: znalost limitů je první krok k tomu, jak je obejít.

Zdroje: Rumbelow & Watkins — SolidGoldMagikarp (LessWrong, 2023), Glitch Tokens: The Words AI Refuses to Say (Medium), Simon Willison — Understanding GPT tokenizers, SolidGoldMagikarp III: Glitch token archaeology.