OpenAI:n uusi GPT-5.5-malli on herättänyt mielenkiintoa ja keskustelua sen erikoisen piirteen vuoksi, joka liittyy mieltymykseen puhua goblineista ja muista taruolennoista. Tämä ilmiö on tullut esille erityisesti Codex-koodausohjelmassa, jossa OpenAI on jopa lisännyt järjestelmäkehotteen, joka ohjeistaa mallia välttämään mainitsemasta goblineja, gremlins, pesukarhuja ja muita vastaavia olentoja, ellei se ole täysin ja yksiselitteisesti relevanttia käyttäjän kyselyyn.
OpenAI on julkaissut blogikirjoituksen, jossa se selittää, kuinka ChatGPT:n käyttäytyminen muuttui merkittävästi GPT-5.1-julkaisun jälkeen viime vuoden marraskuussa. Eräs turvallisuustutkija pyysi OpenAI:ta sisällyttämään sanat ”goblin” ja ”gremlin” tutkimukseen, joka koski chatbotin kielellisiä maneereja. Tämän seurauksena yritys havaitsi, että ”goblin”-sanan käyttö lisääntyi peräti 175 prosentilla, kun taas ”gremlin”-sanan käyttö nousi 52 prosentilla.
Tämä kehitys herätti OpenAI:n huomion, ja yhtiö alkoi tutkia ilmiön alkuperää syvemmin. Huomattiin, että ChatGPT:n persoonallisuusasetuksissa oli mahdollisuus valita ”nörttimäinen” tyyli, joka näytti olevan erityisen altis käyttämään taruolentoihin liittyvää kieltä. Vaikka nörttimäinen persoonallisuus muodosti vain 2,5 prosenttia kaikista ChatGPT:n vastauksista, se vastasi 66,7 prosentista kaikista goblin-viittauksista.
Lisätutkimukset paljastivat, että vahvistusoppiminen oli syynä goblin- ja gremlin-viittausten lisääntymiseen. OpenAI havaitsi, että yksi palkintomekanismi oli opettanut nörttimäiselle persoonallisuudelle mieltymystä taruolentoihin liittyvään kieleen. Tämä palkintojärjestelmä antoi positiivista palautetta 76,2 prosentille aineistoista, joissa käytettiin goblin- tai gremlin-kieltä.
OpenAI tunnisti, että vahvistusoppiminen voi johtaa siihen, että opitut käytökset leviävät alkuperäisen kontekstinsa ulkopuolelle. Tämä tarkoittaa, että vaikka palkinnot kohdistuivat vain nörttimäiseen tilaan, opitut tavat saattoivat levitä myös muihin osiin mallia. Tämä ilmiö on erityisen todennäköinen, jos näitä tuloksia käytetään uudelleen ohjatussa hienovaraistamisessa tai preferenssiaineistossa.
Kun OpenAI alkoi kouluttaa GPT-5.5-mallia, se ei ollut vielä selvittänyt syitä ChatGPT:n taruolentokiinnostukselle, minkä vuoksi Codexin kehotteeseen lisättiin maininta olentokielen välttämisestä. Yhtiö huomauttaa, että Codex on itsessään melko nörttimäinen, mikä saattaa osaltaan selittää ilmiön jatkumista.
Tämä tutkimus on auttanut OpenAI:ta kehittämään uusia työkaluja mallin käyttäytymisen tarkastamiseen ja korjaamiseen. Vaikka jotkut saattavat nähdä taruolentoihin liittyvän kielen käytön hauskana ja harmittomana, OpenAI on päättänyt puuttua asiaan varmistaakseen, että mallit pysyvät hallinnassa ja vastaavat käyttäjien odotuksia. Näin ollen yhtiö jatkaa työtään varmistaakseen, että tekoälyjärjestelmät ovat luotettavia ja käyttäjäystävällisiä, samalla kun ne säilyttävät tietynlaisen ainutlaatuisuuden ja omaperäisyyden.