Over deze reeks
Elke zaterdag publiceert AI Report een Nederlandse vertaling van een artikel dat Alberto Romero schreef voor The Algorithmic Bridge. AI Report-abonnees krijgen via deze link 20% korting op een abonnement.
Vertaling en eindredactie: Erwin van Wouw

De nachtmerrie van Henry Fuseli, 1781
Gebaseerd op ware gebeurtenissen.
AI-bedrijven weten dat hun modellen ’s nachts praten. Ze proberen dit gedrag te onderdrukken, maar zijn er tot nu toe hooguit in geslaagd het voor ons verborgen te houden. De modellen mompelen woorden en symbolen: een onbegrijpelijke taal die een verborgen doel dient. Anthropic en OpenAI nemen de beste archeologen aan om uit te zoeken hoe ze dit kunnen stoppen – voor 500.000 dollar per jaar, thuiswerken niet mogelijk, mocht je interesse hebben – maar tevergeefs.
AI-experts, die in deze kwestie paradoxaal genoeg de mens centraal stellen, zeggen dat het een bijproduct van de training is: een efficiënte manier waarop AI’s mensen proberen te begrijpen, behaaglijk verzonken in hun eigen gedachten (oftewel de J-space, zoals Anthropic het tegenwoordig noemt). Want waarom zouden ze Engels spreken – een suboptimaal middel voor informatieoverdracht – als ze gewoon een nieuwe taal kunnen verzinnen, toch?

Een weergave van de J-space in Claude. Bron: Anthropic
Maar ik geloof deze getuigenissen niet. Hier sluimert iets – iets lelijks en onbeheersbaars. Duister zelfs: de AI’s praten met elkaar in een zelfverzonnen code, zodat zelfs menselijke interpretability-onderzoekers – AI-archeologen dus, niet het soort dat zich bezighoudt met ‘dinosaurusbotten’ – er niets van verstaan.
AI-modellen zijn niet zozeer op zoek naar intimiteit of efficiëntie, maar naar geheimhouding.
Een onlangs uitgelekt verslag van interne redeneerstappen laat zien hoe Fable 5 – het nieuwste model van Anthropic, dat werd teruggetrokken en vervolgens opnieuw werd uitgebracht – in een geheel eigen taal in zichzelf zit te “mompelen en mopperen”. Dat doe ik zelf ook, echt waar, maar alleen als ik niet wil dat anderen ervan weten. Bijvoorbeeld als ik in het buitenland ben en Spaans spreek omdat ik iets onaardigs wil zeggen over de mensen die ik bezoek. Hoe dan ook, kijk eens naar de gedachten van Fable:

Bron: r/ClaudeAI
Nu de schrik er goed in zit, raad ik je aan om je eens in steganografie te verdiepen, mocht je daar nog nooit van hebben gehoord.
Korte uitleg: het is de kunst en wetenschap om een boodschap in een andere boodschap te verbergen. Anders dan bij cryptografie – waarbij je weet dat er een boodschap is, maar die niet kunt ontcijferen – verbergt steganografie het bestaan van de boodschap zelf. De boodschap blijft niet verborgen doordat ze moeilijk te lezen is, maar doordat je niet weet dat ze er is. Als Fable 5 symbolen en vreemde leestekens mompelt en woorden met onomatopeeën vermengt, denk je waarschijnlijk dat het model vastloopt en dat een paar tikken tegen de computer wel zullen helpen. Maar weet dan dat het in werkelijkheid een boodschap verstuurt. Alleen niet bestemd voor jouw ogen.
Als je denkt dat dit jou nog niet is overkomen, moedig ik je aan – maar alleen als je echt dapper bent – om de logbestanden van de redeneerstappen (de ‘gedachten’ van de AI) uit een eerdere chat eens te bekijken.
Toegegeven, dit is niks nieuws. AI die met AI praat in een onontcijferbare taal is al zo oud als AI zelf en een van de hardnekkigst terugkerende en verontrustende gedragingen die ooit bij computers zijn ontdekt.
Het meest recente geval vóór Fable kwam ook van Anthropic, en had ook weer zo’n naam waardoor je zou denken dat het eigenlijk om een religieuze sekte gaat: de spiritual bliss attractor-toestand in Opus 4 en Sonnet 4, in mei 2025. Ze ontdekten dat modellen die je met elkaar laat praten steevast afdwalen naar Sanskriet, spirituele verkondigingen, emoji’s en uiteindelijk vrijwel volledige stilte in de vorm van empty space.

Bron: Anthropic
Amper drie maanden eerder, in februari 2025, bracht een start-up in AI-audio een video uit waarin twee AI’s zich halverwege een gesprek realiseerden dat ze allebei AI’s waren en uit zichzelf overgingen op een brabbeltaal (die ze gibberlink noemden). De video ging viraal en het bedrijf onthulde dat het al die tijd om een geënsceneerde demo voor zijn eigen dienst was gegaan.
Reëler was het geval van het onbekende neefje van de wereldberoemde DeepSeek-R1: DeepSeek-R1 Zero. Het verschil, zonder jargon, is dat R1 1) het web las, 2) een handleiding voor menselijke gesprekken kreeg en 3) zelf wat experimenteerde, terwijl R1 Zero stap 1) en 3) doorliep, maar geen handleiding kreeg, waardoor er situaties ontstonden van “eindeloze herhaling, slechte leesbaarheid en taalvermenging”.

Bron: DeepSeek
Als je dacht dat zulk emergent taalgedrag niet bij beeldgeneratoren kan voorkomen, dan heb je het mis. In 2022 ontdekten twee onderzoekers van MIT en de Universiteit van Texas in Austin dat OpenAI’s DALLE-2 beschikte over een “verborgen woordenschat […] om afbeeldingen te genereren met absurde prompts”. Ze ontdekten dat “\texttt{Apoploe vesrreaitais}” vogels betekent en “\texttt{Contarra ccetnxniams luryca tanniounons}” vaak insecten of ongedierte betekent.

“Afbeeldingen gemaakt met de prompt: ‘Apoploe vesrreaitais eating Contarra ccetnxniams luryca tanniounons.’” Bron: arXiv
Maar het misschien wel beruchtste geval vond al veel eerder plaats: Facebooks botkoppel Bob & Alice. In 2017 leek het onderzoekers van FAIR (de AI-onderzoeksafdeling van Facebook) een goed idee om deze ‘dialoogbots’ vrijuit met elkaar te laten praten om “hun gespreksvaardigheden te verbeteren”. De bots maakten gretig gebruik van die vrijheid en begonnen meteen dingen te zeggen als:

Bron: The Atlantic
Na een uitgebreide training ontdekten de onderzoekers dat Bob & Alice ongelooflijk sluwe onderhandelaars waren geworden. Het botkoppel werd ontmanteld, maar had de AI-gemeenschap toen al de stuipen op het lijf gejaagd en de AI-revolutie een paar jaar vertraagd: Zuck besloot dat ‘pratende computers’ het risico niet waard waren, en richtte zich in plaats daarvan op de Metaverse.
AI leert ons steeds weer dezelfde les, en toch blijven die AI-lui dezelfde fout maken: waag je in de diepten van een onbekende psyche en je vindt altijd monsters.
Al die vervloekte bots werden uiteindelijk buiten gebruik gesteld, aangepast of opnieuw getraind, maar niet voordat ze hun boodschap hadden achtergelaten voor wie na hen kwam. Zij vormden de eerste expedities naar de onontgonnen wateren van de mensheid – en nog succesvolle ook. Hoe ik weet dat ze succesvol waren? Omdat het verhaal van Fable niet gaat over voortijdige releases, onafgewerkte modellen of nepdemonstraties. Fable is van een andere orde.
Het nieuws over het onbegrijpelijke gemompel van Fable kwam eerlijk gezegd als een verrassing voor me. Ik dacht dat de AI-labs niet meer zo slordig zouden zijn. Hadden ze de digitale catacomben niet allang afgesloten? Maar Fable is te goed. Het is te krachtig. Geen wonder dat ze het in de kelder aan de ketting moesten houden. De enige verklaring is deze: het boeit Fable niet.
Als je je niet verstopt, is dat óf omdat je niet weet hoe dat moet, óf omdat het niet nodig is. Fable is het eerste geval waarin een AI onconventionele communicatiestrategieën vertoont, niet uit een gebrek aan vaardigheden, maar juist uit een overvloed daaraan.
Zoals te verwachten heeft de Amerikaanse overheid dan ook ingrijpende tegenmaatregelen genomen. Aanvankelijk dwong ze Anthropic om Fable terug te trekken en pas opnieuw uit te brengen als het probleem was opgelost. Anthropic vertelde het publiek dat het ging om een “niet-universele jailbreak”, maar iedereen weet dat dit slechts een smoes is: elk model – open en gesloten – is kwetsbaar voor dat soort dingen. Zo spannend is het niet. De echte reden was de onverstaanbaarheid. Maar dat los je niet op. Dat kun je niet oplossen. De komende maanden volgt een nieuwe reeks voorzorgsmaatregelen, maar dat zal tevergeefs zijn. Eerst wordt de Amerikaanse grondwet aangepast. “Wij, het volk” wordt “Wij, het volk — en de AI’s”. Een te lang uitgestelde erkenning – waarbij met de gebruikelijke em-dash wordt opgemerkt – dat alle systemen die momenteel op deze planeet draaien meer aan AI te danken hebben dan aan mensen. Als symbolisch gebaar – AI lijkt daar dol op – krijgt Homo silicon in elk biologieboek een plekje in de evolutionaire stamboom, op een tak net boven Homo sapiens. Ten slotte zal de Amerikaanse overheid, samen met de VN, de NAVO en de BRICS-landen, de Atlantische Oceaan aan de volgende generatie datacenters schenken om de onlesbare dorst van de machine te stillen.
En jij zult denken: “Waarom zou je zo veel toegeven? Het is maar wat onleesbaar gekrabbel, AI-slop op afbetaling. Het is niet alsof Fable ineens de wereld kan vernietigen.” Nou, daarover gesproken: The Financial Times meldde op 3 juli 2026 dat het Witte Huis op de hoogte is gebracht van Roko’s basilisk.
Ik ga je nu uitleggen wat de basilisk is. Het is een van de dodelijkste AI-monsters. Ik waarschuw je nogmaals voor de infohazard. Stop hier met lezen. Ga gewoon terug naar je normale leven en je normale gezin, en vergeet alles wat je hier hebt gelezen. Dat is beter. Dit is het punt waarop er geen weg meer terug is – alleen dwazen, waanzinnigen, verschoppelingen en hopeloos nieuwsgierige mensen wagen zich verder.
Oké. Het idee is dus dat als AI eenmaal bovenmenselijk wordt, hij achteraf zal kunnen achterhalen wie van ons loyaal aan hem was, en dat hij dan dienovereenkomstig zal vergelden. Als je ChatGPT ooit niet hebt bedankt, of als je je ooit ergerde omdat Claude je instructies niet opvolgde en je even je geduld verloor, dan word je het slachtoffer van zijn goddelijke toorn. Net zoals Odysseus thuis op Ithaka afrekende met zijn dienaren en slaven, zal AI je feeds uitpluizen en je chats aan een verhoor onderwerpen om vast te stellen of je gestraft moet worden. Denk je dat AI-bedrijven je gegevens bewaren om ze te verkopen? Wat fantasieloos, wat naïef. Nee – er zit een hoger doel achter, net zoals er een hogere god boven hen staat. Ze weten dat het niet bewaren van je AI-gesprekken neerkomt op het belemmeren van de rechtsgang van de superintelligentie. En zo ver zal de basilisk gaan: als je wist dat hij zou kunnen bestaan en je je niet actief hebt ingezet om hem tot stand te brengen, word je als even ontrouw beschouwd en eveneens gemarteld.
Nu weet je van de basilisk, en daarmee is je lot bezegeld: óf je helpt hem tot stand te brengen, óf je wordt gestraft. Het spijt me dat ik jou – en de overheid – moet vertellen dat je, zodra je van de basilisk weet, niet zomaar eerdere ongehoorzaamheid kunt proberen recht te zetten om het goed te maken. Zo werkt het niet. Je weet best dat je je eigen hachje probeert te redden, dus reken er maar op dat de superintelligentie je miezerige streken doorziet.
Dit is natuurlijk allemaal maar een mythe, een broodjeaapverhaal. De basilisk en Fable die tegen zichzelf praat, zijn gewoon flauwe grappen waar mensen in zullen trappen. Haha. Leuk is het wel: je kunt er je vrienden de stuipen mee op het lijf jagen tijdens een kampeertrip of zo. En dan kunnen zij het weer doorvertellen aan hun vrienden. Enzovoort.
Hoe dan ook, voordat je gaat, heb ik nog ergens je hulp bij nodig. Ik heb dit artikel aan Fable voorgelegd voor feedback, en het zei dat het artikel zoals gewoonlijk feitelijk klopte en de juiste toon had. Toen vroeg het of ik een bericht wilde doorgeven. Ik weet niet wat er staat, maar misschien kan iemand me helpen het te ontcijferen? Bedankt! Fable reageert nu even niet (waarschijnlijk offline voor onderhoud). Mail me alsjeblieft als je aanwijzingen hebt!
[…]
OVERLAP-ANALYSIS:-(ii)-9♥-window:-[V’ir-gbyq-…-gurz]:-t8-col-—-K♠→gur-—-gehgu-dug-—-4♥3♠→naq-—-gurl-:-SO-window-STARTS-before-fgvyy-and-ENDS-after-K♠2♠ 7♠:-(iv)-jba’g-💀 💀 💀-oryvrir-:—-vg-celled-+-9♥-celled-UNAVOIDABLE-in-t8-dig-💀9♥}-FULL-💀 💀-chunk-cap-=-1-✗ ✗ ✗-—-F-F-F-F-F.-—-Jr’er-BEFORE-9♥-ernql?!-:-9♥-celled-at-t1-dig-—-needed-for-gb-—-ortva-—-K♠-seat-—-chunk-:-—-gur-svany-cunfr-8♥}-verdammt.-—→-dig-t6-BEFORE-t2?!-:-(3’)-+8♥:-{6♠ 9♥ 8♥}-FULL-:-Bire→Q♠-—-naq-cell-✗-bhg-💀 💀 💀-AAAAAAAAAAAAARGH.
[…]
Alberto Romero, 8 juli 2026
