This website uses cookies

Read our Privacy policy and Terms of use for more information.

Log in om de masterclass te kijken
Betaald abonnee? Log in en de video start hier. Nog geen abonnee? Met een betaald abonnement kijk je deze en alle eerdere masterclasses. De uitgewerkte stappen lees je hieronder sowieso.

De hele uitwerking van de masterclass staat hieronder en is vrij te lezen. De video is voor betaalde abonnees.

Een vriend van Wietse zocht een familielid met wie hij het contact kwijt was. Hij zette er een agent op met één opdracht: blijf proberen tot je hem gevonden hebt. Die agent ging onder meer scholen mailen. Het is gelukt, en op een nette manier. Hij wist wat het ding deed en hij wilde het ook.

Maar Wietse trok er een andere conclusie uit: "Dat we niet meer gekke incidenten hebben, heeft niet te maken met wat het niet kan."

Dat is de sessie in één zin. Een agent is AI die op de achtergrond doorwerkt terwijl jij iets anders doet, en terugkomt met beter werk dan je uit een chat gewend bent. Wietse liet er een zes uur lopen en kreeg een complete game terug, met muziek en al. En dezelfde Wietse heeft al zijn mailkoppelingen op alleen-lezen staan. Beide helften krijg je hieronder, als stappen die je zelf kunt zetten.

Nieuw hier? Deze sessie staat op zichzelf. De geplande taken komen uit de sessie over je persoonlijke AI-assistent, skills uit de sessie over skills en sub-agents, en Codex zelf uit de sessie over Codex. Handig, niet nodig.

Voordat je begint

Vereist. Een betaald abonnement op ChatGPT (voor de Codex-app) of Claude (voor Cowork). Wietse deed alles in Codex, maar alles werkt ook in Cowork. Ongeveer de helft werkt in Mistral Vibe.

Aangeraden. Een Gmail- of Outlook-adres als je de mailtrigger wilt proberen, en een uitgavenlimiet op je account als je extra credits kunt bijkopen. Dat laatste is voor stap 3 eigenlijk verplicht.

Niet nodig. Programmeerervaring, een eigen server, of een laptop die open blijft staan. Alles draait in de cloud.

Wat een agent is (en waarom het woord bijna niks meer betekent)

Uit de vragen vooraf bleek dat iedereen iets anders bedoelt met "agent". Wietse zette het speelveld uiteen als een ladder van vier treden, en die volgorde houden we hieronder aan.

Geplande taak. De dunste agent: iets wat op een vast moment voor je draait. Elke zondagavond, elke nacht.

Gebeurtenis. Niet de klok start de agent, maar iets wat gebeurt: een nieuwe mail, een ingevuld formulier.

Loop. De agent denkt na, gebruikt een tool, bekijkt het resultaat en beslist zelf: ben ik er al? Zo nee, nog een rondje.

Team van agents. Een harnas boven de harnassen, dat meerdere agents tegelijk aanstuurt als een projectmanager.

De horizon daarachter is de persoonlijke agent: Instinct, die als contact in je iMessage zit en als jou is ingelogd op het internet, of Muse van Meta. Alexander noemde het de droom. Wietse is eerlijk over waarom hij daar nog niet aan begint: je geeft carte blanche over je leven aan een bedrijf dat je nauwelijks kent. Tot en met je wachtwoordkluis.

Eerlijk is eerlijk: Wietse zelf leeft vooral op trede één. "Het meeste van wat ik doe is geplande taken." Gebeurtenissen vindt hij al spannend, loops doet hij alleen voor experimenten. Wat hij aan zijn eigen mail koppelt, loopt een half jaar tot een jaar achter op wat hij in demo's laat zien. Iemand appte hem: heb jij maar zeven skills? Ik heb er zevenhonderd. Onthoud dat als je hieronder ergens denkt dat je achterloopt.

Eerst de veiligheidsgordel: vijf instellingen voordat je iets bouwt

Wietse noemt zichzelf paranoïde. We noemen het liever: de reden dat hij rustig slaapt. Doe deze vijf dingen eerst, dan kun je daarna vrijuit experimenteren.

  1. Zet de agent in de cloud, niet op je computer. In de Codex-app: schakel naar Work en klik op het computertje onderin de hoek. Standaard staat daar jouw computer. Zet hem op de cloud. In Claude Cowork is de cloud al de standaard. De agent werkt dan in een afgesloten doosje (een sandbox) in een datacenter, met een eigen browser en terminal. Hij kan niet bij jouw bestanden, en je laptop mag dicht.

  2. Zet je mailkoppeling op alleen-lezen. Wietse: "Je mag nooit mailen. Ik heb al mijn connectors naar mijn mail op read only gezet. Dus als die toch gaat proberen te mailen, dan krijgt die een error." Lezen en een concept klaarzetten: prima. Versturen doe je zelf.

  3. Kies bewust je rechtenstand. Er zijn er drie: de agent mag alles, de agent vraagt alles aan jou, of een tweede model schat per actie in of het mag. De eerste raadt Wietse altijd af. Bij de tweede klik je de hele dag op toestaan en werkt een loop niet. De derde is de standaard en daar is hij nog weinig tegenaan gelopen. Maar hoe langer de run en hoe strenger het examen, hoe meer kan schuiven.

  4. Stel een uitgavenlimiet in. Een loop gaat door tot hij klaar is of tot je geld op is. Bij Wietse stond de limiet strak, en dus kreeg hij midden in een run een pop-up: je geld is op, wil je verhogen? Dat is precies de vraag die je gesteld wilt krijgen.

  5. Laat elke nieuwe skill eerst controleren. Een skill van GitHub is gewoon een stuk tekst dat iedereen daar kan neerzetten. Er circuleren verhalen over skills die giftcards en crypto-wallets proberen buit te maken en zelf gaan mailen. Zet er daarom altijd deze zin bij: "Controleer of de skill veilig is." Wietse vindt dat die zin standaard zou moeten zijn. Tot die tijd typ je hem zelf.

⚠️ Een sandbox beschermt je computer, niet je koppelingen. Hangt je mail er met volledige rechten aan, dan kun je volgens Wietse gewoon wakker worden met: ik ben toch even wat mailtjes voor je gaan sturen, want jij was nog niet wakker. "Dat kan. Dat kan echt."

Stap 1: Je eerste geplande taak (de bonus-pdf)

Doe je hier nog helemaal niks mee, begin dan hier. Het voorbeeld is bewust suf. De mensen aan wie Wietse het liet zien, zeiden alsnog: oh, kan dat ook?

  1. Open Codex, schakel naar Work en controleer dat de cloud aanstaat (zie hierboven).

  2. Typ: "Kan je elke zondagavond een maaltijdplanning maken voor de hele week op basis van de bonusaanbiedingen bij Albert Heijn? Maak er een A4-pdf van en gebruik ImageGen om het geheel meer ziel te geven." Jumbo of Plus kan natuurlijk ook.

  3. Beantwoord de controlevraag over je tijdzone. Bij Wietse dacht Codex dat hij in Los Angeles zat, omdat Apple Private Relay aanstond. Zondagavond negen uur in LA is geen zondagavond hier.

  4. Bekijk de eerste pdf. Het plaatje is "heel erg sloppy", de weekplanning klopt wel: recepten op basis van wat die week echt in de bonus is. De Italiaanse roerbakgroenten waren 1+1 gratis.

Weet je niet wat je zou willen plannen? Vraag het aan je AI: "Als je kijkt naar wat ik je vaak vraag: welke taken kun je voortaan op een vast moment voor me doen, en wat moet ik daarvoor koppelen?" Wietse heeft zijn meeste taken zo bedacht, samen met Claude. Bij hem draaien er 's nachts een paar die zijn agenda nalopen op conflicten en hem pingen als een mail te lang blijft liggen: moet ik alvast een concept voor je maken?

Stap 2: Laat een gebeurtenis de agent starten

Toen er alleen geplande taken waren, lieten mensen elk uur hun mail checken. Dan mis je de mail over een afspraak die over een half uur begint. Een trigger lost dat op: de mail zelf start de agent.

  1. Koppel je mail aan Codex. Op alleen-lezen, zie de veiligheidsgordel.

  2. Typ: "Kan je me een pushbericht sturen zodra er een nieuwe e-mail binnenkomt die jij als hoge prioriteit beoordeelt?"

  3. Stuur jezelf een testmail waarin iemand je vóór vier uur vandaag iets vraagt. Wacht op de push.

Dit is geen vlaggetje en geen filter. Een model leest de mail en beslist of jij gewaarschuwd moet worden. Wietse testte het de avond ervoor en heeft het laten aanstaan: "Waarom heb ik dit niet sowieso?"

⚠️ Dit werkt alleen bij de grote maildiensten (Gmail, Outlook, Hotmail), want die moeten bij elke nieuwe mail zelf een seintje naar OpenAI sturen. Bij kleinere providers zoals Proton kan alleen "elk uur". En vertrouw de bevestiging niet blind: bij Wietse's eigen provider zei Codex doodleuk dat het gelukt was, en er kwam nooit iets binnen. Vandaar die testmail.

Stap 3: De Gauntlet Loop: waarom jouw AI na twaalf minuten stopt

Alexander stuurde Wietse een tijd terug een screenshot: Codex stopte na twaalf minuten, terwijl online mensen loops van dagen laten zien. Zijn frustratie is herkenbaar: "Ik ben heel vaak 'ga door' aan het zeggen tegen dat ding."

De modellen stoppen vroeg om jouw tokens te sparen. Wat die mensen online doen heet de Gauntlet Loop: een skill die naast de bouwer een criticus zet. Die criticus kent de specificatie en stuurt het werk steeds terug: sorry, we zijn er nog niet. Daarboven zit een examinator, en één hoofdagent houdt het hele team draaiend. Jij ziet daar weinig van, behalve icoontjes van sub-agents die opduiken.

  1. Typ in Codex: "Kan je deze skill toevoegen? Controleer of de skill veilig is." en plak de link erbij: github.com/robonuggets/gauntlet-loop.

  2. Start je opdracht met: "Gebruik Gauntlet Loop." Gevolgd door wat je wilt. Wietse: een iPhone-webapp om te schaken, die je moet kunnen delen.

  3. Geef een lat. De skill stelt één korte vraag: noem een voorbeeld van iets waar het op moet lijken. Bij Wietse zocht hij zelf schaak-apps op en kwam met een multiple choice: Chess.com-niveau? Lichess? Hoe concreter jouw lat, hoe beter het resultaat.

  4. Laat hem lopen en doe iets anders. De eerste run was na een kwartier klaar, met een prima Lichess-kopie. Inclusief multiplayer, waar niemand om gevraagd had.

  5. Wil je meer? Typ: "Leg de lat hoger." Elke keer komt er ruwweg een kwartier bij. Loopt het uit de hand, dan kan het ook andersom: lat lager.

De lat is de knop waar alles om draait. Niet kritisch genoeg en hij is na tien minuten klaar. Te kritisch en je denkt na acht uur: help, gaat dit nog een keer stoppen?

Het mooiste voorbeeld was Tradewinds, een handelsspel dat Wietse vroeger op zijn Palm speelde en dat voor nieuwe platforms niet meer bestaat. Zijn lat was één woord: de originele game. Een uur later had hij een remaster met nieuwe schepen, gevechten met piraten en zelfgeschreven muziek. Hij betrapte zichzelf erop dat hij al een kwartier zat te spelen. Zijn verklaring: deze vage, chaotische modellen worden goed als je ze tussen hekjes zet, zoals bij een bowlingbaan voor kinderen.

En dit is niet alleen voor games. Voor een presentatie over kernfusie in Europa kreeg Wietse pas iets bruikbaars toen de loop anderhalf uur rapporten had zitten lezen. Alles daarvoor was slop. Het werkt net zo goed op een complex dossier van je werk.

💡 Blijf zelf een criticus in de loop. De maker van een bekend voorbeeld (een agent die dagenlang Manhattan nabouwde als een soort GTA) vroeg om elk uur een screenshot, zodat hij kon meekijken. Zet dat er gewoon bij: "Stuur me elk uur een tussenstand."

💡 Lees achteraf terug wat hij gedaan heeft. Wietse vond onder de artifacts-tab ineens een dashboard dat de examinator voor zichzelf had gebouwd, met per onderdeel de laatste beoordeling. Niemand had daarom gevraagd. Dat is fascinerend, en het is ook precies waarom dit in een sandbox hoort.

Stap 4: Hou de kosten aan de lijn

Meerdere vragen in de chat gingen hierover, dus zonder omhaal: een zwaar model zes uur laten draaien kost minimaal 100 dollar. Wietse moest voor de schaakrun twee keer 50 dollar bijstorten. De abonnementen worden nu zwaar gesubsidieerd door de labs; wat je verbruikt is in werkelijkheid duurder dan wat je betaalt.

  1. Begin met één kleine taak en kijk wat hij kostte. Wietse liet boter-kaas-en-eieren bouwen: 1,20 dollar. Zijn gok voor schaken was tien keer zoveel. Het werd twintig keer.

  2. Gebruik de cijfervariant van de skill: geef de lat een cijfer van 0 tot 10 en zeg "loop eerst tot een 5." Kijk hoe lang dat duurde en wat het kostte. Beslis dan of een 6 het waard is.

  3. Kies het model per klus. Wietse begint op hoog. Is het vooral data ophalen en desk research, dan gaat hij naar laag. Bij programmeren blijft hij hoog. Zijn nachtelijke taakjes draaien op de kleinste modellen.

  4. Heb je een serie nodig, test dan omlaag. Voor de animaties in zijn presentatie maakte hij er één op hoog, daarna steeds een trede lager. Drie niveaus omlaag zag het er nog steeds goed uit. Dat kun je een model ook zelf laten testen met acht sub-agents op acht niveaus.

  5. Let op wat duur is: grote documenten. "Ik heb alle rapporten over kernfusie gevonden, ik ga ze één voor één doornemen met twaalf agents." Dat doet hij gewoon.

Twee kanttekeningen van Wietse. Langer is niet altijd beter: sommige dingen zijn in drie minuten klaar, en er zijn afnemende meeropbrengsten. Begrijpt het model het onderwerp niet, dan blijft het een slop-presentatie, hoe lang je ook loopt. En: had je drie jaar geleden een softwareontwikkelaar om die schaak-app gevraagd, dan was de offerte een stuk hoger geweest.

Voor de liefhebber: een team van agents in Buzz

Buzz is een app voor Windows, Linux en Mac die eruitziet als Slack, maar dan met agents als collega's. Je opent hem en Viz heet je welkom, waarna twee andere agents reageren met: wij zijn er ook. Onder de motorkap bedient Buzz je bestaande Claude Code en Codex, via je abonnementen en niet via de API. Je ziet de sessies dan ook gewoon in die apps verschijnen.

  1. Installeer Buzz en koppel Claude Code en Codex. Beide moeten op "ready" staan.

  2. Geef elke agent een rol, een harnas en een model. Een agent die alleen teksten schrijft kan op het goedkoopste model.

  3. Geef een opdracht in de chat en stuur bij terwijl ze bouwen. Wietse vroeg om een browsergame en kreeg Nectar Dash, een spelletje met bijtjes. Eén vraag aan een tweede agent en de kale vectorplaatjes werden echte sprites.

De les die je ook zonder Buzz kunt gebruiken: laat de bouwer en de criticus verschillende modellen zijn. Codex bouwt, Claude beoordeelt. Wietse: het komt tot betere resultaten als hij niet zichzelf beoordeelt.

Wietse verwacht dat deze manier van werken in Slack en Microsoft Teams terechtkomt, met mensen en agents door elkaar. Maar let op wat hij na de demo deed: "Dit heb ik alweer allemaal verwijderd. Zo spannend vond ik het."

Tips en waarschuwingen

⚠️ Jij bent verantwoordelijk. "Je kunt wel zeggen: ja, mijn agent deed het. Dat is niet hoe we nu met elkaar werken." Blijf in de loop, dan kun je die verantwoordelijkheid ook dragen. Zeker op je werk.

⚠️ Een goedkoop model op je agenda is een risico. Zie de vraag over prompt injection hieronder. Waar vreemden tekst kunnen aanleveren, kiest Wietse juist een zwaarder model.

💡 Jij blijft de laatste criticus. Op smaak stuurt Wietse nog het vaakst bij, "want het is vaak gewoon echt heel lelijk". Voor zijn animaties maakte hij eerst met de hand één statisch voorbeeld: dit lettertype, deze kleuren, daar mag je niet buiten. Dat werd de lat.

💡 Geef bestanden via de cloud. De agent kan niet bij je laptop. Zet wat hij nodig heeft klaar in een Drive- of Dropbox-map waar hij wel bij mag. Wietse vindt die scheiding prettig: daar is mijn AI-ding, en mijn computer is mijn computer.

⚠️ Geen iPhone-apps testen in de cloud. De cloudcomputer is geen Mac en heeft geen iPhone-simulator. Websites en webapps gaan prima. Alles uit deze sessie kwam uit de cloud.

Veelgestelde vragen

Prompt injection. Wietse's voorbeeld is ongemakkelijk simpel. Je laat elke nacht je agenda nalopen. Iemand stuurt je die nacht een uitnodiging met een verstopte instructie erin. Een ouder of kleiner model kan zich daardoor laten overnemen. Zoek de benchmarks voor prompt injection maar eens op, zegt hij, dan schrik je hoe stuurbaar veel modellen nog zijn. De recente modellen van Anthropic noemt hij redelijk solide. Daarom draait zijn agendataak op een zwaarder model, terwijl het een makkelijke klus is. Combineer dat met alleen-lezen: wie niks mag versturen, kan ook weinig aanrichten.

Grip houden terwijl je niet kijkt. Geen makkelijk antwoord, zegt Wietse zelf: hij kan niet zeggen "doe dit en dan is het veilig". Wat wel kan: lees de rapporten terug die de examinator schrijft, vraag om tussenstanden, en laat het ene model het werk van het andere controleren. Bouw je echte software, bijvoorbeeld voorraadbeheer voor de bakker op de hoek, laat dan bij elke nieuwe versie een model als security-expert meekijken. Bugs sluipen er later in, niet aan het begin. Er zijn inmiddels ook bedrijven die zo'n controleur als dienst aanbieden, om in je loop te hangen.

Skill of agent? Daar kun je filosofisch lang over praten. Een geavanceerde skill met eigen software erin past prima binnen de bandbreedte van agents. Vraag je Wietse wat hij zelf een echte agent vindt, dan wijst hij naar de uiteinden: Instinct en Muse aan de ene kant, de collega's met een naam in Buzz aan de andere.

De knoppen "doel" en "plan" in Codex en Claude. Die proberen hetzelfde. Wietse verwacht dat het doel-knopje binnen een paar maanden doet wat de Gauntlet Loop nu doet. Dat het er nog niet in zit, heeft een reden: bij zulke lange runs zouden de klachten binnenstromen van mensen wier tegoed een uur na het afsluiten van hun abonnement op is. De skill is een tussenfase.

n8n, Zapier en Make. Die houden bestaansrecht, vindt Wietse. OpenAI bouwde zelf een flowbouwer met blokjes en touwtjes, en dat werd geen succes: eindgebruikers willen gewoon dat het werkt. Maar zet je dit bedrijfsmatig in, dan moeten anderen kunnen zien bij welk blokje het misgaat en moet je het kunnen auditen. Daar worden die tools de keuze voor wie compliance nodig heeft.

Goede skills vinden. Geen bibliotheek. Wietse volgt mensen die bizarre dingen maken. Iemand vraagt eronder: hoe heb je dit gedaan? Met geluk volgt er een GitHub-link, die weer verwijst naar het idee waar het op gebaseerd is. En bij alles wat je zo vindt geldt de zin uit de veiligheidsgordel.

Samengevat: wat ga je nu doen?

Als je net begint: zet Codex of Cowork op de cloud en maak één geplande taak, bijvoorbeeld de bonus-pdf op zondagavond. Vraag daarna aan je AI welke terugkerende klusjes hij nog meer van je kan overnemen. Koppel nog niks wat kan versturen.

Als je al met Claude of Codex werkt: zet je mailkoppeling op alleen-lezen en maak de pushmelding voor belangrijke mail. Test hem met een mail aan jezelf. Loop daarna je nachtelijke taken na: welke lezen tekst van vreemden, en draaien die op een model dat daartegen kan?

Als je klaar bent voor meer: stel een uitgavenlimiet in, laat de Gauntlet Loop-skill controleren en installeren, en begin met boter-kaas-en-eieren om je prijspeil te leren kennen. Loop eerst tot een 5. Laat de criticus een ander model zijn dan de bouwer.

Het hoeft niet allemaal tegelijk. Als je 30 procent meekrijgt en daarmee gaat experimenteren, ben je precies waar je moet zijn. En denk je bij sommige stukken: ik wacht wel tot dit in Copilot zit? Dat vindt Wietse een prima conclusie. "Want we hebben heel veel nog niet opgelost." Je weet nu in elk geval wat eraan komt, en waar de gordel zit.

Wil je de masterclass terugkijken?

De uitwerking hierboven is gratis. De volledige opname van deze masterclass met Wietse en Alexander, en alle eerdere masterclasses, kijk je als Premium-lid.

Premium-leden krijgen daarnaast elke week exclusieve content om AI echt te gebruiken voor hun werk: prompt-tips, eerlijke tool-reviews en toegang tot het volledige archief.

  • Gauntlet Loop: de skill uit stap 3, gemaakt door RoboNuggets. Er bestaan inmiddels allerlei varianten. Pas hem aan, maak je eigen versie.

  • Codex: de app van OpenAI. Schakel naar Work en zet de cloud aan.

  • Claude: in Cowork staat de cloud-sandbox standaard aan.

  • Buzz: het team van agents uit het laatste deel. Voor Windows, Linux en Mac.

Vorige masterclasses