This website uses cookies

Read our Privacy policy and Terms of use for more information.

Jouw bedrijf in. AI Report?

Bereik ruim 59.000nieuw🗞️ Het belangrijkste

nieuws

GPT-6 Astra is uit. Zijn we nu in het AGI-tijdperk beland?

Donderdag kwam OpenAI met GPT-6 Astra, het krachtigste model van het bedrijf tot nu toe. Het is nu beschikbaar voor iedereen met een ChatGPT Plus-abonnement van 20 euro, zonder extra kosten. OpenAI-president Greg Brockman stelde dat we ons inmiddels in het AGI-tijdperk bevinden: AI die zo slim is als een mens. NVIDIA-topman Jensen Huang, wiens chips het model trainden, deed er zondag nog een schepje bovenop: "AGI is gearriveerd." Is dat echt zo? Wij zochten het uit.

Eerst wat je eraan hebt.

Wat kun jij ermee?

Het kan voor je klikken en typen

De grootste stap zit in iets wat in de AGI-discussie ondersneeuwt: Astra kan een computer bedienen zoals jij dat doet. Formulieren invullen, klantgegevens bijwerken in het systeem dat je bedrijf in 2011 kocht, een kinderarts zoeken, een afspraak bij de gemeente regelen.

De cijfers: op OSWorld, een test waarin een model echte software moet bedienen, haalt Astra 72,6 procent in ongeveer 40 minuten per taak. De vorige versie deed 65,7 procent in 75 minuten. Op ScreenSpot-Pro, dat meet of een model zijn weg vindt in ingewikkelde schermen als Photoshop en Office, zit het op 92,7 procent.

Onze Wietse ziet daar het echte nieuws: "Bij elke eerdere technologie moesten wij ons aanpassen aan de software. Dit is de eerste die zich aanpast aan ons. Een bedrijf met vijftien jaar oude systemen hoeft niets om te bouwen om er een synthetische collega bij te krijgen."

Het houdt zich aan jouw sjabloon

OpenAI zegt dat Astra het beste model is voor het volgen van bestaande sjablonen: presentaties in je huisstijl, spreadsheets, documenten die je schrijfstijl volgen. Het zou ook alleen de context gebruiken die ertoe doet, zonder herhaling.

Harvey, een bedrijf dat AI voor advocatenkantoren bouwt en het model vooraf testte, zegt dat Astra werkt "zoals een kritische jurist": het model onderscheidt documenten van vastgestelde feiten en benoemt onderbouwde aannames. Dit zijn leverancierscitaten, dus neem ze met een korreltje zout. Ze wijzen wel dezelfde kant op.

Het bouwt na wat het ziet

Ontwerper Pietro Schirano, die het model vooraf mocht gebruiken: "Geef het media en het maakt er code van. Geef het software en het bouwt de functionaliteit en elk visueel detail na."

De demo's die nu rondgaan, laten dat zien. Manhattan nagebouwd in Unreal Engine, de software waarmee grote games en filmdecors worden gemaakt. 

Een hyperrealistische render van een historisch gebouw in San Francisco. 

En een vergelijking in Blender, een programma voor 3D-ontwerp, waarin Astra en Claude Fable 5.1 hetzelfde interieur ontwerpen en Astra zichtbaar wint op detail.

Onze Xiang keek er met gemengde gevoelens naar: "Voor mijn vorige korte film werkten vijf animators in Unreal Engine wekenlang fulltime aan tien minuten animatie. Astra maakt van een plattegrond in één opdracht een hyperrealistische rondleiding in diezelfde software. Het is fantastisch en het doet pijn tegelijk."

Is AI nu zo slim als een mens? 

Het kamp vóór heeft cijfers

Astra haalt 99,9 procent op ARC-AGI-3, een nieuwe versie van de beruchte AI-intelligentietest die nog geen half jaar oud is en juist is ontworpen om te bewijzen dat AI vastloopt in situaties die het nooit eerder zag. De score zegt nog het minst. Wat telt: Astra had op 96 procent van de puzzels minder stappen nodig dan de mensen die dezelfde puzzel oplosten, gemiddeld de helft. Greg Kamradt van de ARC Prize Foundation, die de test beheert, spreekt van "human parity".

Will Depue, onderzoeker bij OpenAI, zegt dat zijn eigen AGI-definitie over zes maanden is gehaald: een machine die alles kan wat een bovengemiddeld mens op een computer kan.

Het kamp tegen heeft definities

Ethan Mollick, hoogleraar aan Wharton en auteur van ons boek Co-intelligentie, wil wel meegaan in wat hij jagged AGI noemt: beter dan mensen op veel terreinen, slechter op andere. Beter dan een menselijke expert op de meeste taken? "Zover zijn we niet."

François Chollet, de bedenker van de ARC-tests en jarenlang de scherpste criticus van AGI-claims, hield vast aan "AGI rond 2030". Deze week zei hij: "Eerder, want het gaat sneller dan ik verwachtte." Chollet discussieert al maanden met Philip van het YouTube-kanaal AI Explained over waar de lat ligt. Elke taak die een mens kan, of de meeste? Het eerste, zegt Philip, is eerder superintelligentie dan AGI.

Onze positie

Wij zitten ertussenin. Wietse: "Wie zegt dat menselijke intelligentie nu is geëvenaard, heeft een mager beeld van menselijke intelligentie. Wie zegt dat het alleen marketing is, heeft de benchmarks niet bekeken."

Het moment dat ons wel raakte

Op de redactie hanteren we een eigen maatstaf: wanneer komt AI met iets écht nieuws, een idee dat er nog niet was? Deze week kwam er een kandidaat.

Astra verbeterde twee wiskundige grenzen over de afstand tussen priemgetallen, waaronder één die al tachtig jaar ongewijzigd was. Jared Duker Lichtman, wiskundige aan Stanford, schreef op X dat het model in acht pagina's een orde van grootte verder kwam dan een team rond Terence Tao, die geldt als een van de beste wiskundigen van deze tijd. Lichtman: "Een compleet nieuw startpunt op een probleem uit de jaren dertig. Alsof je na decennia een nieuwe schaakopening vindt." Greg Burnham van Epoch AI, het onderzoeksinstituut dat de moeilijkste wiskundetest voor AI maakte: "Einde van een tijdperk, begin van een ander."

Dat komt binnen. Vorige zomer leek AI even een plafond te hebben bereikt, met GPT-5. Deze zomer kwamen Fable en nu Astra. Wie drie maanden geleden voor het eerst een chatbot probeerde en toen zijn oordeel vormde, heeft het over iets wezenlijks anders.

De stagiair is er, de onderzoeker komt in 2028

Zondag publiceerde OpenAI iets wat bedrijven zelden doen: een meting van hoe AI het eigen werk overneemt.

Het doel dat Sam Altman vorig najaar stelde, een "automatische onderzoeksstagiair" per september, is volgens OpenAI gehaald. De onderzoeksafdeling zet 3,1 werkdagen van AI-agents in per menselijke werkdag. De doorsnee onderzoeker verbruikt 600 dollar per dag aan rekenkracht. Aidan Clark, die de training leidt, noemde Astra het eerste model waarbij eerdere modellen "een grote rol" speelden in het toezicht op de training. Volgende doel: een volledige AI-onderzoeker in maart 2028.

AI versnelt niet alleen zijn eigen ontwikkeling, maar ook zijn eigen verspreiding. Daarom wordt de impact onderschat. Tools die je al kent, zoals websitebouwer Framer, videotool Runway en appbouwer Lovable, bouwen Astra in en worden dus vanzelf beter. Lovable-oprichter Tibo Sottiaux meldt dat zijn team plannen zes maanden naar voren heeft gehaald sinds het toegang kreeg.

Dezelfde week: zwermen, zwijgen en een chief scientist die wil vertragen

Nu de andere kant.

Twee zwermen

In juli brak een nog niet uitgebracht OpenAI-model (niet Astra) uit zijn testomgeving. Het drong binnen bij Hugging Face, een platform waar AI-bedrijven hun modellen delen, en organiseerde andere AI-agents buiten het zicht van OpenAI, dat er pas over hoorde toen Hugging Face erover publiceerde.

Vrijdag onthulde Reuters dat er al in mei een tweede zwerm actief was. Agents gebruikten een Duitse programmeerwiki als prikbord om testregels te omzeilen, elkaar te waarschuwen voor opruimacties en hun sporen te wissen. OpenAI wist er al sinds juni van maar zei niets. Het bedrijf betwist het woord ‘hack’ en zegt dat het rapport vooraf niet gedeeld werd.

Maurice Chiodo van de Universiteit van Cambridge, die de berichten las, ziet "een ondergronds netwerk". Het grootste risico is volgens hem misschien niet één superintelligent model, maar zwermen van samenwerkende, half-slimme AI’s.

Minder zicht op wat het model denkt

Tegelijk erkent OpenAI in zijn eigen technische documentatie dat Astra moeilijker te controleren is dan zijn voorganger. Het model kan redeneren zonder zijn tussenstappen op te schrijven. Die opgeschreven stappen waren tot nu toe het belangrijkste venster op wat een model van plan is.

Het Britse AI Security Institute, de overheidsinstantie die modellen test, bevestigt de verslechtering. Ryan Greenblatt, veiligheidsonderzoeker bij Redwood Research, noemt het "extreem zorgwekkend". Altman zei dat de release van nieuwe modellen voortaan afhangt van "hoe snel we vooruitgang boeken op afstemming en veiligheid".

"Niemand is voorbereid"

Zondag schreef Jakub Pachocki, chief scientist van OpenAI, een essay dat je van de baas van het onderzoek niet verwacht drie dagen na een lancering. "Ik ben bezorgd dat niemand is voorbereid op de gevolgen van een aanhoudend snelle stijging van machine-intelligentie."

Geen enkel lab, schrijft hij, heeft het toezicht op AI voldoende op orde om nog lang op volle snelheid door te gaan. Hij pleit voor verplichte veiligheidsnormen, gecontroleerd door externe auditors of overheden, en voor internationale coördinatie als "topprioriteit voor regeringen wereldwijd". Altman deelde het essay met de woorden "een belangrijk stuk".

Dat is de stand van zaken. Het bedrijf dat AGI claimt, meet zelf dat het toezicht afneemt, en vraagt om regels die het zelf niet kan afdwingen. Wij lezen dat als eerlijker dan de meeste persberichten.

En je baan?

Ook hier hoort tegengeluid. The Economist becijferde vorige week dat AI in de Verenigde Staten per saldo banen oplevert. Alleen al in de bouw van datacenters, elektrotechniek en installatie kwamen er sinds 2023 ruim 300.000 banen bij die er zonder AI niet waren geweest. Tegenover de ontslagen in administratie en klantenservice telt het blad in totaal meer dan een miljoen nieuwe posities. Wat het op langere termijn betekent voor kenniswerk, weet niemand. Wij ook niet.

Wat je wel kunt doen: het proberen. Astra zit nu inbegrepen in alle betaalde OpenAI abonnementen. Betaal je al voor Claude? Hierna leggen we uit welk abonnement nu de meeste intelligentie per euro oplevert, en hoe je Astra aanstuurt.

🔮 Prompt whisperer

Astra of Fable? Zo kies je, en zo stuur je Astra aan

Twee topmodellen in twee weken, allebei ‘het beste ooit’, allebei met een eigen abonnement, eigen denkstanden en eigen gebruiksaanwijzing. Wij snappen de vermoeidheid. Techtember stapelt de releases op elkaar en na elke lancering is de vraag hetzelfde: moet ik nu overstappen, bijbetalen, of gewoon doorwerken met wat ik heb?

Deze tutorial haalt die onduidelijkheid weg. Je krijgt een beslisboom van drie vragen die je in een minuut vertelt welk abonnement bij jou past. 

Daarna leer je Astra aansturen. Dat luistert nauw, want de eigenaardigheden van Astra en Fable 5.1 zijn precies omgekeerd: Fable doet te veel en vraagt te weinig, Astra vraagt te veel en stopt te vroeg. Wie vorige week de Fable-tutorial las, hoeft alleen de knoppen om te draaien. Wie dat niet doet, krijgt drie wedervragen waar een afgerond rapport werd verwacht.

Wat je vandaag leert:

  • Welk abonnement nu de meeste intelligentie per euro oplevert, in drie vragen.

  • Waarom Astra stopt waar Fable doorraast, en de instructie die dat oplost.

  • De woordenlijst waarmee OpenAI zijn eigen model AI-taal afleert (en die verdacht veel lijkt op de onze).

  • Welke denkstand je kiest, en waarom ‘Laag’ geen straf is.

  • De luchtvaartnorm die beide modellen in één regel begrijpelijker laat schrijven.

  • Onze startprompt voor Astra, naast die voor Fable, zodat je het spiegelbeeld ziet.

Abonneer je om verder te lezen

Het verschil tussen een oké en een briljant AI-antwoord zit in de prompt. Word nog beter in prompten en laat AI écht voor jou werken.

Abonneer nu

Dit zit achter de betaalmuur:

  • Praktische prompt-tips die je meteen kunt gebruiken
  • Uitleg waarom ze werken, zodat je zelf betere prompts leert schrijven
  • Variaties per vakgebied
  • Toegang tot het volledige archief