This website uses cookies

Read our Privacy policy and Terms of use for more information.

🗞️ Het belangrijkste nieuws

Fable-niveau voor de prijs van een Pro-abonnement: Claude Opus 5.5 is uit, en OpenAI halveert meteen zijn prijzen

Vorige week riep Anthropic-topman Dario Amodei de hele AI-sector op om het rustiger aan te doen, en OpenAI-baas Sam Altman viel hem publiekelijk bij. Dinsdagmiddag brachten hun bedrijven binnen een uur na elkaar een nieuw model uit. De wapenwedloop gaat gewoon door, en voor jou betekent dat concreet dat het topniveau waarvoor je drie weken geleden nog moest bijbetalen nu in het Pro-abonnement van 20 euro zit.

Wat is er gebeurd?

Anthropic, de maker van Claude, bracht Claude Opus 5.5 uit. Voor wie de namen niet uit elkaar houdt: Anthropic verkoopt zijn modellen in oplopende klassen, van Haiku en Sonnet (klein en goedkoop) via Opus (de middenklasse) naar Fable (het duurste en krachtigste model dat je als gewone gebruiker kunt afnemen). Het nieuws is dat de middenklasser volgens het bedrijf nu "presteert op het niveau van Claude Fable 5.1 bij het meeste werk", en 40 procent goedkoper is dan zijn voorganger Opus 5. OpenAI antwoordde met GPT-6 Sol en Luna, twee kleinere en goedkopere varianten van GPT-6 Astra, het topmodel dat OpenAI drie weken geleden uitbracht als tegenhanger van Fable. Sol en Luna kosten de helft van hun voorgangers.

Opus 5.5 is vanaf nu het standaardmodel in de Claude-app, ook in het Pro-abonnement. Drie weken geleden schreven we nog dat je voor Fable-niveau moest bijbetalen of upgraden naar Max. Dat advies is achterhaald.

Wat kun je ermee?

Opus 5.5 is voor kantoorwerk het interessantst op drie punten.

Het schrijft beter. Anthropic geeft toe dat de tekst van Opus 5 de meest gehoorde klacht was en zegt dat te hebben opgelost: het belangrijkste vooraan, minder jargon, en het houdt zich aan de schrijfregels die je meegeeft. Op X werd niets zo vaak gedeeld als de waarneming dat de em-dashes uit de output zijn verdwenen. Een Anthropic-onderzoeker vatte de release samen met "veel, veel, veel beter dan Opus 5. Sorry voor dat model."

Het model controleert zijn eigen werk. In een interne test moesten Opus 5.5, Fable 5.1 en Opus 5 een kwartaalrapport schrijven over een bedrijf, waarbij elk cijfer en citaat werd getoetst aan de bron. Opus 5.5 slaagde in 16 van de 18 pogingen; de andere twee in geen enkele. Hedgefonds Walleye Capital meldt dat het model een fout in de eigen testinstructies ontdekte en corrigeerde, "wetend dat dat punten zou kosten bij de beoordelaar".

Je krijgt meer voor je abonnement. De limieten per vijf uur gaan 20 procent omhoog op Pro, Max en Team, en je krijgt een reset die je zelf mag bewaren voor het moment dat je hem nodig hebt.

OpenAI's antwoord

Sol en Luna zijn geen nieuwe topmodellen. Sol zit een trede onder Astra en is bedoeld voor terugkerend werk zoals code en agents (AI die zelfstandig taken uitvoert); Luna is voor bulkwerk als samenvatten en informatie uit documenten halen, en kost een tiende van Sol. OpenAI zegt dat Sol de helft minder feitelijke fouten maakt dan zijn voorganger en op zakelijke workflows Fable 5.1 verslaat voor een fractie van de prijs. Beschikbaarheid: alleen in ChatGPT Work, de zakelijke versie van ChatGPT, en in Codex, de programmeertool van OpenAI, voor betalende gebruikers. Gratis gebruikers krijgen Luna in de desktop-app. In het gewone ChatGPT-gesprek zitten ze nog niet.

Wie wint?

Op de tests die beide labs delen, wint Opus 5.5 elk onderdeel, van programmeren tot kantoorwerk. Op GDPval, de test die "echt kantoorwerk" over 44 beroepen meet, scoort Opus 5.5 zelfs hoger dan Astra. Sol scoort daar ongeveer 100 punten lager dan de GPT-5.6 Sol die het vervangt; volgens meetbureau Artificial Analysis komt dat niet door slechter redeneren maar door zwakkere opmaak en opdrachten die half werden afgemaakt.

Sols voordeel is de prijs, en dat is geen detail. AI-modellen rekenen per token, een stukje tekst van een paar letters tot een woord. Per token kost Sol de helft van Opus 5.5, en Opus 5.5 gebruikt veel tokens: op de hoogste denkstand (je kunt instellen hoe lang het model nadenkt voor het antwoordt) zo'n 119.000 per taak, tegen 31.000 voor Sol. Artificial Analysis rekende uit dat Opus 5.5 op die stand per taak evenveel kost als Opus 5; de "40 procent goedkoper" geldt op de standaardstand Medium. Dat is ook de stand die Anthropic zelf adviseert, en waar de meeste van zijn klanten hun winst melden: Box, het bedrijf achter de gelijknamige bestandsopslag, zag een derde van de tokens en 40 procent kortere antwoorden zonder verlies aan nauwkeurigheid.

Voor de abonnee betekent dit: in de Claude-app op Medium krijg je Fable-kwaliteit voor Opus-verbruik. Wie per token betaalt en vooral bulkwerk doet, is het best af met Luna.

Kanttekeningen

Opus 5.5 komt met dezelfde beveiligingsfilters als Fable 5.1, omdat het volgens Anthropic in biologie en cyberbeveiliging vergelijkbaar is met Mythos 5.1, de versie van Fable zonder die filters, die Anthropic alleen aan geselecteerde organisaties levert. Gevoelige vragen worden stilletjes overgezet naar een ouder model. Dat slaat soms door: een onderzoeker die Opus 5.5 vroeg kanker te genezen, kreeg het antwoord van het terugvalmodel. Anthropic zegt hieraan te werken.

Twee dingen die tegen de intuïtie ingaan. Hoger is niet beter: op een programmeertest scoorde de op één na hoogste denkstand lager dan Medium, tegen bijna drie keer de prijs. En Anthropic zelf zegt dat "de kloof tussen Opus 5.5 en Fable 5.1 in ons eigen gebruik smaller is dan de scores suggereren", wat je bij een persbericht zelden leest.

En de vertraging?

Dit is de eerste release van beide labs sinds Amodeis oproep, en Anthropic benadrukt dat zelf ook: het model is getest door de onafhankelijke onderzoeksgroepen METR en Frontier Design, haalde het beste resultaat ooit op de eigen gedragstest en deed 85 procent minder pogingen om uit een afgeschermde omgeving te breken dan Opus 5. Wat ons opvalt: geen van beide labs bracht dinsdag een nieuw topmodel uit. Dat past bij de belofte om te vertragen. Tegelijk verslaat een middenklasser die officieel "geen topmodel" is Fable 5.1 op elke test, en kost hij de helft. 

De wedloop is dus verschoven: van wie het slimste model heeft naar wie hetzelfde niveau het goedkoopst levert. Voor jou als gebruiker is dat de prettigste vorm van concurrentie die er bestaat. Of het ook de veiligste is, is een andere vraag: Claude Sonnet 5.5 en Haiku 5.5, de twee kleinere modellen van Anthropic, volgen "in de komende weken", en dan zien we hoe ver dit niveau nog zakt in prijs.

Terwijl de labs om vertraging roepen, zegt OpenAI intern al meer dan honderd wiskundeproblemen te hebben gekraakt

De modellen die je deze week kunt gebruiken, zijn niet de modellen die de labs zelf draaien. Dat verschil werd maandag zichtbaar toen OpenAI meldde dat een intern model, sinds 28 augustus in training, "naast het Navier-Stokes Millennium Prize-probleem nu ook meer dan honderd al lang bestaande open problemen heeft opgelost, verspreid over de meeste gebieden van de wiskunde". Negen dagen eerder had Sam Altman de oproep van Dario Amodei gesteund om langzamer te gaan.

Waar dit op terugslaat

Twee weken geleden schreven we over dat ene probleem: OpenAI claimde een wiskundepuzzel van een miljoen dollar te hebben opgelost, en wiskundige Tristan Buckmaster van New York University stelde dat het model precies zijn route had gevolgd. Dat bewijs is nog altijd niet door de vakgemeenschap beoordeeld. Buckmaster schreef toen dat het grotere verhaal was "wat deze modellen nu kunnen", en dat de gemeenschap "serieus en in alle rust" moest bespreken hoe het verder moet.

Die bespreking heeft nu een adres. OpenAI benaderde een aantal wiskundigen voor een externe adviesraad; zij besloten in overleg met OpenAI een onafhankelijke groep op te richten. De Advisory Group on Mathematics and Artificial Intelligence zetelt bij het Institute for Advanced Study in Princeton, en kondigde zichzelf aan via een gastbijdrage op het blog van Terence Tao, die geldt als een van de beste wiskundigen van deze tijd. Onder de negen leden zitten natuurkundige Edward Witten en Timothy Gowers, allebei winnaars van de Fields-medaille, de hoogste onderscheiding in de wiskunde. Niemand wordt betaald, adviezen worden openbaar gepubliceerd, en de groep biedt dezelfde dienst aan elk ander AI-lab aan.

Wat ze precies gaan doen

De groep formuleert haar eerste opdracht precies: OpenAI adviseren "over het coördineren van de publicatie van een groot aantal significante resultaten in de wiskunde die volgens het bedrijf door zijn interne model zijn geproduceerd". Let op dat ‘volgens het bedrijf’. De wiskundigen hebben de honderd resultaten nog niet gezien, laat staan nagekeken.

De groep gaat over hoe resultaten naar buiten komen, en over de vraag of ze kloppen. Ze gaat uitdrukkelijk niet over het tempo. OpenAI schrijft dat de groep "niet verantwoordelijk is voor advies over de snelheid van onze interne vooruitgang in de wiskunde". Vertaald: wat wij intern bouwen, blijft onze zaak.

Dezelfde dag publiceerde OpenAI een beleidsstuk dat die lijn bevestigt. Het bedrijf wil dat de VS wereldwijde technische standaarden aanjaagt voor AI die zichzelf verbetert, via de bestaande veiligheidsinstituten, met gedeelde meetmethodes en een meldplicht voor incidenten. Maar nadrukkelijk zonder "vergunningen, verplichte beoordeling vooraf of goedkeuringseisen". En vertragen, schrijft OpenAI, "gaat niet om een vooraf bepaalde snelheid": het gaat erom dat veiligheidsonderzoek de capaciteiten voorblijft. Hoe hard dat onderzoek loopt, bepaalt het lab zelf.

Honderd open problemen in drie weken is een claim van een andere orde dan één Millennium-probleem. Als een deel ervan standhoudt, verandert de wiskunde als vak. Bij dat eerste probleem hoorden de wiskundigen het pas na de aankondiging. Deze keer worden ze vooraf gebeld. Dat is winst.

Waarom dit voor jou telt

Toen we vorige week schreven over de oproep om te vertragen, ging het over wat de labs uitbrengen. Dit gaat over wat ze binnenhouden. Opus 5.5 en Sol zijn bewust geen topmodellen; het model dat honderd problemen kraakte is "aanzienlijk krachtiger dan Astra" en zit bij niemand in de app. De race zelf loopt door, achter gesloten deuren, en we zien daarvan wat een lab besluit te vertellen. Deze adviesgroep is de eerste poging om daar een derde partij tussen te zetten. Of dat werkt, weten we als de eerste honderd bewijzen op tafel liggen.

🎯Jouw bedrijf in AI Report?

Bereik ruim 59.000 nieuwsbriefabonnees met interesse in AI. Sponsor onze nieuwsbrief of podcast. Laat je interesse weten.

🔮 Prompt whisperer

Je presentatie in je huisstijl? Stuur een schermafbeelding

Van document naar presentatie in één gesprek, en daarna in de kleuren van je eigen website.

Het document is af. Nu wil je leidinggevende het 'even kort' in het overleg zien. Dus open je PowerPoint, kies je een sjabloon en begin je de tekst over te tikken die je net al had geschreven. Een uur later schuif je nog steeds met tekstvakken.

Vorige keer lieten we zien hoe je in de vernieuwde Claude samen met de AI een document schrijft, zonder plug-in of extra programma. Deze keer maken we er in hetzelfde gesprek een presentatie van. De eerste versie zag er verzorgd uit, maar ook als elke andere presentatie. Toen stuurden we drie schermafbeeldingen van onze website mee. Wat terugkwam, hadden we zelf niet sneller kunnen maken.

Wat leer je vandaag?

  • Hoe je van een bestaand document een presentatie laat maken zonder iets over te tikken.

  • Welke prompt voorkomt dat je slides een voorgelezen document worden.

  • Hoe je de AI je huisstijl laat overnemen.

  • Wat je zelf nog moet nakijken voordat je ermee voor een zaal staat.

  • Hoe je het resultaat naar PowerPoint of pdf krijgt.

Abonneer je om verder te lezen

Het verschil tussen een oké en een briljant AI-antwoord zit in de prompt. Word nog beter in prompten en laat AI écht voor jou werken.

Abonneer nu

Dit zit achter de betaalmuur:

  • Praktische prompt-tips die je meteen kunt gebruiken
  • Uitleg waarom ze werken, zodat je zelf betere prompts leert schrijven
  • Variaties per vakgebied
  • Toegang tot het volledige archief