Overslaan naar inhoud

GPT-6 Astra; is de hype terecht?

Worden professionals al vervangen door AGI?
10 september 2026 in
GPT-6 Astra; is de hype terecht?
Thijmen Goedings

Je hebt net een beetje door hoe je ChatGPT handig inzet, en daar is alweer een nieuw model. GPT-6 Astra dit keer (Bron). Met indrukwekkende cijfers en de belofte dat AI steeds meer werk zelfstandig kan uitvoeren. Moet je daar nu meteen iets mee?

Onze eerste conclusie: Astra is een serieuze ontwikkeling om te volgen en gericht uit te proberen. Vooral als jouw werk uit meerdere stappen bestaat. Maar een hoge testscore vertelt je nog niet of de AI jouw lesmateriaal, klantendossier of beleidsnotitie goed afhandelt. Daarvoor moet je weten wat er precies is getest, onder welke omstandigheden en wat jij onder goed werk verstaat.

In deze blog kijken we naar de cijfers tegenover andere modellen, de redenen voor de hoge verwachtingen en de punten waarop je kritisch moet blijven. Steeds met dezelfde vraag in gedachten: wat betekent dit voor jouw dagelijkse werk?

De cijfers en beschikbaarheidsinformatie in deze blog zijn gecontroleerd op 9 september 2026. Ranglijsten en productvoorwaarden kunnen daarna veranderen.

Waarom er zoveel van wordt verwacht

Werk uit handen geven wordt concreter

Denk aan het voorbereiden van een teamoverleg. Daarvoor moet je misschien notities terugzoeken, openstaande acties verzamelen, cijfers vergelijken en een agenda opstellen. Losse AI-antwoorden helpen daarbij, maar jij bent dan nog degene die alle onderdelen bij elkaar brengt.

De aantrekkelijke belofte van AI die zelfstandig handelt, is dat je een groter stuk van die voorbereiding kunt overdragen. Zo’n systeem noemen we vaak een AI-agent of agentic AI: een model dat hulpmiddelen gebruikt en opeenvolgende handelingen uitvoert om een doel te bereiken. Dat kan via een scherm, maar ook via koppelingen tussen applicaties. Hieronder is een video te zien van een demo waarin OpenAI GPT-6 showcased. 

Juist die opeenvolging maakt de ontwikkeling relevant. Als de eerste stap klopt, maar de informatie in het verkeerde document terechtkomt, heb je nog steeds geen bruikbaar resultaat. De winst moet uiteindelijk zichtbaar zijn in een afgeronde taak waar jij minder herstelwerk aan hebt.


Een opvallende prestatie bij onbekende puzzels

De organisatie ARC Prize test hoe AI onbekende interactieve omgevingen verkent en oplost. Astra haalt op de semi-private test 62,7% in de standaardomgeving en 99,9% met een zogeheten Provider Adapter (Bron). Bij die laatste aanpak blijft meer interne redeneercontext tussen stappen beschikbaar. Het zijn dus verschillende testomstandigheden.

De onderzoekers zagen ook dat Astra op 96% van de levels minder acties nodig had dan de menselijke referentie, hieronder zie je een voorbeeld van een level (bron). Dat gaat over handelingen binnen deze test, niet over algemene superioriteit boven mensen. ARC Prize noemt de vooruitgang betekenisvol, maar stelt expliciet dat het behalen van deze benchmark geen bewijs voor AGI is: kunstmatige algemene intelligentie, die breed nieuwe vaardigheden kan leren.

Je kunt de aantrekkingskracht van dit resultaat goed begrijpen. We willen op het werk graag een assistent die ook iets kan uitzoeken als de situatie niet precies is voorgekauwd. Tegelijkertijd is een afgebakende puzzelwereld veel overzichtelijker dan een organisatie waarin afspraken veranderen en collega’s elkaar soms tegenspreken. De stap tussen die twee verdient minstens zoveel aandacht als het record zelf, en dan hebben we het nog niet eens gehad over de energie efficiëntie van een mens vs computer. 

De verwachting raakt aan herkenbare werkdruk

Een ingewikkelde wiskundescore kan indrukwekkend klinken, maar een correct voorbereid overzicht voor morgenochtend spreekt direct tot de verbeelding. De hoop is dat AI meer van het uitzoekwerk kan doen dat tussen jouw echte inhoudelijke taken in zit.

Voor een docent kan dat het voorbereiden van materiaal op verschillende niveaus zijn. Voor een medewerker bij een gemeente het ordenen van openbare stukken. Voor een bedrijf het verzamelen van informatie voor een klantgesprek. Dit zijn mogelijke toepassingen om te testen, geen vastgestelde Astra-resultaten in Nederlandse organisaties. Het kan allemaal erg handig en indrukwekkend klinken, maar in principe was dit met wat moeite ook al mogelijk vóór het Astra-tijdperk.

Hoe Astra scoort tegenover de concurrentie

Een benchmark is een gestandaardiseerde test. Alle deelnemers krijgen een vastgestelde soort opdrachten, waarna de resultaten worden beoordeeld. Handig om verschillen te ontdekken, zolang je niet vergeet dat de gekozen opdrachten mede bepalen wie bovenaan staat.

De actuele onafhankelijke ranglijst

In Artificial Analysis Intelligence Index v4.3 van 7 september delen Astra en Claude Fable 5.1 de koppositie. Deze index bundelt tien evaluaties. Hieronder staan de gerapporteerde instellingen; het gaat niet automatisch om de standaardstand in jouw chatapp.

Een gedeelde score betekent niet dat twee systemen bij dezelfde opdrachten even goed zijn. Je kunt allebei een gemiddeld rapportcijfer van een acht hebben, terwijl de één beter schrijft en de ander beter rekent. Voor jouw keuze zijn juist die onderliggende verschillen interessant.

Onafhankelijke benchmark

Artificial Analysis Intelligence Index

Intelligence Index v4.3 · hogere score is beter

v4.3
GPT-6 Astra max
53
Claude Fable 5.1 max met fallback
53
Claude Opus 5 max
51
Claude Fable 5 met fallback
50
Muse Spark 1.3 max
48
GPT-5.6 Sol max
47
Let op: indexpunten zijn geen percentages. De scores gelden voor de hierboven genoemde modelinstellingen.

Waarom je ook andere cijfers tegenkomt

Bij de introductie op 3 september rapporteerde Artificial Analysis nog indexversie 4.1.1: Astra scoorde afgerond 61, naast GPT-5.6 Sol en onder Fable 5.1. Op 7 september veranderde de testmix, met onder meer moeilijker terminalwerk en AutomationBench-AA (Bron). 

Dat is geen bewijs dat Astra in vier dagen slimmer werd. Je kijkt naar een andere meetlat. Vergelijk dus nooit de 61 uit de oude index rechtstreeks met de 53 uit de nieuwe index. Dit is ook een praktische tip voor als je een overtuigende grafiek op LinkedIn ziet. Zoek het oorspronkelijke onderzoek op. Soms is de conclusie al achterhaald doordat de ranglijst is vernieuwd. Soms worden twee verschillende tests behandeld alsof het dezelfde wedstrijd is.

Waar zijn Claude en andere alternatieven

Google’s Gemini 3.8 Flash richt zich ook op snelheid en kosten (Bron). Dat maakt een vergelijking alleen op topscores onvolledig. Voor veel korte, herhaalde taken kan een goedkoper model een zinnige kandidaat zijn. Bij een ingewikkelde analyse kan de tijd die jij aan herstelwerk kwijt bent zwaarder wegen. Het juiste antwoord hangt af van jouw taakvolume en kwaliteitsgrens.

Claude Fable 5.1 is de breed beschikbare variant in Anthropic’s nieuwe aanbod; Mythos 5.1 heeft hetzelfde onderliggende model met andere veiligheidsmaatregelen en beperkte toegang (Bron). Een demonstratie met Mythos zegt daarom niet automatisch wat een normale Claude-gebruiker kan verwachten.

Deze blog vergelijkt concrete modellen. Een bestaande werkomgeving zoals Copilot moet je daarnaast beoordelen op de daadwerkelijk gebruikte configuratie, gegevenskoppelingen en functies. Een productnaam op zichzelf is geen voldoende beschrijving van een benchmarkdeelnemer.

Wat je er in jouw werk mee zou kunnen doen

De onderstaande situaties zijn hypothetische use cases. Ze illustreren hoe je de ontwikkeling kunt vertalen naar je eigen praktijk; het zijn geen beloften over wat Astra altijd correct zal uitvoeren. 

In het onderwijs

Een school kan Astra koppelen aan SharePoint, Google Drive en het leermanagementsysteem. De docent vraagt: “Maak voor hoofdstuk 4 een les van 45 minuten.” Astra zoekt de leerdoelen en het gebruikte lesmateriaal op, maakt twee oefeningen met antwoorden en slaat het concept op in de juiste map. Met computer use kan het de oefeningen ook in een afgeschermde versie van de digitale leeromgeving klaarzetten. De docent controleert en publiceert ze.

Bij de overheid

Astra kan via een documentmanagementsysteem en webzoekfunctie een openbaar dossier onderzoeken. Het haalt de relevante stukken op, vergelijkt versies, controleert data en maakt een bronvermelding bij iedere conclusie. Vervolgens schrijft het een intern overzicht en plaatst dat in de aangewezen dossiermap. Publicatie of verzending blijft geblokkeerd totdat een medewerker toestemming geeft.

In een bedrijf

Via een koppeling kan Astra bijvoorbeeld het CRM, e-mail, de agenda en een documentomgeving gebruiken. Voor een klantgesprek haalt het de laatste correspondentie en afspraken op, controleert het welke offerte actueel is en maakt het een gespreksagenda. Daarna zet het een conceptmail en een voorgestelde afspraak klaar. Pas na goedkeuring verstuurt het de mail, maakt het de afspraak aan en werkt het CRM bij.

De kanttekeningen die je niet wilt overslaan

Een hoog scorend model kan nog steeds overtuigend ongelijk hebben

Voor je eigen werk is de vuistregel eenvoudig: vraag om controleerbare onderbouwing. Bij een offertevergelijking wil je kunnen zien uit welke offerte een prijs komt. Bij een samenvatting wil je terug naar de oorspronkelijke passage. Een bronvermelding is pas nuttig als die de bijbehorende bewering daadwerkelijk ondersteunt.

OpenAI rapporteert dat Astra beter binnen veiligheids- en toegangsgrenzen blijft en minder snel ongewenste of schadelijke acties uitvoert. Daar staat een opvallende kanttekening tegenover: volgens de eigen systeemevaluaties is Astra juist minder goed te volgen via zijn interne redeneerspoor dan GPT-5.6 Sol. Het model kan vaker handelen of tot een antwoord komen zonder uitgebreide redeneerstappen vast te leggen, waardoor monitoring op basis van die tussenstappen lastiger wordt (Bron).

Dat betekent niet automatisch dat Astra minder betrouwbaar is. Het laat wel zien dat veiligheid en controleerbaarheid niet hetzelfde zijn. Een systeem kan betere ingebouwde veiligheidsmaatregelen hebben, terwijl het tegelijkertijd moeilijker wordt om precies te reconstrueren waarom het een bepaalde stap heeft gezet. Juist bij taken waarin AI meerdere handelingen zelfstandig uitvoert, is het daarom verstandig om niet alleen naar het eindresultaat te kijken, maar ook naar de gebruikte bronnen, uitgevoerde acties en momenten waarop menselijke goedkeuring nodig is.

Controleer daarnaast de onderdelen waarop een fout gevolgen heeft. Een vlotte schrijfstijl is prettig, maar geen kwaliteitsbewijs. Laat de AI gerust helpen om onzekerheden te vinden; beoordeel vervolgens zelf of die controle voldoende was.

Privacy wordt niet opgelost door een hoger modelnummer

Een betere benchmarkscore beantwoordt niet de vraag of jij bepaalde gegevens mag verwerken. Laat voor zakelijk gebruik controleren welke accountvorm, afspraken, toegang en bewaartermijnen gelden. Bespreek twijfelgevallen met de verantwoordelijke binnen je organisatie.

Een geslaagde demonstratie is nog geen vaste werkroutine

Een demo beantwoordt vooral de vraag of iets mogelijk is. Jij wilt waarschijnlijk weten of het volgende week ook werkt, met een minder overzichtelijk bestand en een uitzondering die niet in het voorbeeld zat.

Laat een belangrijke taak daarom enkele keren uitvoeren met verschillende invoer. Neem ook een geval met ontbrekende informatie op. Kan het systeem daarmee omgaan zonder zekerheid te suggereren die er niet is? En blijf jij begrijpen wat je moet controleren?

Herhaalbaarheid is voor veel organisaties waardevoller dan een spectaculaire uitschieter. Je kunt pas een realistische planning maken als je weet hoeveel begeleiding en herstelwerk doorgaans nodig zijn.

Wat wij je aanraden

Dus... is de hype terecht? De cijfers geven goede redenen om Astra serieus te nemen. De grootste vraag voor jouw organisatie is of je een bruikbare taak verder kunt overdragen, met overzicht over wat er gebeurt. Daar krijg je het beste antwoord op door gericht te oefenen, de grenzen helder te maken en resultaten kritisch te bespreken.

Wat kan je nu direct doen? Geef Astra een concrete opdracht waarvan jij de kwaliteit kunt beoordelen. Kies iets dat werkelijk tijd kost en waar een beter resultaat waarde heeft. Meet vervolgens wat er overblijft aan controle en herstelwerk.

Wil je dat samen met je team leren? In onze workshops vertalen we AI naar opdrachten uit jullie dagelijkse praktijk. We besteden aandacht aan duidelijke instructies, het beoordelen van resultaten en verantwoord gebruik. Zo kun je zelf bepalen welke ontwikkeling relevant is voor jouw werk.

GPT-6 Astra; is de hype terecht?
Thijmen Goedings 10 september 2026
Deel deze post