Greg Brockman sloot de persbriefing over GPT-6 Astra op 3 september af met "welcome to the AGI era". Zakenkrant De Tijd bracht het een dag later, met VUB-professor Vincent Ginis erbij, die zegt dat het in de benchmarktests van de AI-industrie bijna onmogelijk is geworden om nog een opgave te verzinnen die een AI-model niet kan en een mens wel.
Op de lanceringspagina van OpenAI zelf staan er twee.
41,4 procent
AutomationBench meet werkstromen uit sales, marketing, operations, support, finance en HR, uitgevoerd in CRM's, mailboxen en agenda's met data erin. Ofwel zijn de juiste records aangepast en de juiste berichten verstuurd, ofwel niet. Astra haalt er 41,4 procent, tegenover 18,1 voor de vorige generatie. De benchmark komt van het automatiseringsbedrijf Zapier.
OSWorld 2.0 zet een model aan een gewoon bureaublad en laat het 108 werkstromen afwerken waar de helft van de menselijke testers meer dan anderhalf uur over doet. Astra staat er op 72,6 procent. OpenAI zet er in de voetnoot zelf bij: offline set, partial score. Offline set betekent dat de opdrachten zonder internetverbinding draaien, en een deelscore telt hoeveel tussenstappen goed gingen.
Het onderzoeksteam xlang-ai, dat de benchmark bouwde, testte in zijn paper het sterkste model van dat moment. Dat rondde amper 20,6 procent van de opdrachten volledig af, bij een deelscore van 54,8. Voor Astra publiceert OpenAI alleen de deelscore.
Headless
Met 17.900 programma's in CadQuery, een Python-framework, meet BenchCAD hoe goed een model industriële onderdelen in code kan tekenen. Astra haalt er 95,9 procent, tegenover 83,3 voor zijn voorganger. Het model schrijft code en een engine voert ze uit, dus de uitkomst is goed of fout zonder dat er iemand naar kijkt. De auteurs zetten er zelf bij dat hun dekking geen volledige industriële CAD is.
Diezelfde week ging een clip rond waarin Astra een woning nabouwt in het gratis 3D-programma Blender en er een wandelbare scène van maakt in game-engine Unreal Engine 5. Ontwikkelaar Yunfan Ye deed hetzelfde met een huis van de Amerikaanse vastgoedsite Zillow en haalde er ruim vierhonderdduizend weergaven mee. Ye zette zijn prompt erbij, en die begint met "use blender headless". Het model schreef een Python-script tegen de API van Blender en liet dat renderen. Er kwam geen muis aan te pas.
Op ScreenSpot-Pro, dat meet of een model het juiste element op een scherm terugvindt, staat Astra op 92,7 procent tegenover 76,9. De onderzoekers van xlang-ai zagen modellen wel onderweg informatie verliezen en doorklikken op een scherm dat intussen veranderd was. Elk getest model besteedde aan het opsporen en herstellen van eigen fouten samen minder dan zeven procent van zijn budget. In Blender loopt het script of het loopt niet. In een CRM bestaat er geen compiler die u komt vertellen dat het dossier verkeerd is bijgewerkt.
De makkelijke helft
Renderen, rekenen, dataconversie en code schrijven staan op de moeilijke helft van de meeste automatiseringslijsten, en daar haalt Astra 95,9 procent. Op de makkelijke helft staan een offerte opvolgen in het CRM, een nieuwe medewerker in zes systemen aanmaken en een klacht afhandelen tot de klant tevreden is. Op de benchmark die dat werk meet komt hetzelfde model niet boven 41,4. Geen van die drie levert aan het eind een bestand op dat een machine kan valideren.
Sinds 1 januari 2026 moeten alle btw-plichtige Belgische ondernemingen hun B2B-facturen versturen via het Europese factuurnetwerk Peppol, want een pdf volstaat niet meer. Zo'n factuur heeft een vast schema, verplichte velden en een bevestiging van aflevering, dus een agent die daarop werkt kan zelf nagaan of hij een geldig document heeft afgeleverd. De boekhouders die daar vorig jaar op vloekten, hebben er het enige proces aan overgehouden waarvan een machine zelf kan vaststellen dat het af is.
Drie processen
Ginis heeft het over wat een model kan, en AutomationBench meet of het werk af raakt. Astra ging op die benchmark van 18,1 naar 41,4 procent in één generatie, dus dat verschil slinkt. De onafhankelijke benchmarksite Artificial Analysis draaide de 657 opdrachten zelf opnieuw en zag het sterkste model 62,7 procent van de deeldoelstellingen halen, waarbij een overtreding van de veiligheidsregels de hele opdracht op nul zet.
Uw Salesforce heeft dubbele records, half ingevulde velden, drie custom objects die niemand ooit gedocumenteerd heeft en een uitzondering die één iemand kent. Die benchmarks draaien op propere data.
Neem de drie processen die bovenaan uw automatiseringslijst staan. Bestaat er een controle die een machine zelf kan draaien om te zien of het werk correct af is? Een schemavalidatie, een testsuite, een saldo dat moet kloppen, een ontvangstbevestiging.
Vindt u er geen, dan is die controle bouwen het eerste project. Zonder controle krijgt u een medewerker die aan nakijken minder dan zeven procent van zijn tijd besteedt.
