OpenAI's Astra Lost Decennialang Onopgeloste Wiskundeproblemen Op Terwijl Microsoft Zijn Agent-Trainingsframework Open-Source Maakt

AI News AI Agents Automation LLMs

Introductie

Twee verhalen uit de eerste week van augustus 2026 vertellen een groter verhaal over waar AI naartoe gaat. OpenAI liet een interne versie van zijn volgende model, Astra, los op tien wiskunde- en theoretische-informaticaproblemen die tien jaar of langer onopgelost waren gebleven — en het produceerde machine-verifieerbare bewijzen voor allemaal, voor ongeveer $2.000 aan rekenkracht. Dagen later maakte Microsoft Research Orchard open source, een framework dat het trainen van een competente AI-agent aanzienlijk goedkoper maakt door te scheiden hoe een agent leert van hoe deze uiteindelijk in productie draait. Geen van beide verhalen gaat over een chatbot die een nieuw likje verf krijgt. Beide gaan over de onderliggende kosten- en capaciteitscurve van het bouwen van AI-systemen die redeneren en handelen — en dat is precies wat bepaalt hoe goed, en hoe betaalbaar, de volgende generatie AI-agents wordt.

Abstracte illustratie van een bewijscertificaat en een open agentframework die verbinden met een centrale geautomatiseerde workflowhub

OpenAI’s Astra Lost Tien Problemen Op Waar Wiskundigen Niet Uitkwamen

Op 1 augustus publiceerde OpenAI een opvallende bewering: een interne versie van Astra had nieuwe resultaten geproduceerd voor tien openstaande problemen in de zuivere wiskunde en theoretische informatica, waarvan meerdere al meer dan twee decennia onopgelost waren. Het opvallendste resultaat is een expliciete constructie van een niet-sofische groep — een vraag die openstond sinds Mikhail Gromov in 1999 het concept sofisiteit introduceerde. Astra weerlegde ook Connes’s rigidity conjecture door oneindig veel niet-isomorfe groepen te construeren die dezelfde von Neumann-algebra delen, en bewees Ehrhart’s volume conjecture. De resultaten bestrijken groepentheorie, hoogdimensionale meetkunde, kwantumcomplexiteit, roostercryptografie en extremale combinatoriek — velden die normaal gesproken niet in dezelfde zin voorkomen als een taalmodel.

Wat dit anders maakt dan een typische “AI lost moeilijk probleem op”-kop is de verificatie. OpenAI publiceerde niet zomaar beweringen — het publiceerde machine-verifieerbare Lean 4-bewijscertificaten voor alle tien resultaten op GitHub onder een Apache 2.0-licentie, samen met een technisch manuscript van 249 pagina’s. De “sorry”-telling in de repository staat op nul, wat betekent dat geen enkele stap in de geformaliseerde bewijzen onbewezen of losjes werd afgehandeld. Dat is een betekenisvol andere maatstaf dan een model dat beweert iets te hebben opgelost: een Lean-bewijs klopt type-technisch, of het klopt niet, onafhankelijk van of je het model dat het produceerde vertrouwt. Fields Medal-winnaar Timothy Gowers zou naar verluidt hebben gezegd dat hij zonder aarzelen een van de bewijzen zou aanbevelen voor een topvaktijdschrift — al is het belangrijk om precies te zijn: geen van de tien resultaten heeft daadwerkelijk al een peer review afgerond.

FlowHunt Logo

Klaar om uw bedrijf te laten groeien?

Start vandaag uw gratis proefperiode en zie binnen enkele dagen resultaten.

Waarom een Wiskundige Doorbraak Belangrijk Is voor AI-Agents

Het is verleidelijk om dit weg te zetten als “indrukwekkend, maar irrelevant voor mijn bedrijf.” Dat zou een vergissing zijn. De capaciteit die Astra demonstreerde — aanhoudend, meerstaps formeel redeneren waarbij één verkeerde stap het hele resultaat ongeldig maakt — is structureel dezelfde capaciteit die een AI-agent betrouwbaar maakt bij een lange bedrijfsworkflow. Een agent die een verzekeringsclaim verwerkt, een reeks facturen reconcilieert, of een juridisch document opstelt, doet een kleinere, minder glamoureuze versie van hetzelfde: een lange keten van stappen volgen waarbij een vroege fout doorwerkt — hetzelfde patroon dat je herkent uit elke lijst met praktijkvoorbeelden van AI-agents die voor productiegebruik zijn gebouwd. Modellen die meetbaar beter worden in het herkennen van hun eigen fouten in een wiskundig bewijs van 249 pagina’s, worden doorgaans ook beter in het herkennen van fouten in een automatisering van twaalf stappen. Het wiskunderesultaat is het extreme, verifieerbare randgeval dat laat zien waar het redeneerplafond voor elke volgende agent naartoe gaat.

Zet de Nieuwste Redeneermodellen aan het Werk in Jouw Automatiseringen

Met FlowHunt bouw je meerstaps AI-agents bovenop de nieuwste modellen — geen onderzoeksteam, geen infrastructuur, gewoon werkende automatisering.

Microsoft Maakt Orchard Open Source: Agents Trainen Zonder Frontier-Budget

Als Astra gaat over hoe ver redeneren kan reiken, dan gaat Microsoft’s Orchard-release over hoe goedkoop een competente agent gebouwd kan worden. Orchard is een open-source framework van Microsoft Research dat agenttraining bewust scheidt van agentuitvoering — in plaats van een steeds groter basismodel op een taak los te laten, gebruiken ontwikkelaars Orchard Env, een herbruikbare omgevingsservice, om kleinere agents te trainen binnen realistische taaksimulaties voordat ze ooit een productiesysteem aanraken. Dezelfde infrastructuur ondersteunt softwareontwikkelingsagents, webnavigatie-agents en persoonlijke-assistentagents, en sluit direct aan op echte deploymentharnessen zoals Codex, OpenClaw en ZeroClaw zodra de training is afgerond.

De efficiëntiecijfers zijn het deel waar het de moeite waard is om aandacht aan te besteden, en ze zijn belangrijk om dezelfde reden dat kostenefficiëntievergelijkingen tussen AI-agentframeworks belangrijk zijn wanneer je een stack kiest om op te bouwen. Orchard-SWE, een codeeragent getraind met het framework, scoort 69,7% op SWE-bench Verified — een veelgebruikte benchmark voor praktijkgerichte softwareontwikkelingstaken — oplopend tot 73,0% met value-model reranking, met slechts ongeveer 3 miljard actieve parameters. Dat is een klein fractie van de omvang van de frontier-codeermodellen waarvan het de prestaties benadert. Microsoft’s team bouwde dit door ongeveer 107.000 taaktrajecten te distilleren uit grotere modellen, waarna ze wat ze credit-assignment supervised fine-tuning noemen toepasten — nuttig signaal leren, zelfs uit trajecten die niet volledig succesvol waren — gevolgd door reinforcement learning.

Staafdiagram dat toont dat Orchard-SWE 69,7 procent scoort op SWE-bench Verified, oplopend tot 73,0 procent met value-model reranking, met ongeveer 3 miljard actieve parameters

De Scheiding Tussen Training en Uitvoering Is Wat Voor Jou Zou Moeten Tellen

De architecturale keuze achter Orchard — de vaardigheden van een agent apart trainen van het draaien ervan in productie — weerspiegelt een onderscheid dat belangrijk is voor iedereen die automatisering bouwt, niet alleen voor ML-onderzoekers. Een verticale AI-agent die is gebouwd voor een specifieke branchetaak heeft geen breed groter brein nodig; het heeft gerichte oefening nodig op de smalle reeks beslissingen waar het daadwerkelijk mee te maken krijgt, en dat is precies wat een trainingsomgeving in de stijl van Orchard goedkoper biedt dan het opschalen van een algemeen model. Dezelfde logica geldt of je nu een model vanaf nul traint of een no-code agent configureert: smalle, goed gedefinieerde training op realistische taken verslaat consistent het inzetten van meer algemene capaciteit op een probleem waarvoor het niet gebouwd was.

Dit verklaart ook waarom het open source maken van het framework, in plaats van alleen benchmarkcijfers te publiceren, het meest ingrijpende deel van Microsoft’s release is. Een framework dat iedereen kan gebruiken om intelligente agents te trainen op hun eigen taakomgevingen, versterkt zichzelf — elk team dat het overneemt en verbeteringen deelt, maakt de agent van het volgende team goedkoper om te bouwen, dezelfde dynamiek die ervoor zorgde dat open-source software de infrastructuurstack de afgelopen twee decennia veroverde.

Wat Dit Betekent voor Gartner’s Voorspelling over Bedrijfsagents

Zoom verder uit en beide verhalen versterken een voorspelling die Gartner deed over het tempo van bedrijfsadoptie: dat eind 2026 40% van de bedrijfsapplicaties taakspecifieke AI-agents zal bevatten, tegenover minder dan 5% in 2025. Een achtvoudige sprong in één jaar is een agressieve voorspelling, en resultaten zoals die van Astra en frameworks zoals Orchard zijn precies het soort onderliggende verschuiving in capaciteit en kosten dat nodig zou zijn om dit plausibel te maken — goedkopere training maakt het economisch aantrekkelijk om agents voor smallere taken te bouwen, en beter redeneren maakt die smallere agents betrouwbaarder om daadwerkelijk in te zetten.

Staafdiagram dat Gartner's voorspelling toont dat taakspecifieke AI-agents in bedrijfsapplicaties zullen stijgen van minder dan 5 procent in 2025 naar 40 procent eind 2026

Gartner’s definitie is specifiek en de moeite waard om te onthouden: een taakspecifieke agent is een agent die is gebouwd om een afgebakende, end-to-end taak uit te voeren — hun voorbeeld is een cybersecurity-agent die netwerkverkeer, systeemlogs en gebruikersgedrag in real time scant en zelf een reactie initieert. Dat is een andere maatstaf dan “de app heeft een chatbot.” Het is het verschil tussen een AI-functie en een AI-werknemer, en het is hetzelfde onderscheid dat een generieke assistent scheidt van een echte onderzoeksassistent die is gebouwd om één taak van begin tot eind betrouwbaar af te handelen.

Wat Dit Betekent voor Teams Die Vandaag Automatisering Bouwen

Noch Astra noch Orchard is iets waar de meeste bedrijven direct mee te maken krijgen — je gaat geen model finetunen op Lean-bewijzen of je eigen Orchard-trainingspipeline opzetten. Wat telt is wat doorsijpelt. Verbeteringen in frontier-redeneren verhogen uiteindelijk het plafond van wat elk onderliggend model betrouwbaar kan doen, inclusief de modellen die al no-code automatiseringsplatforms aandrijven. Goedkopere, efficiëntere trainingstechnieken verlagen uiteindelijk de kosten van de gespecialiseerde agents die op die modellen worden gebouwd. Geen van beide verhalen verandert wat je dit kwartaal zou moeten bouwen — maar ze zijn een redelijk betrouwbaar signaal van wat mogelijk, en betaalbaar, wordt in het volgende kwartaal. De praktische zet is niet om het onderzoek achterna te jagen; het is om automatisering te bouwen op een AI-agentplatform dat flexibel genoeg is om de onderliggende modelverbeteringen automatisch op te nemen — hetzelfde instinct dat ertoe deed toen we bespraken hoe Claude Cowork en zijn concurrenten het agentlandschap slechts weken eerder hertekenden.

Kiezen Waar Je Eerst Op Focust

Als je aan het bepalen bent wat je eerst moet automatiseren terwijl de onderliggende modellen onder je blijven verbeteren, zijn de veiligste startpunten taken die smal, goed gedefinieerd en gemakkelijk te verifiëren zijn — dezelfde eigenschappen die Orchard’s trainingsaanpak effectief maakten. Zoekwoordenonderzoek, documentsamenvatting en gestructureerde data-extractie zijn veelvoorkomende startpunten, precies omdat succes makkelijk te controleren is en falen weinig kost. Naarmate redeneren verbetert en training efficiënter wordt, schaalt datzelfde principe op naar ambitieuzere, langer lopende workflows — maar het begint met het kiezen van een taak waarbij je snel en goedkoop kunt vaststellen of de agent het daadwerkelijk goed heeft gedaan.

Conclusie

Augustus 2026 begon met twee releases die op het eerste gezicht niets met elkaar te maken hebben — een model dat decennialang onopgeloste wiskundeproblemen oplost, en een trainingsframework voor codeeragents. Onderliggend gaat het bij beide om dezelfde krachten: hoever redeneren kan worden opgevoerd, en hoe goedkoop dat redeneren kan worden omgezet in een werkende agent. Astra laat zien dat het plafond nog steeds stijgt. Orchard laat zien dat de kosten om een nuttige fractie van dat plafond te bereiken snel dalen. Samen zijn ze een goede reden om te geloven dat Gartner’s agressieve adoptievoorspelling plausibeler is dan hij op het eerste gezicht lijkt — en een goede reden voor elk team dat automatisering bouwt om ervoor te zorgen dat hun tooling flexibel genoeg is om te blijven profiteren terwijl beide trends zich voortzetten.

Veelgestelde vragen

Yasha is een getalenteerde softwareontwikkelaar die gespecialiseerd is in Python, Java en machine learning. Yasha schrijft technische artikelen over AI, prompt engineering en chatbotontwikkeling.

Yasha Boroumand
Yasha Boroumand
CTO, FlowHunt

Zet Frontier AI-Onderzoek Om in Werkende Automatisering

Je hebt geen onderzoekslab nodig om te profiteren van de nieuwste doorbraken in redeneren en agents. Met FlowHunt bouw je productieklare AI-agents bovenop de nieuwste modellen — zonder code.

Meer informatie

Multi-Agent AI-systemen in 2026: Wat het onderzoek werkelijk zegt
Multi-Agent AI-systemen in 2026: Wat het onderzoek werkelijk zegt

Multi-Agent AI-systemen in 2026: Wat het onderzoek werkelijk zegt

Het debat van 2025 over multi-agent AI is voorbij. Anthropic, Cognition en OpenAI zijn allemaal op orchestrator + geïsoleerde subagents uitgekomen. Dit zegt het...

14 min lezen
AI Agents Automation +3
OpenAI
OpenAI

OpenAI

OpenAI is een toonaangevende onderzoeksorganisatie op het gebied van kunstmatige intelligentie, bekend van de ontwikkeling van GPT, DALL-E en ChatGPT, en streef...

3 min lezen
OpenAI AI +4