OpenAIs Astra Løser Årtier-gamle Matematikproblemer, mens Microsoft Open Sourcer sit Agent-træningsframework
OpenAIs Astra-model løste netop ti årtier-gamle matematikproblemer med maskinkontrollerbare beviser, og Microsoft open sourcede Orchard, et framework til at træne AI-agenter for en brøkdel af den sædvanlige pris. Her er, hvad begge dele betyder for teams, der bygger automatisering.
AI News
AI Agents
AutomationLLMs
OpenAI
Microsoft
Research
To historier fra den første uge af august 2026 fortæller en større historie om, hvor AI er på vej hen. OpenAI lod en intern version af sin kommende model, Astra, gå løs på ti problemer inden for matematik og teoretisk datalogi, som havde ligget uløste i et årti eller mere — og den producerede maskinkontrollerbare beviser for alle ti, for omkring 2.000 dollars i beregningskraft. Få dage senere open sourcede Microsoft Research Orchard, et framework, der gør det dramatisk billigere at træne en dygtig AI-agent ved at adskille, hvordan en agent lærer, fra hvordan den til sidst kører i produktion. Ingen af historierne handler om, at en chatbot får en ny finish. Begge handler om den underliggende omkostnings- og kapabilitetskurve for at bygge AI-systemer, der ræsonnerer og handler — hvilket er præcis dét, der afgør, hvor gode og hvor overkommelige den næste generation af AI-agenter bliver.
OpenAIs Astra Løser Ti Problemer, Matematikere Ikke Kunne Knække
Den 1. august publicerede OpenAI en opsigtsvækkende påstand: en intern version af Astra havde produceret nye resultater for ti åbne problemer inden for ren matematik og teoretisk datalogi, hvoraf flere havde været uløste i mere end to årtier. Hovedresultatet er en eksplicit konstruktion af en ikke-sofisk gruppe — et spørgsmål, der har stået åbent, siden Mikhail Gromov introducerede begrebet soficitet i 1999. Astra modbeviste også Connes’s rigiditetsformodning ved at konstruere uendeligt mange ikke-isomorfe grupper, der deler den samme von Neumann-algebra, og den beviste Ehrharts volumenformodning. Resultaterne spænder over gruppeteori, højdimensional geometri, kvantekompleksitet, gitterkryptografi og ekstremal kombinatorik — felter, der normalt ikke optræder i samme sætning som en sprogmodel.
Det, der adskiller dette fra en typisk “AI løser svært problem”-overskrift, er verifikation. OpenAI publicerede ikke blot påstande — virksomheden publicerede maskinkontrollerbare Lean 4-bevis-certifikater for alle ti resultater på GitHub under en Apache 2.0-licens, sammen med et 249 sider langt teknisk manuskript. Repositoriets “sorry”-antal ligger på nul, hvilket betyder, at intet trin i nogen af de formaliserede beviser blev efterladt ubevist eller overladt til antagelser. Det er en meningsfuldt anderledes standard end en model, der blot hævder at have løst noget: et Lean-bevis enten type-checker eller gør det ikke, uafhængigt af om man stoler på den model, der producerede det. Fields-medaljevinder Timothy Gowers har angiveligt sagt, at han uden tøven ville anbefale et af beviserne til et førende tidsskrift — selvom det er værd at være præcis om, at ingen af de ti resultater faktisk er blevet fagfællebedømt endnu.
Klar til at vokse din virksomhed?
Start din gratis prøveperiode i dag og se resultater inden for få dage.
Hvorfor et Matematisk Gennembrud Betyder Noget for AI-agenter
Det er fristende at lægge dette i skuffen “imponerende, men irrelevant for min virksomhed.” Det ville være en fejl. Den evne, Astra demonstrerede — vedvarende, flertrins formel ræsonnement, hvor ét forkert trin ugyldiggør hele resultatet — er strukturelt den samme evne, der gør en AI-agent pålidelig i en lang forretningsarbejdsgang. En agent, der behandler en forsikringsskade, afstemmer et sæt fakturaer eller udarbejder et juridisk dokument, udfører en mindre, mindre glamourøs version af det samme: at følge en lang kæde af trin, hvor en tidlig fejl forplanter sig — det samme mønster, du vil genkende fra enhver liste over virkelighedsnære AI-agent-eksempler bygget til produktionsbrug. Modeller, der bliver målbart bedre til at fange deres egne fejl i et 249 sider langt matematisk bevis, har en tendens til også at blive bedre til at fange fejl i en automatisering med tolv trin. Matematikresultatet er det ekstreme, verificerbare grænsetilfælde, der forudviser, hvor ræsonnementsloftet er på vej hen for enhver agent, der bygges nedstrøms.
Sæt de Nyeste Ræsonnementmodeller i Arbejde i Dine Automatiseringer
Microsoft Open Sourcer Orchard: Træning af Agenter Uden et Frontier-budget
Hvis Astra handler om, hvor langt ræsonnement kan nå, handler Microsofts Orchard-udgivelse om, hvor billigt en dygtig agent kan bygges. Orchard er et open source-framework fra Microsoft Research, der bevidst adskiller agent-træning fra agentudførelse — i stedet for at kaste en stadig større basismodel efter en opgave bruger udviklere Orchard Env, en genanvendelig miljøtjeneste, til at træne mindre agenter inde i realistiske opgavesimuleringer, før de nogensinde rører et produktionssystem. Den samme infrastruktur understøtter softwareudviklings-agenter, webnavigations-agenter og personlig assistance-agenter, og den kobler sig direkte til reelle deployment-harnesses som Codex, OpenClaw og ZeroClaw, når træningen er afsluttet.
Effektivitetstallene er den del, det er værd at hæfte sig ved, og de betyder noget af samme grund, som omkostningseffektivitets-sammenligninger på tværs af AI-agent-frameworks betyder noget, når du skal vælge en stack at bygge på. Orchard-SWE, en kodeagent trænet med frameworket, scorer 69,7% på SWE-bench Verified — en udbredt benchmark for virkelighedsnære softwareudviklingsopgaver — stigende til 73,0% med value-model-reranking, ved brug af blot omkring 3 milliarder aktive parametre. Det er en lille brøkdel af størrelsen på de frontier-kodemodeller, den nærmer sig i ydelse. Microsofts team byggede dette ved at destillere omkring 107.000 opgave-trajektorier fra større modeller og derefter anvende det, de kalder credit-assignment supervised fine-tuning — at lære nyttigt signal selv fra trajektorier, der ikke var fuldt succesfulde — efterfulgt af reinforcement learning.
Tilmeld dig vores nyhedsbrev
Få de seneste tips, trends og tilbud gratis.
Adskillelsen af Træning og Udførelse Er det, Der Bør Betyde Noget for Dig
Det arkitektoniske valg bag Orchard — at træne en agents færdigheder adskilt fra at køre den i produktion — spejler et skel, der betyder noget for alle, der bygger automatisering, ikke kun ML-forskere. En vertikal AI-agent bygget til en specifik brancheopgave har ikke brug for en større hjerne på alle fronter; den har brug for fokuseret træning på den smalle skive af beslutninger, den rent faktisk vil møde — hvilket er præcis, hvad et Orchard-lignende træningsmiljø leverer billigere end at skalere en generel model op. Den samme logik gælder, uanset om du træner en model fra bunden eller konfigurerer en no-code-agent: smal, veldefineret træning på realistiske opgaver slår konsekvent det at kaste mere generel kapabilitet efter et problem, den ikke var bygget til at løse.
Dette forklarer også, hvorfor det at open source frameworket, frem for blot at publicere benchmark-tal, er den mere betydningsfulde del af Microsofts udgivelse. Et framework, som alle kan bruge til at træne intelligente agenter på deres egne opgavemiljøer, har en sammensat effekt — hvert team, der tager det i brug og deler forbedringer, gør det billigere for det næste team at bygge deres agent, den samme dynamik, der fik open source-software til at æde infrastruktur-stacken i løbet af de sidste to årtier.
Hvad Dette Betyder for Gartners Virksomhedsagent-prognose
Zoomer man længere ud, understøtter begge historier en prognose, Gartner har lavet om tempoet i virksomheders AI-adoption: at 40% af virksomhedsapplikationer ved udgangen af 2026 vil indeholde opgavespecifikke AI-agenter, op fra under 5% i 2025. En ottedobling på et enkelt år er en aggressiv prognose, og resultater som Astras og frameworks som Orchard er præcis den slags underliggende skift i kapabilitet og omkostning, der skulle ske, for at det bliver plausibelt — billigere træning gør det økonomisk at bygge agenter til smallere opgaver, og bedre ræsonnement gør de smallere agenter mere troværdige at rent faktisk sætte i drift.
Gartners definition er specifik og værd at holde fast i: en opgavespecifik agent er bygget til at håndtere et defineret, ende-til-ende job — deres eksempel er en cybersikkerhedsagent, der scanner netværkstrafik, systemlogfiler og brugeradfærd i realtid og selv igangsætter en reaktion. Det er en anden standard end “appen har en chatbot.” Det er forskellen på en AI-funktion og en AI-medarbejder, og det er den samme forskel, der adskiller en generisk assistent fra en ordentlig researchassistent bygget til pålideligt at håndtere ét job fra start til slut.
Hvad Dette Betyder for Teams, der Bygger Automatisering i Dag
Hverken Astra eller Orchard er noget, de fleste virksomheder kommer til at røre direkte — du skal ikke finjustere en model på Lean-beviser eller sætte din egen Orchard-træningspipeline op. Det, der betyder noget, er det, der siver ned. Banebrydende ræsonnementforbedringer hæver på sigt loftet for, hvad enhver nedstrøms-model pålideligt kan gøre, inklusive dem, der allerede driver no-code-automatiseringsplatforme. Billigere, mere effektive træningsteknikker sænker på sigt omkostningen ved de specialiserede agenter, der bygges oven på disse modeller. Ingen af historierne ændrer, hvad du bør bygge i dette kvartal — men de er et rimeligt pålideligt signal om, hvad der bliver muligt og overkommeligt i det næste. Det praktiske træk er ikke at jagte forskningen; det er at bygge automatisering på en AI-agent-platform, der er fleksibel nok til automatisk at optage de underliggende modelforbedringer — den samme instinkt, der gjorde sig gældende, da vi dækkede, hvordan Claude Cowork og dets konkurrenter omformede agent-landskabet blot uger tidligere.
Valg af, Hvor du Skal Fokusere Først
Hvis du skal beslutte, hvad du automatiserer først, mens de underliggende modeller fortsætter med at forbedre sig under dig, er de sikreste udgangspunkter opgaver, der er smalle, veldefinerede og nemme at verificere — de samme egenskaber, der gjorde Orchards træningstilgang effektiv. Keyword research, dokumentopsummering og struktureret dataudtræk er almindelige udgangspunkter, netop fordi succes er nem at kontrollere, og fejl er billige. Efterhånden som ræsonnementet forbedres, og træningen bliver mere effektiv, skalerer det samme princip op til mere ambitiøse, længerevarende arbejdsgange — men det starter med at vælge en opgave, hvor du hurtigt og billigt kan afgøre, om agenten rent faktisk fik ret.
Konklusion
August 2026 begyndte med to udgivelser, der på overfladen intet har med hinanden at gøre — en model, der løser årtier-gamle matematikproblemer, og et træningsframework til kodeagenter. Under overfladen handler begge om de samme kræfter: hvor langt ræsonnement kan presses, og hvor billigt dét ræsonnement kan omsættes til en fungerende agent. Astra viser, at loftet stadig stiger. Orchard viser, at omkostningen ved at nå en nyttig del af det loft falder hurtigt. Sammen er de en god grund til at tro, at Gartners aggressive adoptionsprognose er mere plausibel, end den ser ud ved første øjekast — og en god grund for ethvert team, der bygger automatisering, til at sikre, at deres værktøjer er fleksible nok til at blive ved med at drage fordel, mens begge tendenser fortsætter.
Ofte stillede spørgsmål
En intern version af Astra, OpenAIs kommende modelfamilie, producerede nye resultater for ti problemer inden for matematik og teoretisk datalogi, som havde stået åbne i mindst et årti, og som spænder over gruppeteori, von Neumann-algebraer, højdimensional geometri, kvantekompleksitet, gitterkryptografi og ekstremal kombinatorik. Hovedresultatet er en eksplicit konstruktion af en ikke-sofisk gruppe, et spørgsmål der har stået åbent siden 1999, samt en modbevisning af Connes's rigiditetsformodning. OpenAI publicerede maskinkontrollerbare Lean 4-beviser for alle ti resultater sammen med et 249 sider langt teknisk manuskript.
Nej. Ingen af de ti resultater har endnu været gennem formel fagfællebedømmelse. Beviserne er dog publiceret som maskinkontrollerbare Lean 4-certifikater på GitHub med et 'sorry'-antal på nul, hvilket betyder, at intet trin i noget formaliseret bevis er efterladt ubevist — en form for verifikation, der ikke kræver en menneskelig bedømmer for at bekræfte den logiske korrekthed, selv før tidsskriftsbedømmelsen finder sted.
Orchard er et open source-framework fra Microsoft Research, der adskiller AI-agent-træning fra agentudførelse og giver udviklere en genanvendelig miljøtjeneste til at træne og evaluere agenter på tværs af opgavedomæner som softwareudvikling, webnavigation og personlig assistance, før de bliver sat i drift. Det er designet til at gøre det billigere at bygge dygtige agenter ved at lade mindre modeller lære af realistiske opgavemiljøer i stedet for at kræve stadig større basismodeller.
Orchard-SWE, en kodeagent trænet med Orchard-frameworket, scorer 69,7% på SWE-bench Verified (stigende til 73,0% med value-model-reranking) ved brug af blot omkring 3 milliarder aktive parametre — hvilket nærmer sig ydelsen af frontier-kodemodeller, der bruger mere end ti gange så mange parametre. Denne effektivitet betyder noget, fordi den sænker beregningsomkostningen ved at træne og køre en dygtig kodeagent.
Gartner forudser, at 40% af virksomhedsapplikationer ved udgangen af 2026 vil indeholde opgavespecifikke AI-agenter, op fra under 5% i 2025. En opgavespecifik agent er bygget til at håndtere et defineret, ende-til-ende job — som fx en cybersikkerhedsagent, der overvåger netværkstrafik og igangsætter en reaktion — frem for en generel assistent. Prognosen afspejler, at agenter bliver en standardfunktion i eksisterende forretningssoftware, ikke blot selvstændige produkter.
Ikke direkte — Astras matematiske resultater demonstrerer forbedret formel ræsonnementsevne, hvilket er en anden egenskab end at udføre flertrins-forretningsarbejdsgange. Men de underliggende ræsonnementsforbedringer, der gør det muligt for en model at konstruere et stringent matematisk bevis, har tendens til også at forbedre en agents evne til at planlægge, kontrollere sit eget arbejde og opdage fejl i strukturerede flertrinsopgaver, hvilket er direkte relevant for automatiseringens pålidelighed.
Træning foregår i et kontrolleret miljø, hvor en agent øver sig gentagne gange på en opgave og bliver rettet — det er dét, frameworks som Orchard fokuserer på. Deployment (eller udførelse) er at køre den trænede agent mod virkelige, aktive opgaver i produktion, ofte gennem en harness som Codex eller en no-code-platform. At adskille de to, sådan som Orchard gør, betyder, at et team kan forbedre eller genoptræne en agents færdigheder uden at skulle røre ved eller risikere det produktionssystem, agenten i sidste ende kører i.
Banebrydende forskning som Astra og Orchard siver ned i de basismodeller og teknikker, som no-code-platforme bygger oven på — man behøver ikke selv genskabe den. Platforme som FlowHunt lader teams sammensætte produktionsklare AI-agenter af færdigbyggede blokke og forbinde dem til reelle datakilder og værktøjer, så fordelene ved bedre ræsonnement og mere effektiv træning viser sig som bedre agentydelse, uden at det kræver et internt ML-team.
Yasha er en talentfuld softwareudvikler med speciale i Python, Java og maskinlæring. Yasha skriver tekniske artikler om AI, prompt engineering og udvikling af chatbots.
Yasha Boroumand
CTO, FlowHunt
Omsæt Banebrydende AI-forskning til Fungerende Automatisering
Du behøver ikke et forskningslaboratorium for at drage fordel af de nyeste gennembrud inden for ræsonnement og agenter. FlowHunt lader dig bygge produktionsklare AI-agenter oven på de nyeste modeller — uden kode.
Hvorfor OpenAI ikke kan retfærdiggøre sin værdiansættelse på 500 milliarder dollars – og hvordan Anthropic vinder det eneste AI-marked, der betyder noget
OpenAIs værdiansættelse på 500 milliarder dollars er under pres, efterhånden som kommoditiserede AI-modeller og open source-alternativer udligner spillereglerne...
Open-Source vs Proprietary AI Agent Builders: Omkostnings- og Fordelsanalyse 2025
En omfattende analyse af open-source og proprietære AI agent builders i 2025, hvor omkostninger, fleksibilitet, ydeevne og ROI undersøges for at hjælpe organisa...
OpenAI er en førende forskningsorganisation inden for kunstig intelligens, kendt for at udvikle GPT, DALL-E og ChatGPT, og har som mål at skabe sikker og gavnli...
3 min læsning
OpenAI
AI
+4
Cookie Samtykke Vi bruger cookies til at forbedre din browsingoplevelse og analysere vores trafik. See our privacy policy.