OpenAIs Astra löser decennielånga matematikproblem medan Microsoft öppen källkod-licensierar sitt ramverk för agentträning
OpenAIs Astra-modell löste nyss tio decennielånga matematikproblem med maskinverifierbara bevis, och Microsoft öppen källkod-licensierade Orchard, ett ramverk för att träna AI-agenter till en bråkdel av den vanliga kostnaden. Så här påverkar båda nyheterna team som bygger automatisering.
AI News
AI Agents
AutomationLLMs
OpenAI
Microsoft
Research
Två nyheter från den första veckan i augusti 2026 berättar en större historia om vart AI är på väg. OpenAI släppte en intern version av sin nästa modell, Astra, lös på tio problem inom matematik och teoretisk datavetenskap som hade förblivit olösta i ett decennium eller mer — och den producerade maskinverifierbara bevis för samtliga, för ungefär 2 000 dollar i beräkningskraft. Några dagar senare öppen källkod-licensierade Microsoft Research Orchard, ett ramverk som gör det dramatiskt billigare att träna en kompetent AI-agent genom att separera hur en agent lär sig från hur den så småningom körs i produktion. Ingen av nyheterna handlar om att en chatbot fått en ny ytlig finish. Båda handlar om den underliggande kostnads- och förmågekurvan för att bygga AI-system som resonerar och agerar — vilket är precis det som avgör hur bra, och hur prisvärd, nästa generations AI-agenter blir.
OpenAIs Astra löser tio problem som matematiker inte kunde knäcka
Den 1 augusti publicerade OpenAI ett slående påstående: en intern version av Astra hade producerat nya resultat för tio öppna problem inom ren matematik och teoretisk datavetenskap, flera av dem olösta i mer än två decennier. Huvudresultatet är en explicit konstruktion av en icke-sofisk grupp — en fråga som stått öppen sedan Mikhail Gromov introducerade begreppet sofisitet 1999. Astra motbevisade även Connes’s rigiditetsförmodan genom att konstruera oändligt många icke-isomorfa grupper som delar samma von Neumann-algebra, och den bevisade Ehrharts volymförmodan. Resultaten spänner över gruppteori, högdimensionell geometri, kvantkomplexitet, gitterkryptografi och extremal kombinatorik — områden som vanligtvis inte dyker upp i samma mening som en språkmodell.
Det som skiljer detta från en typisk rubrik om att “AI löser svårt problem” är verifieringen. OpenAI publicerade inte bara påståenden — man publicerade maskinverifierbara Lean 4-bevisintyg för alla tio resultat på GitHub under en Apache 2.0-licens, tillsammans med ett tekniskt manuskript på 249 sidor. Repositoriets “sorry”-räknare ligger på noll, vilket betyder att inget steg i något av de formaliserade bevisen lämnades obevisat eller handviftat. Det är en meningsfullt annorlunda måttstock än att en modell bara hävdar att den löst något: ett Lean-bevis antingen typkontrolleras eller inte, oberoende av om man litar på modellen som producerade det. Fields-medaljören Timothy Gowers ska enligt uppgift ha sagt att han utan tvekan skulle rekommendera ett av bevisen till en toppublikation — även om det är värt att påpeka att inget av de tio resultaten faktiskt har genomgått peer review än.
Redo att växa ditt företag?
Starta din kostnadsfria provperiod idag och se resultat inom några dagar.
Varför ett matematiskt genombrott spelar roll för AI-agenter
Det är frestande att lägga detta i facket “imponerande men irrelevant för min verksamhet.” Det vore ett misstag. Förmågan Astra demonstrerade — uthålligt, flerstegs formellt resonemang där ett enda felaktigt steg ogiltigförklarar hela resultatet — är strukturellt samma förmåga som gör en AI-agent pålitlig i ett långt affärsarbetsflöde. En agent som behandlar ett försäkringsärende, stämmer av en uppsättning fakturor eller utarbetar ett juridiskt dokument gör en mindre, mindre glamorös version av samma sak: att följa en lång kedja av steg där ett tidigt misstag förstärks — samma mönster du känner igen från vilken lista som helst med verkliga AI-agentexempel byggda för produktionsanvändning. Modeller som blir mätbart bättre på att upptäcka sina egna fel i ett 249-sidigt matematikbevis tenderar också att bli bättre på att upptäcka fel i en tolvstegsautomatisering. Matematikresultatet är det extrema, verifierbara gränsfallet som förhandsvisar vart resonemangstaket för varje underliggande agent är på väg.
Sätt de senaste resonemangsmodellerna i arbete i dina automatiseringar
Microsoft öppen källkod-licensierar Orchard: att träna agenter utan en frontier-budget
Om Astra handlar om hur långt resonemang kan drivas, handlar Microsofts Orchard-lansering om hur billigt en kompetent agent kan byggas. Orchard är ett ramverk med öppen källkod från Microsoft Research som medvetet separerar agentträning från agentexekvering — istället för att kasta en allt större basmodell på en uppgift använder utvecklare Orchard Env, en återanvändbar miljötjänst, för att träna mindre agenter inom realistiska uppgiftssimuleringar innan de någonsin rör en produktionsmiljö. Samma infrastruktur stödjer mjukvaruutvecklingsagenter, webbnavigeringsagenter och personliga assistentagenter, och den kopplas direkt in i verkliga driftsättningsmiljöer som Codex, OpenClaw och ZeroClaw när träningen är klar.
Effektivitetssiffrorna är det som är värt att uppmärksamma, och de spelar roll av samma anledning som kostnadseffektivitetsjämförelser mellan olika AI-agentramverk spelar roll när du väljer en stack att bygga på. Orchard-SWE, en kodningsagent tränad med ramverket, får 69,7 % på SWE-bench Verified — ett flitigt använt riktmärke för verkliga mjukvaruutvecklingsuppgifter — vilket stiger till 73,0 % med värdemodell-omrankning, med hjälp av endast omkring 3 miljarder aktiva parametrar. Det är en liten bråkdel av storleken på de frontier-kodningsmodeller den närmar sig i prestanda. Microsofts team byggde detta genom att destillera cirka 107 000 uppgiftsförlopp från större modeller, och sedan tillämpa det de kallar credit-assignment supervised fine-tuning — att lära sig användbara signaler även från förlopp som inte fullt ut lyckades — följt av förstärkningsinlärning.
Gå med i vårt nyhetsbrev
Få de senaste tipsen, trenderna och erbjudandena gratis.
Separationen mellan träning och exekvering är det som borde spela roll för dig
Det arkitektoniska valet bakom Orchard — att träna en agents färdigheter separat från att köra den i produktion — speglar en distinktion som spelar roll för alla som bygger automatisering, inte bara ML-forskare. En vertikal AI-agent byggd för en specifik branschuppgift behöver inte en större hjärna rakt över hela linjen; den behöver fokuserad övning på den smala skiva av beslut den faktiskt kommer att möta, vilket är precis vad en Orchard-liknande träningsmiljö tillhandahåller billigare än att skala upp en generell modell. Samma logik gäller oavsett om du tränar en modell från grunden eller konfigurerar en no-code-agent: smal, väldefinierad träning på realistiska uppgifter slår konsekvent att kasta mer generell förmåga på ett problem den inte byggdes för att lösa.
Det här förklarar också varför det är den mer betydelsefulla delen av Microsofts lansering att öppen källkod-licensiera ramverket, snarare än att bara publicera riktmärkessiffror. Ett ramverk som vem som helst kan använda för att träna intelligenta agenter på sina egna uppgiftsmiljöer skapar sammansatt värde — varje team som tar det i bruk och delar förbättringar gör nästa teams agent billigare att bygga, samma dynamik som fick öppen källkods-mjukvara att äta upp infrastrukturstacken under de senaste två decennierna.
Vad detta betyder för Gartners prognos för agenter i företag
Zoomar man ut ytterligare förstärker båda nyheterna en prognos som Gartner gjort om takten i företagens adoption: att i slutet av 2026 kommer 40 % av företagsapplikationerna att inbädda uppgiftsspecifika AI-agenter, upp från under 5 % 2025. En åttadubbling på ett enda år är en aggressiv prognos, och resultat som Astras och ramverk som Orchard är exakt den typ av underliggande förmåge- och kostnadsförskjutning som skulle behöva ske för att den ska vara trolig — billigare träning gör det ekonomiskt att bygga agenter för smalare uppgifter, och bättre resonemang gör dessa smalare agenter mer pålitliga att faktiskt driftsätta.
Gartners definition är specifik och värd att hålla fast vid: en uppgiftsspecifik agent är en som byggts för att hantera ett definierat jobb från början till slut — deras exempel är en cybersäkerhetsagent som skannar nätverkstrafik, systemloggar och användarbeteende i realtid och initierar sitt eget svar. Det är en annan måttstock än “appen har en chatbot.” Det är skillnaden mellan en AI-funktion och en AI-arbetare, och det är samma distinktion som skiljer en generisk assistent från en riktig forskningsassistent byggd för att hantera ett jobb pålitligt från start till mål.
Vad detta betyder för team som bygger automatisering idag
Varken Astra eller Orchard är något de flesta företag kommer att röra direkt — du kommer inte att finjustera en modell på Lean-bevis eller sätta upp din egen Orchard-träningspipeline. Det som spelar roll är vad som sipprar ner. Frontier-förbättringar inom resonemang höjer så småningom taket för vad varje underliggande modell pålitligt kan göra, inklusive de som redan driver no-code-automatiseringsplattformar. Billigare, mer effektiva träningstekniker sänker så småningom kostnaden för de specialiserade agenter som byggs ovanpå dessa modeller. Ingen av dessa nyheter ändrar vad du bör bygga det här kvartalet — men de är en rimligt pålitlig signal om vad som kommer vara möjligt, och prisvärt, nästa kvartal. Det praktiska draget är inte att jaga forskningen; det är att bygga automatisering på en AI-agentplattform tillräckligt flexibel för att automatiskt absorbera de underliggande modellförbättringarna, samma instinkt som spelade roll när vi tog upp hur Claude Cowork och dess konkurrenter omformade agentlandskapet bara veckor tidigare.
Att välja var du ska fokusera först
Om du bestämmer vad du ska automatisera först medan de underliggande modellerna fortsätter förbättras under dig, är de säkraste utgångspunkterna uppgifter som är smala, väldefinierade och lätta att verifiera — samma egenskaper som gjorde Orchards träningsmetod effektiv. Sökordsresearch, dokumentsammanfattning och strukturerad datautvinning är vanliga utgångspunkter just för att framgång är lätt att kontrollera och misslyckande är billigt. I takt med att resonemang förbättras och träning blir mer effektiv skalar samma princip upp till mer ambitiösa, längre arbetsflöden — men det börjar med att välja en uppgift där du snabbt och billigt kan avgöra om agenten faktiskt gjorde rätt.
Slutsats
Augusti 2026 inleddes med två lanseringar som, på ytan, inte har något med varandra att göra — en modell som löser decennielånga matematikproblem, och ett träningsramverk för kodningsagenter. Under ytan handlar båda om samma krafter: hur långt resonemang kan drivas, och hur billigt det resonemanget kan omvandlas till en fungerande agent. Astra visar att taket fortfarande stiger. Orchard visar att kostnaden för att nå en användbar bråkdel av det taket sjunker snabbt. Tillsammans är de en god anledning att tro att Gartners aggressiva adoptionsprognos är mer trolig än den ser ut vid första anblicken — och en god anledning för alla team som bygger automatisering att se till att deras verktyg är tillräckligt flexibla för att fortsätta dra nytta när båda trenderna fortsätter.
Vanliga frågor
En intern version av Astra, OpenAIs nästa modellfamilj, producerade nya resultat för tio problem inom matematik och teoretisk datavetenskap som varit öppna i minst ett decennium, inom områden som gruppteori, von Neumann-algebror, högdimensionell geometri, kvantkomplexitet, gitterkryptografi och extremal kombinatorik. Huvudresultatet är en explicit konstruktion av en icke-sofisk grupp, en fråga som stått öppen sedan 1999, samt en motbevisning av Connes's rigiditetsförmodan. OpenAI publicerade maskinverifierbara Lean 4-bevis för samtliga tio resultat tillsammans med ett tekniskt manuskript på 249 sidor.
Nej. Inget av de tio resultaten har ännu genomgått formell peer review. Bevisen är dock publicerade som maskinverifierbara Lean 4-certifikat på GitHub med ett 'sorry'-antal på noll, vilket betyder att inget steg i något formaliserat bevis lämnades obevisat — en form av verifiering som inte kräver en mänsklig granskare för att bekräfta logisk korrekthet, även innan tidskriftsgranskning sker.
Orchard är ett ramverk med öppen källkod från Microsoft Research som separerar träning av AI-agenter från agentexekvering, och ger utvecklare en återanvändbar miljötjänst för att träna och utvärdera agenter inom uppgiftsdomäner som mjukvaruutveckling, webbnavigering och personlig assistans innan de driftsätts. Det är utformat för att göra kapabla agenter billigare att bygga genom att låta mindre modeller lära sig av realistiska uppgiftsmiljöer istället för att kräva allt större basmodeller.
Orchard-SWE, en kodningsagent tränad med Orchard-ramverket, får 69,7 % på SWE-bench Verified (stigande till 73,0 % med värdemodell-omrankning) med hjälp av endast omkring 3 miljarder aktiva parametrar — vilket närmar sig prestandan hos frontier-kodningsmodeller som använder mer än tio gånger så många parametrar. Den effektiviteten spelar roll eftersom den sänker beräkningskostnaden för att träna och köra en kapabel kodningsagent.
Gartner förutspår att 40 % av företagsapplikationerna kommer att inbädda uppgiftsspecifika AI-agenter i slutet av 2026, upp från under 5 % 2025. En uppgiftsspecifik agent är en som byggts för att hantera ett definierat jobb från början till slut — som en cybersäkerhetsagent som övervakar nätverkstrafik och initierar ett svar — snarare än en generell assistent. Prognosen speglar att agenter blir en standardfunktion inuti befintlig affärsmjukvara, inte bara fristående produkter.
Inte direkt — Astras matematikresultat visar förbättrat formellt resonemang, vilket är en annan förmåga än att utföra flerstegs affärsarbetsflöden. Men de underliggande resonemangsförbättringarna som gör att en modell kan konstruera ett rigoröst matematiskt bevis tenderar också att förbättra en agents förmåga att planera, verifiera sitt eget arbete och upptäcka fel i strukturerade flerstegsuppgifter, vilket är direkt relevant för automatiseringens tillförlitlighet.
Träning sker i en kontrollerad miljö där en agent övar en uppgift upprepade gånger och blir rättad — det är detta ramverk som Orchard fokuserar på. Driftsättning (eller exekvering) innebär att köra den tränade agenten mot verkliga, levande uppgifter i produktion, ofta genom en miljö som Codex eller en no-code-plattform. Att separera de två, vilket Orchard gör, innebär att ett team kan förbättra eller omträna en agents färdigheter utan att behöva röra eller riskera det produktionssystem den så småningom körs i.
Frontier-forskning som Astra och Orchard sipprar ner i de basmodeller och tekniker som no-code-plattformar bygger ovanpå — du behöver inte återskapa den själv. Plattformar som FlowHunt låter team sätta samman produktionsklara AI-agenter av färdiga byggblock och koppla dem till verkliga datakällor och verktyg, så att fördelarna med bättre resonemang och effektivare träning visar sig som bättre agentprestanda utan att kräva ett internt ML-team.
Yasha är en skicklig mjukvaruutvecklare som specialiserar sig på Python, Java och maskininlärning. Yasha skriver tekniska artiklar om AI, prompt engineering och utveckling av chattbotar.
Yasha Boroumand
CTO, FlowHunt
Omvandla frontier-AI-forskning till fungerande automatisering
Du behöver inte ett forskningslabb för att dra nytta av de senaste genombrotten inom resonemang och agenter. Med FlowHunt kan du bygga produktionsklara AI-agenter ovanpå de nyaste modellerna — helt utan kod.
Varför OpenAI inte kan motivera sin värdering på 500 miljarder dollar – och hur Anthropic vinner den enda AI-marknad som räknas
OpenAIs värdering på 500 miljarder dollar granskas när kommersialiserade AI-modeller och open source-alternativ jämnar ut spelplanen. Upptäck varför Anthropics ...
OpenAI är en ledande forskningsorganisation inom artificiell intelligens, känd för att ha utvecklat GPT, DALL-E och ChatGPT, och strävar efter att skapa säker o...
Varför förstärkningsinlärning vann: AI-modellernas finjustering och historien om OpenPipe
Utforska hur förstärkningsinlärning och finjustering blev det dominerande tillvägagångssättet för att optimera AI-modeller, från GPT-4-destillering till framväx...
13 min läsning
AI
Machine Learning
+3
Cookie-samtycke Vi använder cookies för att förbättra din surfupplevelse och analysera vår trafik. See our privacy policy.