Astra od OpenAI rieši desaťročia staré matematické problémy, zatiaľ čo Microsoft otvára svoj framework na trénovanie agentov
Model Astra od OpenAI práve vyriešil desať desaťročia starých matematických problémov so strojovo overiteľnými dôkazmi a Microsoft otvoril Orchard, framework na trénovanie AI agentov za zlomok bežných nákladov. Toto znamená oboje pre tímy budujúce automatizáciu.
AI News
AI Agents
Automation
LLMs
OpenAI
Microsoft
Research
Dva príbehy z prvého augustového týždňa roku 2026 hovoria väčší príbeh o tom, kam smeruje umelá inteligencia. OpenAI pustilo internú verziu svojho ďalšieho modelu, Astry, na desať problémov z matematiky a teoretickej informatiky, ktoré zostávali nevyriešené desať a viac rokov — a vyprodukovalo strojovo overiteľné dôkazy pre všetky, za približne 2 000 dolárov výpočtového výkonu. O niekoľko dní neskôr Microsoft Research otvoril Orchard, framework, ktorý dramaticky zlacňuje trénovanie schopného AI agenta tým, že oddeľuje spôsob, akým sa agent učí, od spôsobu, akým nakoniec beží v produkcii. Ani jeden príbeh nie je o chatbote s novým kabátom. Oba sú o základnej krivke nákladov a schopností pri budovaní AI systémov, ktoré uvažujú a konajú — a to presne určuje, aká dobrá a aká dostupná bude ďalšia generácia AI agentov.
Astra od OpenAI rieši desať problémov, na ktoré matematici nestačili
augusta OpenAI publikovalo pôsobivé tvrdenie: interná verzia Astry priniesla nové výsledky pre desať otvorených problémov v čistej matematike a teoretickej informatike, pričom viaceré z nich boli nevyriešené viac než dve desaťročia. Hlavným výsledkom je explicitná konštrukcia nesofickej grupy — otázka otvorená od roku 1999, keď Mikhail Gromov predstavil koncept sofickosti. Astra tiež vyvrátila Connesovu rigidity hypotézu zostrojením nekonečne veľa neizomorfných grúp, ktoré zdieľajú tú istú von Neumannovu algebru, a dokázala Ehrhartovu objemovú hypotézu. Výsledky pokrývajú teóriu grúp, vysokorozmernú geometriu, kvantovú zložitosť, mriežkovú kryptografiu a extremálnu kombinatoriku — oblasti, ktoré sa bežne nespomínajú v tej istej vete ako jazykový model.
Čo tento prípad odlišuje od typického titulku “AI rieši ťažký problém”, je overenie. OpenAI nepublikovalo len tvrdenia — publikovalo strojovo overiteľné certifikáty dôkazov v Lean 4 pre všetkých desať výsledkov na GitHube pod licenciou Apache 2.0, spolu s 249-stranovým technickým manuskriptom. Počet príkazov “sorry” v repozitári je nula, čo znamená, že žiaden krok v žiadnom z formalizovaných dôkazov nezostal nedokázaný ani nebol odbitý. To je zmysluplne iná úroveň než keď model len tvrdí, že niečo vyriešil: dôkaz v Lean buď prejde typovou kontrolou, alebo nie, nezávisle od toho, či dôverujete modelu, ktorý ho vytvoril. Držiteľ Fieldsovej medaily Timothy Gowers údajne povedal, že by bez váhania odporučil jeden z dôkazov do popredného časopisu — hoci treba presne uviesť, že žiaden z desiatich výsledkov zatiaľ v skutočnosti neprešiel recenzným konaním.
Pripravení rozšíriť svoje podnikanie?
Začnite svoju 30-dňovú skúšobnú verziu ešte dnes a vidzte výsledky behom pár dní.
Prečo je matematický prelom dôležitý pre AI agentov
Je lákavé zaradiť toto pod “pôsobivé, ale irelevantné pre môj biznis”. To by bola chyba. Schopnosť, ktorú Astra predviedla — udržateľné, viackrokové formálne uvažovanie, kde jediný chybný krok znehodnotí celý výsledok — je štrukturálne rovnaká schopnosť, ktorá robí AI agenta spoľahlivým pri dlhom biznis workflowe. Agent, ktorý spracúva poistnú udalosť, zosúlaďuje sadu faktúr alebo vypracúva právny dokument, robí menšiu, menej okázalú verziu tej istej veci: nasleduje dlhý reťazec krokov, kde sa skorá chyba kumuluje — rovnaký vzorec, aký nájdete v akomkoľvek zozname reálnych príkladov AI agentov vytvorených pre produkčné použitie. Modely, ktoré sa merateľne zlepšujú v odhaľovaní vlastných chýb v 249-stranovom matematickom dôkaze, sa zvyčajne zlepšujú aj v odhaľovaní chýb v dvanásťkrokovej automatizácii. Matematický výsledok je extrémny, overiteľný okrajový prípad, ktorý predznamenáva, kam smeruje strop uvažovania pre každého downstream agenta.
Nasaďte najnovšie modely uvažovania do svojich automatizácií
FlowHunt vám umožní budovať viackrokových AI agentov na najnovších modeloch — bez výskumného tímu, bez infraštruktúry, len funkčnú automatizáciu.
Microsoft otvára Orchard: trénovanie agentov bez rozpočtu špičkového laboratória
Ak je Astra o tom, ako ďaleko môže uvažovanie zájsť, vydanie Orchardu od Microsoftu je o tom, aké lacné môže byť vybudovanie schopného agenta. Orchard je open-source framework od Microsoft Research, ktorý zámerne oddeľuje trénovanie agenta od jeho vykonávania — namiesto toho, aby na úlohu hodili stále väčší základný model, vývojári používajú Orchard Env, opakovane použiteľnú prostredovú službu, na trénovanie menších agentov v rámci realistických simulácií úloh ešte predtým, než sa vôbec dotknú produkčného systému. Rovnaká infraštruktúra podporuje agentov pre softvérové inžinierstvo, navigáciu na webe a osobnú asistenciu a po dokončení trénovania sa priamo napája na reálne nasadzovacie harnesse ako Codex, OpenClaw a ZeroClaw.
Čísla efektivity sú tou časťou, ktorej sa oplatí venovať pozornosť, a sú dôležité z rovnakého dôvodu, prečo záleží na porovnaní nákladovej efektívnosti naprieč frameworkami pre AI agentov, keď vyberáte stack, na ktorom chcete stavať. Orchard-SWE, kódovací agent trénovaný pomocou tohto frameworku, dosahuje 69,7 % na SWE-bench Verified — široko používanom benchmarku pre reálne softvérovo-inžinierske úlohy — čo stúpa na 73,0 % pri preradení pomocou hodnotového modelu, a to pri použití len okolo 3 miliárd aktívnych parametrov. To je len zlomok veľkosti špičkových kódovacích modelov, ktorých výkon sa blíži dosiahnuť. Tím Microsoftu to vybudoval destiláciou približne 107 000 trajektórií úloh z väčších modelov, následne aplikoval takzvané supervidované doladenie s priraďovaním zásluh — učenie sa užitočného signálu aj z trajektórií, ktoré neboli úplne úspešné — a napokon posilňované učenie.
Prihláste sa na newsletter
Získajte najnovšie tipy, trendy a ponuky zadarmo.
Oddelenie trénovania a vykonávania je časť, na ktorej by vám malo záležať
Architektonické rozhodnutie za Orchardom — trénovanie schopností agenta oddelene od jeho prevádzky v produkcii — odzrkadľuje rozdiel dôležitý pre každého, kto buduje automatizáciu, nielen pre ML výskumníkov. Vertikálny AI agent postavený pre konkrétnu odvetvovú úlohu nepotrebuje celkovo väčší mozog; potrebuje sústredený tréning na úzkom výseku rozhodnutí, ktorým bude skutočne čeliť — presne to, čo prostredie na trénovanie v štýle Orchardu poskytuje lacnejšie než škálovanie univerzálneho modelu. Rovnaká logika platí, či už trénujete model od základov, alebo konfigurujete no-code agenta: úzky, dobre definovaný tréning na realistických úlohách konzistentne prekonáva nasadenie väčšej všeobecnej schopnosti na problém, na ktorý nebola stavaná.
To tiež vysvetľuje, prečo je otvorenie frameworku ako open-source, namiesto len publikovania benchmarkových čísel, dôležitejšou časťou vydania Microsoftu. Framework, ktorý môže hocikto použiť na trénovanie inteligentných agentov na vlastných prostrediach úloh, sa kumuluje — každý tím, ktorý ho prijme a zdieľa zlepšenia, uľahčí ďalšiemu tímu vybudovanie lacnejšieho agenta, rovnaká dynamika, ktorá spôsobila, že open-source softvér ovládol infraštruktúrny stack za posledné dve desaťročia.
Čo z toho vyplýva pre Gartnerovu prognózu podnikových agentov
Keď sa pozrieme širšie, oba príbehy podporujú predpoveď, ktorú urobil Gartner o tempe podnikového prijímania AI: že do konca roka 2026 bude 40 % podnikových aplikácií obsahovať úlohovo-špecifických AI agentov, oproti menej než 5 % v roku 2025. Osemnásobný nárast za jeden rok je agresívna prognóza a výsledky ako Astra a frameworky ako Orchard sú presne tým druhom podkladovej zmeny v schopnostiach a nákladoch, ktorá by musela nastať, aby bola táto prognóza vierohodná — lacnejšie trénovanie robí budovanie agentov pre užšie úlohy ekonomicky výhodným a lepšie uvažovanie robí týchto úzko zameraných agentov dôveryhodnejšími na reálne nasadenie.
Gartnerova definícia je konkrétna a stojí za to si ju zapamätať: úlohovo-špecifický agent je taký, ktorý je postavený na zvládnutie definovanej, komplexnej úlohy od začiatku do konca — ich príkladom je kybernetickobezpečnostný agent, ktorý v reálnom čase skenuje sieťovú prevádzku, systémové logy a správanie používateľov a iniciuje vlastnú reakciu. To je iná úroveň než “aplikácia má chatbota”. Je to rozdiel medzi AI funkciou a AI pracovníkom, a je to rovnaký rozdiel, ktorý oddeľuje univerzálneho asistenta od poriadneho výskumného asistenta postaveného na spoľahlivé zvládnutie jednej úlohy od začiatku do konca.
Čo to znamená pre tímy budujúce automatizáciu dnes
Ani Astra, ani Orchard nie je niečo, čoho sa väčšina firiem priamo dotkne — nebudete doladovať model na dôkazoch v Lean ani si stavať vlastný trénovací pipeline Orchardu. Dôležité je to, čo presakuje ďalej. Zlepšenia špičkového uvažovania nakoniec zdvíhajú strop toho, čo dokáže spoľahlivo urobiť každý downstream model, vrátane tých, ktoré už poháňajú no-code automatizačné platformy. Lacnejšie, efektívnejšie tréningové techniky nakoniec znižujú náklady na špecializovaných agentov postavených na týchto modeloch. Ani jeden z týchto príbehov nemení to, čo by ste mali budovať tento štvrťrok — ale sú pomerne spoľahlivým signálom toho, čo bude možné a dostupné v tom nasledujúcom. Praktický krok nie je naháňať výskum; je to budovať automatizáciu na AI agentovej platforme dostatočne flexibilnej na to, aby automaticky absorbovala podkladové zlepšenia modelov — rovnaký inštinkt, ktorý bol dôležitý, keď sme pred pár týždňami písali o tom, ako Claude Cowork a jeho konkurenti pretvorili krajinu AI agentov.
Výber, kam sa zamerať ako prvé
Ak sa rozhodujete, čo automatizovať ako prvé, zatiaľ čo sa podkladové modely pod vami neustále zlepšujú, najbezpečnejším východiskovým bodom sú úlohy, ktoré sú úzke, dobre definované a ľahko overiteľné — rovnaké vlastnosti, vďaka ktorým bol tréningový prístup Orchardu účinný. Prieskum kľúčových slov, sumarizácia dokumentov a extrakcia štruktúrovaných dát sú bežnými východiskovými bodmi práve preto, že úspech sa dá ľahko overiť a zlyhanie je lacné. Ako sa uvažovanie zlepšuje a trénovanie sa stáva efektívnejším, ten istý princíp sa škáluje na ambicióznejšie, dlhšie bežiace workflowy — no všetko začína výberom úlohy, pri ktorej viete rýchlo a lacno zistiť, či agent skutočne urobil dobrú prácu.
Záver
August 2026 sa začal dvomi vydaniami, ktoré na prvý pohľad nemajú nič spoločné — model riešiaci desaťročia staré matematické problémy a tréningový framework pre kódovacích agentov. Pod povrchom sú obe o tých istých silách: ako ďaleko možno posunúť uvažovanie a ako lacno možno toto uvažovanie premeniť na fungujúceho agenta. Astra ukazuje, že strop stále stúpa. Orchard ukazuje, že náklady na dosiahnutie užitočnej časti tohto stropu rýchlo klesajú. Spolu sú dobrým dôvodom veriť, že Gartnerova agresívna prognóza prijatia je vierohodnejšia, než sa na prvý pohľad zdá — a dobrým dôvodom pre každý tím budujúci automatizáciu uistiť sa, že jeho nástroje sú dostatočne flexibilné na to, aby z oboch trendov ťažili aj naďalej.
Najčastejšie kladené otázky
Interná verzia Astry, ďalšej modelovej rodiny OpenAI, priniesla nové výsledky pre desať problémov v matematike a teoretickej informatike, ktoré boli otvorené najmenej desať rokov, naprieč teóriou grúp, von Neumannovými algebrami, vysokorozmernou geometriou, kvantovou zložitosťou, mriežkovou kryptografiou a extremálnou kombinatorikou. Hlavným výsledkom je explicitná konštrukcia nesofickej grupy, otázka otvorená od roku 1999, a vyvrátenie Connesovej rigidity hypotézy. OpenAI publikovalo strojovo overiteľné dôkazy v Lean 4 pre všetkých desať výsledkov spolu s 249-stranovým technickým manuskriptom.
Nie. Žiadny z desiatich výsledkov zatiaľ neprešiel formálnym recenzným konaním. Dôkazy sú však publikované ako strojovo overiteľné certifikáty v Lean 4 na GitHube s počtom príkazov 'sorry' rovným nule, čo znamená, že žiaden krok v žiadnom formalizovanom dôkaze nezostal nedokázaný — forma overenia, ktorá nevyžaduje ľudského recenzenta na potvrdenie logickej správnosti, ešte pred publikovaním v časopise.
Orchard je open-source framework od Microsoft Research, ktorý oddeľuje trénovanie AI agentov od ich vykonávania, čím dáva vývojárom opakovane použiteľnú prostredovú službu na trénovanie a hodnotenie agentov naprieč doménami úloh, ako je softvérové inžinierstvo, navigácia na webe a osobná asistencia, ešte pred ich nasadením. Je navrhnutý tak, aby zlacnil budovanie schopných agentov tým, že umožňuje menším modelom učiť sa z realistických prostredí úloh namiesto toho, aby si to vyžadovalo stále väčšie základné modely.
Orchard-SWE, kódovací agent trénovaný pomocou frameworku Orchard, dosahuje 69,7 % na SWE-bench Verified (s preradením pomocou hodnotového modelu stúpa na 73,0 %) pri použití len okolo 3 miliárd aktívnych parametrov — čo sa blíži výkonu špičkových kódovacích modelov, ktoré používajú viac než desaťnásobok tohto počtu parametrov. Táto efektivita je dôležitá, pretože znižuje výpočtové náklady na trénovanie a prevádzku schopného kódovacieho agenta.
Gartner predpovedá, že do konca roka 2026 bude 40 % podnikových aplikácií obsahovať úlohovo-špecifických AI agentov, oproti menej než 5 % v roku 2025. Úlohovo-špecifický agent je taký, ktorý je postavený na zvládnutie definovanej, komplexnej úlohy od začiatku do konca — napríklad kybernetickobezpečnostný agent, ktorý monitoruje sieťovú prevádzku a iniciuje reakciu — na rozdiel od univerzálneho asistenta. Táto prognóza odráža, že agenti sa stávajú štandardnou súčasťou existujúceho podnikového softvéru, nielen samostatnými produktmi.
Nie priamo — matematické výsledky Astry demonštrujú zlepšené formálne uvažovanie, čo je iná schopnosť než vykonávanie viacstupňových biznis workflowov. Ale rovnaké zlepšenia uvažovania, ktoré modelu umožňujú zostaviť rigorózny matematický dôkaz, zvyčajne zlepšujú aj schopnosť agenta plánovať, overovať vlastnú prácu a odhaľovať chyby v štruktúrovaných viacstupňových úlohách, čo je priamo relevantné pre spoľahlivosť automatizácie.
Trénovanie prebieha v kontrolovanom prostredí, kde agent opakovane precvičuje úlohu a dostáva korekcie — na to sa zameriavajú frameworky ako Orchard. Nasadenie (alebo vykonávanie) je spustenie tohto natrénovaného agenta na reálnych, živých úlohách v produkcii, často cez harness ako Codex alebo no-code platformu. Oddelenie oboch, ako to robí Orchard, znamená, že tím môže zlepšovať alebo pretrénovať schopnosti agenta bez toho, aby musel zasahovať do produkčného systému, v ktorom nakoniec beží, alebo ho riskovať.
Špičkový výskum ako Astra a Orchard postupne presakuje do základných modelov a techník, na ktorých stavajú no-code platformy — nemusíte ho reprodukovať sami. Platformy ako FlowHunt umožňujú tímom skladať produkčných AI agentov z predpripravených blokov a napájať ich na reálne dátové zdroje a nástroje, takže výhody lepšieho uvažovania a efektívnejšieho trénovania sa prejavia ako lepší výkon agenta bez potreby interného ML tímu.
Yasha je talentovaný softvérový vývojár so špecializáciou na Python, Javu a strojové učenie. Yasha píše technické články o AI, prompt engineeringu a vývoji chatbotov.
Yasha Boroumand
CTO, FlowHunt
Premeňte špičkový AI výskum na fungujúcu automatizáciu
Na to, aby ste ťažili z najnovších prelomov v uvažovaní a AI agentoch, nepotrebujete výskumné laboratórium. FlowHunt vám umožní stavať produkčných AI agentov na najnovších modeloch — bez potreby programovania.
Prečo OpenAI nedokáže obhájiť svoju hodnotu 500 miliárd dolárov – a ako Anthropic víťazí v jedinom AI trhu, na ktorom záleží
Hodnota OpenAI na úrovni 500 miliárd dolárov je pod drobnohľadom, keďže komoditizované AI modely a open-source alternatívy vyrovnávajú podmienky. Objavte, prečo...
Open-source vs. proprietárne AI agent buildery: Analýza nákladov a prínosov 2025
Komplexná analýza open-source a proprietárnych AI agent builderov v roku 2025, skúmajúca náklady, flexibilitu, výkon a návratnosť investícií, aby organizácie mo...
Preskúmajte nový prehliadač Atlas od OpenAI, ako revolučne mení AI-automatizáciu webu a čo to znamená pre budúcnosť agentických AI aplikácií a produktivity....
14 min čítania
AI
Automation
+3
Súhlas s cookies Používame cookies na vylepšenie vášho prehliadania a analýzu našej návštevnosti. See our privacy policy.