OpenAI'nin Astra'sı On Yıllık Matematik Problemlerini Çözerken Microsoft Ajan Eğitim Çerçevesini Açık Kaynak Yapıyor
OpenAI’nin Astra modeli, makineyle doğrulanabilir kanıtlarla on yıllık on matematik problemini çözdü ve Microsoft, yapay zeka ajanlarını olağan maliyetin çok altında eğitmeyi sağlayan bir çerçeve olan Orchard’ı açık kaynak olarak yayınladı. İşte her ikisinin otomasyon inşa eden ekipler için anlamı.
AI News
AI Agents
AutomationLLMs
OpenAI
Microsoft
Research
Ağustos 2026’nın ilk haftasından gelen iki haber, yapay zekanın nereye doğru gittiğine dair daha büyük bir hikaye anlatıyor. OpenAI, bir sonraki modeli Astra’nın dahili bir sürümünü, on yıl veya daha uzun süredir çözülememiş on matematik ve teorik bilgisayar bilimi problemi üzerinde serbest bıraktı — ve yaklaşık 2.000 dolarlık hesaplama karşılığında bunların hepsi için makineyle doğrulanabilir kanıtlar üretti. Günler sonra Microsoft Research, bir ajanın nasıl öğrendiğini onun sonunda üretimde nasıl çalıştığından ayırarak yetkin bir yapay zeka ajanının eğitimini çarpıcı biçimde ucuzlatan bir çerçeve olan Orchard’ı açık kaynak olarak yayınladı. Her iki haber de bir sohbet robotuna yeni bir kat boya çekmekle ilgili değil. İkisi de akıl yürüten ve eyleme geçen yapay zeka sistemleri inşa etmenin altında yatan maliyet ve yetenek eğrisiyle ilgili — ki bu da yeni nesil yapay zeka ajanlarının ne kadar iyi ve ne kadar uygun fiyatlı olacağını tam olarak belirleyen şey.
OpenAI’nin Astra’sı Matematikçilerin Çözemediği On Problemi Çözüyor
1 Ağustos’ta OpenAI çarpıcı bir iddia yayınladı: Astra’nın dahili bir sürümü, saf matematik ve teorik bilgisayar biliminde on açık problem için, bazıları yirmi yıldan uzun süredir çözülememiş yeni sonuçlar üretmişti. En dikkat çekici sonuç, Mikhail Gromov’un 1999’da sofikliği tanımladığı andan beri açık kalan bir sorunun yanıtı olan açık bir non-sofik grup inşasıdır. Astra ayrıca, aynı von Neumann cebirini paylaşan sonsuz sayıda izomorf olmayan grup inşa ederek Connes’in katılık varsayımını çürüttü ve Ehrhart’ın hacim varsayımını ispatladı. Sonuçlar; grup teorisi, yüksek boyutlu geometri, kuantum karmaşıklığı, kafes kriptografisi ve ekstremal kombinatorik alanlarına yayılıyor — bir dil modeliyle aynı cümlede pek görülmeyen alanlar.
Bunu tipik bir “yapay zeka zor bir problemi çözdü” başlığından farklı kılan şey doğrulamadır. OpenAI yalnızca iddialar yayınlamadı — on sonucun tamamı için makineyle doğrulanabilir Lean 4 kanıt sertifikalarını, 249 sayfalık teknik bir raporla birlikte, GitHub’da Apache 2.0 lisansı altında yayınladı. Deponun “sorry” sayısı sıfırda duruyor; bu da biçimlendirilmiş kanıtların hiçbirinde ispatlanmamış veya es geçilmiş bir adım bulunmadığı anlamına geliyor. Bu, bir modelin bir şeyi çözdüğünü iddia etmesinden anlamlı ölçüde farklı bir eşiktir: bir Lean kanıtı, onu üreten modele güvenip güvenmediğinizden bağımsız olarak ya tip denetiminden geçer ya da geçmez. Fields Madalyası sahibi Timothy Gowers’ın, kanıtlardan birini üst düzey bir dergiye hiç tereddüt etmeden önereceğini söylediği bildiriliyor — yine de on sonuçtan hiçbirinin henüz hakem denetimini fiilen tamamlamadığını belirtmekte fayda var.
İşinizi büyütmeye hazır mısınız?
Bugün ücretsiz denemenizi başlatın ve günler içinde sonuçları görün.
Bir Matematik Atılımı Yapay Zeka Ajanları İçin Neden Önemli
Bunu “etkileyici ama işim için alakasız” kategorisine koymak cazip gelebilir. Bu bir hata olur. Astra’nın gösterdiği yetenek — tek bir yanlış adımın tüm sonucu geçersiz kıldığı sürdürülebilir, çok adımlı biçimsel akıl yürütme — yapısal olarak bir yapay zeka ajanını uzun bir iş akışında güvenilir kılan yetenekle aynıdır. Bir sigorta talebini işleyen, bir dizi faturayı mutabakata bağlayan veya bir hukuki belge taslağı hazırlayan bir ajan, aynı şeyin daha küçük, daha az göz kamaştırıcı bir versiyonunu yapıyor: erken bir hatanın katlanarak büyüdüğü uzun bir adımlar zincirini takip etmek — üretim kullanımı için oluşturulmuş herhangi bir gerçek dünyadan yapay zeka ajanı örnekleri listesinden tanıyacağınız aynı örüntü. 249 sayfalık bir matematik kanıtındaki kendi hatalarını yakalamada ölçülebilir şekilde daha iyi hale gelen modeller, genellikle on iki adımlı bir otomasyondaki hataları yakalamada da daha iyi hale geliyor. Matematik sonucu, her alt akış ajanı için akıl yürütme tavanının nereye doğru gittiğini önizleyen, aşırı uçtaki, doğrulanabilir sınır durumdur.
En Son Akıl Yürütme Modellerini Otomasyonlarınızda Çalıştırın
FlowHunt, en yeni modeller üzerine çok adımlı yapay zeka ajanları oluşturmanızı sağlar — araştırma ekibi yok, altyapı yok, sadece çalışan otomasyon.
Microsoft Orchard’ı Açık Kaynak Yapıyor: Öncü Bütçesi Olmadan Ajan Eğitimi
Astra akıl yürütmenin ne kadar ileri gidebileceğiyle ilgiliyse, Microsoft’un Orchard yayını da yetkin bir ajanın ne kadar ucuza inşa edilebileceğiyle ilgili. Orchard, Microsoft Research’ten, ajan eğitimini ajan yürütmeden bilinçli olarak ayıran açık kaynaklı bir çerçevedir — geliştiriciler bir göreve giderek büyüyen bir temel model atmak yerine, daha küçük ajanları bir üretim sistemine hiç dokunmadan önce gerçekçi görev simülasyonları içinde eğitmek için yeniden kullanılabilir bir ortam hizmeti olan Orchard Env’i kullanıyor. Aynı altyapı, yazılım mühendisliği ajanlarını, web gezinme ajanlarını ve kişisel asistan ajanlarını destekliyor ve eğitim tamamlandığında Codex, OpenClaw ve ZeroClaw gibi gerçek dağıtım harness’lerine doğrudan bağlanıyor.
Dikkat edilmesi gereken kısım verimlilik rakamları ve bunlar, üzerine inşa edeceğiniz bir yığın seçerken yapay zeka ajan çerçeveleri arasındaki maliyet-verimlilik karşılaştırmalarının önemli olmasıyla aynı sebepten önemli. Bu çerçeveyle eğitilmiş bir kodlama ajanı olan Orchard-SWE, gerçek dünya yazılım mühendisliği görevleri için yaygın olarak kullanılan bir kıyaslama olan SWE-bench Verified’da %69,7 puan alıyor — değer modeli yeniden sıralamasıyla %73,0’a yükseliyor — ve bunu yalnızca yaklaşık 3 milyar aktif parametre kullanarak yapıyor. Bu, performansta yaklaştığı öncü kodlama modellerinin boyutunun küçük bir kesri. Microsoft’un ekibi bunu, daha büyük modellerden yaklaşık 107.000 görev izini damıtarak, ardından kredi atama denetimli ince ayar adını verdikleri yöntemi — tam olarak başarılı olmayan izlerden bile yararlı sinyal öğrenmeyi — uygulayıp arkasından pekiştirmeli öğrenme ekleyerek inşa etti.
Bültenimize katılın
En son ipuçlarını, trendleri ve teklifleri ücretsiz alın.
Eğitim/Yürütme Ayrımı Sizin İçin Önemli Olması Gereken Kısım
Orchard’ın arkasındaki mimari tercih — bir ajanın becerilerini üretimde çalıştırmaktan ayrı olarak eğitmek — yalnızca ML araştırmacıları için değil, otomasyon inşa eden herkes için önemli olan bir ayrımı yansıtıyor. Belirli bir sektör görevi için oluşturulmuş bir dikey yapay zeka ajanı, her alanda daha büyük bir beyne ihtiyaç duymaz; fiilen karşılaşacağı dar karar dilimine odaklanmış pratik ihtiyacı vardır ve bunu, genel amaçlı bir modeli büyütmekten daha ucuza tam olarak Orchard tarzı bir eğitim ortamı sağlar. Aynı mantık, bir modeli sıfırdan eğitirken de bir kodsuz ajanı yapılandırırken de geçerlidir: gerçekçi görevler üzerinde dar, iyi tanımlanmış eğitim, bir soruna çözmek üzere tasarlanmadığı daha genel bir yetenek atmaktan sürekli olarak daha iyi sonuç verir.
Bu aynı zamanda çerçeveyi açık kaynak yapmanın, yalnızca kıyaslama rakamlarını yayınlamaktan çok daha sonuç doğurucu olmasının nedenini de açıklıyor. Herkesin kendi görev ortamlarında akıllı ajanlar eğitmek için kullanabileceği bir çerçeve katlanarak büyür — onu benimseyip iyileştirmelerini paylaşan her ekip, bir sonraki ekibin ajanını inşa etmeyi daha ucuz hale getirir; bu, son yirmi yılda açık kaynak yazılımın altyapı yığınını yutmasını sağlayan aynı dinamiktir.
Bu Durum Gartner’ın Kurumsal Ajan Tahminini Nereye Bırakıyor
Biraz daha geriden bakıldığında, her iki haber de Gartner’ın kurumsal benimseme hızına dair yaptığı bir tahmini destekliyor: 2026 sonuna kadar kurumsal uygulamaların %40’ının göreve özel yapay zeka ajanları içereceği, bu oranın 2025’te %5’in altında olduğu. Tek bir yılda sekiz kat sıçrama iddialı bir tahmin ve Astra’nınki gibi sonuçlar ile Orchard gibi çerçeveler, bunun makul olabilmesi için gerçekleşmesi gereken tam da bu türden bir temel yetenek ve maliyet kaymasıdır — daha ucuz eğitim, daha dar görevler için ajanlar inşa etmeyi ekonomik hale getiriyor, daha iyi akıl yürütme ise bu dar kapsamlı ajanları fiilen dağıtmak için daha güvenilir kılıyor.
Gartner’ın tanımı nettir ve akılda tutmaya değer: göreve özel bir ajan, tanımlanmış, uçtan uca bir işi yerine getirmek için oluşturulmuş bir ajandır — onların örneği, ağ trafiğini, sistem günlüklerini ve kullanıcı davranışını gerçek zamanlı taradıktan sonra kendi yanıtını başlatan bir siber güvenlik ajanı. Bu, “uygulamada bir sohbet robotu var” demekten farklı bir eşik. Bu, bir yapay zeka özelliği ile bir yapay zeka çalışanı arasındaki fark ve bu, genel bir asistanı, baştan sona bir işi güvenilir şekilde yerine getirmek üzere oluşturulmuş uygun bir araştırma asistanı’ndan ayıran aynı ayrımdır.
Bu, Bugün Otomasyon İnşa Eden Ekipler İçin Ne Anlama Geliyor
Ne Astra ne de Orchard, çoğu işletmenin doğrudan dokunacağı bir şey — bir modeli Lean kanıtları üzerinde ince ayar yapmayacak ya da kendi Orchard eğitim hattınızı kurmayacaksınız. Önemli olan aşağıya süzülen şey. Öncü akıl yürütme iyileştirmeleri, zamanla, halihazırda kodsuz otomasyon platformlarını güçlendirenler dahil olmak üzere, her alt akış modelinin güvenilir şekilde yapabileceklerinin tavanını yükseltiyor. Daha ucuz, daha verimli eğitim teknikleri, zamanla, bu modeller üzerine inşa edilen özelleşmiş ajanların maliyetini düşürüyor. Bu haberlerin hiçbiri bu çeyrek ne inşa etmeniz gerektiğini değiştirmiyor — ama bir sonraki çeyrekte nelerin mümkün ve uygun fiyatlı olacağına dair makul ölçüde güvenilir bir sinyal. Pratik hamle araştırmanın peşinden koşmak değil; altta yatan model iyileştirmelerini otomatik olarak özümseyecek kadar esnek bir yapay zeka ajan platformu üzerine otomasyon inşa etmektir — tıpkı yalnızca birkaç hafta önce Claude Cowork‘ün ve rakiplerinin ajan manzarasını nasıl yeniden şekillendirdiğini ele aldığımızda önemli olan içgüdü gibi.
Önce Nereye Odaklanacağınızı Seçmek
Altta yatan modeller sizin altınızda gelişmeye devam ederken önce neyi otomatikleştireceğinize karar veriyorsanız, en güvenli başlangıç noktaları dar, iyi tanımlanmış ve doğrulanması kolay görevlerdir — Orchard’ın eğitim yaklaşımını etkili kılan aynı nitelikler. Anahtar kelime araştırması, belge özetleme ve yapılandırılmış veri çıkarma, tam olarak başarıyı kontrol etmenin kolay ve başarısızlığın ucuz olması nedeniyle yaygın başlangıç noktalarıdır. Akıl yürütme geliştikçe ve eğitim daha verimli hale geldikçe, aynı ilke daha iddialı, daha uzun süren iş akışlarına doğru ölçeklenir — ama her şey, ajanın gerçekten doğru yapıp yapmadığını hızlı ve ucuz şekilde anlayabileceğiniz bir görev seçmekle başlar.
Sonuç
Ağustos 2026, yüzeyde birbiriyle hiçbir ilgisi yokmuş gibi görünen iki yayınla açıldı — on yıllık matematik problemlerini çözen bir model ve kodlama ajanları için bir eğitim çerçevesi. Altta ikisi de aynı güçlerle ilgili: akıl yürütmenin ne kadar ileri itilebileceği ve bu akıl yürütmenin ne kadar ucuza çalışan bir ajana dönüştürülebileceği. Astra, tavanın hâlâ yükseldiğini gösteriyor. Orchard, o tavanın yararlı bir kesrine ulaşmanın maliyetinin hızla düştüğünü gösteriyor. Bir araya geldiklerinde, Gartner’ın iddialı benimseme tahmininin ilk bakışta göründüğünden daha makul olduğuna inanmak için iyi bir neden sunuyorlar — ve otomasyon inşa eden her ekibin, her iki eğilim devam ederken faydalanmaya devam edebilecek kadar esnek bir araç setine sahip olduğundan emin olması için iyi bir sebep.
Sıkça sorulan sorular
OpenAI'nin bir sonraki model ailesi olan Astra'nın dahili bir sürümü, grup teorisi, von Neumann cebirleri, yüksek boyutlu geometri, kuantum karmaşıklığı, kafes kriptografisi ve ekstremal kombinatorik alanlarına yayılan, en az on yıldır çözülememiş on matematik ve teorik bilgisayar bilimi problemi için yeni sonuçlar üretti. En dikkat çekici sonuç, 1999'dan beri açık kalan bir sorunun yanıtı olan açık bir non-sofik grup inşasıdır ve Connes'in katılık varsayımının çürütülmesidir. OpenAI, on sonucun tümü için makineyle doğrulanabilir Lean 4 kanıtlarını 249 sayfalık teknik bir raporla birlikte yayınladı.
Hayır. On sonuçtan hiçbiri henüz resmi hakem denetiminden geçmedi. Ancak kanıtlar, GitHub'da 'sorry' sayısı sıfır olan makineyle doğrulanabilir Lean 4 sertifikaları olarak yayınlandı; bu da biçimlendirilmiş kanıtların hiçbirinde ispatlanmamış bir adım bırakılmadığı anlamına geliyor — dergi incelemesi gerçekleşmeden önce bile mantıksal doğruluğu teyit etmek için insan bir hakeme ihtiyaç duymayan bir doğrulama biçimi.
Orchard, Microsoft Research'ten açık kaynaklı bir çerçevedir ve yapay zeka ajan eğitimini ajan yürütmeden ayırarak geliştiricilere, yazılım mühendisliği, web gezinme ve kişisel asistanlık gibi görev alanlarında ajanları dağıtımdan önce eğitip değerlendirmek için yeniden kullanılabilir bir ortam hizmeti sunar. Gittikçe büyüyen temel modeller gerektirmek yerine daha küçük modellerin gerçekçi görev ortamlarından öğrenmesini sağlayarak yetenekli ajanların daha ucuza inşa edilmesini sağlamak üzere tasarlanmıştır.
Orchard çerçevesiyle eğitilmiş bir kodlama ajanı olan Orchard-SWE, yalnızca yaklaşık 3 milyar aktif parametre kullanarak SWE-bench Verified'da %69,7 puan alıyor (değer modeli yeniden sıralamasıyla %73,0'a yükseliyor) — bu, on kattan fazla parametre kullanan öncü kodlama modellerinin performansına yaklaşıyor. Bu verimlilik önemli, çünkü yetenekli bir kodlama ajanını eğitmenin ve çalıştırmanın hesaplama maliyetini düşürüyor.
Gartner, 2026 sonuna kadar kurumsal uygulamaların %40'ının göreve özel yapay zeka ajanları içereceğini, bu oranın 2025'te %5'in altında olduğunu öngörüyor. Göreve özel bir ajan, genel amaçlı bir asistan yerine, ağ trafiğini izleyip bir yanıt başlatan bir siber güvenlik ajanı gibi, tanımlanmış, uçtan uca bir işi yerine getirmek için oluşturulan bir ajandır. Bu tahmin, ajanların yalnızca bağımsız ürünler olarak değil, mevcut iş yazılımlarının içinde standart bir özellik haline geldiğini yansıtıyor.
Doğrudan değil — Astra'nın matematik sonuçları, çok adımlı iş akışlarını yürütmekten farklı bir yetenek olan gelişmiş biçimsel akıl yürütmeyi gösteriyor. Ancak bir modelin titiz bir matematiksel kanıt oluşturmasını sağlayan altta yatan akıl yürütme iyileştirmeleri, genellikle bir ajanın planlama, kendi işini doğrulama ve yapılandırılmış çok adımlı görevlerdeki hataları yakalama becerisini de geliştiriyor; bu da doğrudan otomasyon güvenilirliğiyle ilgilidir.
Eğitim, bir ajanın bir görevi tekrar tekrar uygulayıp düzeltildiği kontrollü bir ortamda gerçekleşir — Orchard gibi çerçevelerin odaklandığı nokta budur. Dağıtım (veya yürütme) ise eğitilmiş o ajanı, genellikle Codex gibi bir harness veya kodsuz bir platform aracılığıyla, üretimde gerçek, canlı görevlere karşı çalıştırmaktır. Orchard'ın yaptığı gibi ikisini ayırmak, bir ekibin sonunda çalışacağı üretim sistemine dokunmadan veya onu riske atmadan bir ajanın becerilerini geliştirebileceği veya yeniden eğitebileceği anlamına gelir.
Astra ve Orchard gibi öncü araştırmalar, kodsuz platformların üzerine inşa edildiği temel modellere ve tekniklere zamanla yansır — bunu kendiniz yeniden üretmenize gerek yok. FlowHunt gibi platformlar, ekiplerin üretime hazır yapay zeka ajanlarını önceden hazırlanmış bloklardan oluşturmasını ve bunları gerçek veri kaynakları ve araçlarla bağlamasını sağlar; böylece daha iyi akıl yürütmenin ve daha verimli eğitimin faydaları, dahili bir ML ekibine ihtiyaç duyulmadan daha iyi ajan performansı olarak ortaya çıkar.
Yasha, Python, Java ve makine öğrenimi konusunda uzmanlaşmış yetenekli bir yazılım geliştiricisidir. Yasha, yapay zeka, prompt mühendisliği ve sohbet botu geliştirme konularında teknik makaleler yazar.
Yasha Boroumand
CTO, FlowHunt
Öncü Yapay Zeka Araştırmalarını Çalışan Otomasyona Dönüştürün
En son akıl yürütme ve ajan atılımlarından faydalanmak için bir araştırma laboratuvarına ihtiyacınız yok. FlowHunt, kod yazmadan en yeni modeller üzerine üretime hazır yapay zeka ajanları oluşturmanızı sağlar.
OpenAI 500 Milyar Dolarlık Değerlemesini Neden Haklı Çıkaramıyor—ve Anthropic Neden Gerçekten Önemli Olan Tek Yapay Zekâ Pazarında Kazanıyor?
OpenAI'nin 500 milyar dolarlık değerlemesi, metalaşan yapay zekâ modelleri ve açık kaynak alternatifleriyle rekabetin eşitlenmesiyle sorgulanıyor. Anthropic'in ...
OpenAI, GPT, DALL-E ve ChatGPT'yi geliştiren, yapay genel zekânın (AGI) insanlık için güvenli ve faydalı olmasını hedefleyen, önde gelen bir yapay zekâ araştırm...
3 dakika okuma
OpenAI
AI
+4
Çerez Onayı Göz atma deneyiminizi geliştirmek ve trafiğimizi analiz etmek için çerezleri kullanıyoruz. See our privacy policy.