OpenAI'nin Astra'sı On Yıllık Matematik Problemlerini Çözerken Microsoft Ajan Eğitim Çerçevesini Açık Kaynak Yapıyor

AI News AI Agents Automation LLMs

Giriş

Ağustos 2026’nın ilk haftasından gelen iki haber, yapay zekanın nereye doğru gittiğine dair daha büyük bir hikaye anlatıyor. OpenAI, bir sonraki modeli Astra’nın dahili bir sürümünü, on yıl veya daha uzun süredir çözülememiş on matematik ve teorik bilgisayar bilimi problemi üzerinde serbest bıraktı — ve yaklaşık 2.000 dolarlık hesaplama karşılığında bunların hepsi için makineyle doğrulanabilir kanıtlar üretti. Günler sonra Microsoft Research, bir ajanın nasıl öğrendiğini onun sonunda üretimde nasıl çalıştığından ayırarak yetkin bir yapay zeka ajanının eğitimini çarpıcı biçimde ucuzlatan bir çerçeve olan Orchard’ı açık kaynak olarak yayınladı. Her iki haber de bir sohbet robotuna yeni bir kat boya çekmekle ilgili değil. İkisi de akıl yürüten ve eyleme geçen yapay zeka sistemleri inşa etmenin altında yatan maliyet ve yetenek eğrisiyle ilgili — ki bu da yeni nesil yapay zeka ajanlarının ne kadar iyi ve ne kadar uygun fiyatlı olacağını tam olarak belirleyen şey.

Bir kanıt sertifikasını ve açık bir ajan çerçevesini merkezi bir otomatik iş akışı merkezine bağlayan soyut illüstrasyon

OpenAI’nin Astra’sı Matematikçilerin Çözemediği On Problemi Çözüyor

1 Ağustos’ta OpenAI çarpıcı bir iddia yayınladı: Astra’nın dahili bir sürümü, saf matematik ve teorik bilgisayar biliminde on açık problem için, bazıları yirmi yıldan uzun süredir çözülememiş yeni sonuçlar üretmişti. En dikkat çekici sonuç, Mikhail Gromov’un 1999’da sofikliği tanımladığı andan beri açık kalan bir sorunun yanıtı olan açık bir non-sofik grup inşasıdır. Astra ayrıca, aynı von Neumann cebirini paylaşan sonsuz sayıda izomorf olmayan grup inşa ederek Connes’in katılık varsayımını çürüttü ve Ehrhart’ın hacim varsayımını ispatladı. Sonuçlar; grup teorisi, yüksek boyutlu geometri, kuantum karmaşıklığı, kafes kriptografisi ve ekstremal kombinatorik alanlarına yayılıyor — bir dil modeliyle aynı cümlede pek görülmeyen alanlar.

Bunu tipik bir “yapay zeka zor bir problemi çözdü” başlığından farklı kılan şey doğrulamadır. OpenAI yalnızca iddialar yayınlamadı — on sonucun tamamı için makineyle doğrulanabilir Lean 4 kanıt sertifikalarını, 249 sayfalık teknik bir raporla birlikte, GitHub’da Apache 2.0 lisansı altında yayınladı. Deponun “sorry” sayısı sıfırda duruyor; bu da biçimlendirilmiş kanıtların hiçbirinde ispatlanmamış veya es geçilmiş bir adım bulunmadığı anlamına geliyor. Bu, bir modelin bir şeyi çözdüğünü iddia etmesinden anlamlı ölçüde farklı bir eşiktir: bir Lean kanıtı, onu üreten modele güvenip güvenmediğinizden bağımsız olarak ya tip denetiminden geçer ya da geçmez. Fields Madalyası sahibi Timothy Gowers’ın, kanıtlardan birini üst düzey bir dergiye hiç tereddüt etmeden önereceğini söylediği bildiriliyor — yine de on sonuçtan hiçbirinin henüz hakem denetimini fiilen tamamlamadığını belirtmekte fayda var.

FlowHunt Logo

İşinizi büyütmeye hazır mısınız?

Bugün ücretsiz denemenizi başlatın ve günler içinde sonuçları görün.

Bir Matematik Atılımı Yapay Zeka Ajanları İçin Neden Önemli

Bunu “etkileyici ama işim için alakasız” kategorisine koymak cazip gelebilir. Bu bir hata olur. Astra’nın gösterdiği yetenek — tek bir yanlış adımın tüm sonucu geçersiz kıldığı sürdürülebilir, çok adımlı biçimsel akıl yürütme — yapısal olarak bir yapay zeka ajanını uzun bir iş akışında güvenilir kılan yetenekle aynıdır. Bir sigorta talebini işleyen, bir dizi faturayı mutabakata bağlayan veya bir hukuki belge taslağı hazırlayan bir ajan, aynı şeyin daha küçük, daha az göz kamaştırıcı bir versiyonunu yapıyor: erken bir hatanın katlanarak büyüdüğü uzun bir adımlar zincirini takip etmek — üretim kullanımı için oluşturulmuş herhangi bir gerçek dünyadan yapay zeka ajanı örnekleri listesinden tanıyacağınız aynı örüntü. 249 sayfalık bir matematik kanıtındaki kendi hatalarını yakalamada ölçülebilir şekilde daha iyi hale gelen modeller, genellikle on iki adımlı bir otomasyondaki hataları yakalamada da daha iyi hale geliyor. Matematik sonucu, her alt akış ajanı için akıl yürütme tavanının nereye doğru gittiğini önizleyen, aşırı uçtaki, doğrulanabilir sınır durumdur.

En Son Akıl Yürütme Modellerini Otomasyonlarınızda Çalıştırın

FlowHunt, en yeni modeller üzerine çok adımlı yapay zeka ajanları oluşturmanızı sağlar — araştırma ekibi yok, altyapı yok, sadece çalışan otomasyon.

Microsoft Orchard’ı Açık Kaynak Yapıyor: Öncü Bütçesi Olmadan Ajan Eğitimi

Astra akıl yürütmenin ne kadar ileri gidebileceğiyle ilgiliyse, Microsoft’un Orchard yayını da yetkin bir ajanın ne kadar ucuza inşa edilebileceğiyle ilgili. Orchard, Microsoft Research’ten, ajan eğitimini ajan yürütmeden bilinçli olarak ayıran açık kaynaklı bir çerçevedir — geliştiriciler bir göreve giderek büyüyen bir temel model atmak yerine, daha küçük ajanları bir üretim sistemine hiç dokunmadan önce gerçekçi görev simülasyonları içinde eğitmek için yeniden kullanılabilir bir ortam hizmeti olan Orchard Env’i kullanıyor. Aynı altyapı, yazılım mühendisliği ajanlarını, web gezinme ajanlarını ve kişisel asistan ajanlarını destekliyor ve eğitim tamamlandığında Codex, OpenClaw ve ZeroClaw gibi gerçek dağıtım harness’lerine doğrudan bağlanıyor.

Dikkat edilmesi gereken kısım verimlilik rakamları ve bunlar, üzerine inşa edeceğiniz bir yığın seçerken yapay zeka ajan çerçeveleri arasındaki maliyet-verimlilik karşılaştırmalarının önemli olmasıyla aynı sebepten önemli. Bu çerçeveyle eğitilmiş bir kodlama ajanı olan Orchard-SWE, gerçek dünya yazılım mühendisliği görevleri için yaygın olarak kullanılan bir kıyaslama olan SWE-bench Verified’da %69,7 puan alıyor — değer modeli yeniden sıralamasıyla %73,0’a yükseliyor — ve bunu yalnızca yaklaşık 3 milyar aktif parametre kullanarak yapıyor. Bu, performansta yaklaştığı öncü kodlama modellerinin boyutunun küçük bir kesri. Microsoft’un ekibi bunu, daha büyük modellerden yaklaşık 107.000 görev izini damıtarak, ardından kredi atama denetimli ince ayar adını verdikleri yöntemi — tam olarak başarılı olmayan izlerden bile yararlı sinyal öğrenmeyi — uygulayıp arkasından pekiştirmeli öğrenme ekleyerek inşa etti.

Orchard-SWE'nin SWE-bench Verified'da yüzde 69,7 puan aldığını, değer modeli yeniden sıralamasıyla yüzde 73,0'a yükseldiğini ve yaklaşık 3 milyar aktif parametre kullandığını gösteren çubuk grafik

Eğitim/Yürütme Ayrımı Sizin İçin Önemli Olması Gereken Kısım

Orchard’ın arkasındaki mimari tercih — bir ajanın becerilerini üretimde çalıştırmaktan ayrı olarak eğitmek — yalnızca ML araştırmacıları için değil, otomasyon inşa eden herkes için önemli olan bir ayrımı yansıtıyor. Belirli bir sektör görevi için oluşturulmuş bir dikey yapay zeka ajanı, her alanda daha büyük bir beyne ihtiyaç duymaz; fiilen karşılaşacağı dar karar dilimine odaklanmış pratik ihtiyacı vardır ve bunu, genel amaçlı bir modeli büyütmekten daha ucuza tam olarak Orchard tarzı bir eğitim ortamı sağlar. Aynı mantık, bir modeli sıfırdan eğitirken de bir kodsuz ajanı yapılandırırken de geçerlidir: gerçekçi görevler üzerinde dar, iyi tanımlanmış eğitim, bir soruna çözmek üzere tasarlanmadığı daha genel bir yetenek atmaktan sürekli olarak daha iyi sonuç verir.

Bu aynı zamanda çerçeveyi açık kaynak yapmanın, yalnızca kıyaslama rakamlarını yayınlamaktan çok daha sonuç doğurucu olmasının nedenini de açıklıyor. Herkesin kendi görev ortamlarında akıllı ajanlar eğitmek için kullanabileceği bir çerçeve katlanarak büyür — onu benimseyip iyileştirmelerini paylaşan her ekip, bir sonraki ekibin ajanını inşa etmeyi daha ucuz hale getirir; bu, son yirmi yılda açık kaynak yazılımın altyapı yığınını yutmasını sağlayan aynı dinamiktir.

Bu Durum Gartner’ın Kurumsal Ajan Tahminini Nereye Bırakıyor

Biraz daha geriden bakıldığında, her iki haber de Gartner’ın kurumsal benimseme hızına dair yaptığı bir tahmini destekliyor: 2026 sonuna kadar kurumsal uygulamaların %40’ının göreve özel yapay zeka ajanları içereceği, bu oranın 2025’te %5’in altında olduğu. Tek bir yılda sekiz kat sıçrama iddialı bir tahmin ve Astra’nınki gibi sonuçlar ile Orchard gibi çerçeveler, bunun makul olabilmesi için gerçekleşmesi gereken tam da bu türden bir temel yetenek ve maliyet kaymasıdır — daha ucuz eğitim, daha dar görevler için ajanlar inşa etmeyi ekonomik hale getiriyor, daha iyi akıl yürütme ise bu dar kapsamlı ajanları fiilen dağıtmak için daha güvenilir kılıyor.

Gartner'ın, kurumsal uygulamalardaki göreve özel yapay zeka ajanlarının 2025'te yüzde 5'in altından 2026 sonuna kadar yüzde 40'a yükseleceği tahminini gösteren çubuk grafik

Gartner’ın tanımı nettir ve akılda tutmaya değer: göreve özel bir ajan, tanımlanmış, uçtan uca bir işi yerine getirmek için oluşturulmuş bir ajandır — onların örneği, ağ trafiğini, sistem günlüklerini ve kullanıcı davranışını gerçek zamanlı taradıktan sonra kendi yanıtını başlatan bir siber güvenlik ajanı. Bu, “uygulamada bir sohbet robotu var” demekten farklı bir eşik. Bu, bir yapay zeka özelliği ile bir yapay zeka çalışanı arasındaki fark ve bu, genel bir asistanı, baştan sona bir işi güvenilir şekilde yerine getirmek üzere oluşturulmuş uygun bir araştırma asistanı’ndan ayıran aynı ayrımdır.

Bu, Bugün Otomasyon İnşa Eden Ekipler İçin Ne Anlama Geliyor

Ne Astra ne de Orchard, çoğu işletmenin doğrudan dokunacağı bir şey — bir modeli Lean kanıtları üzerinde ince ayar yapmayacak ya da kendi Orchard eğitim hattınızı kurmayacaksınız. Önemli olan aşağıya süzülen şey. Öncü akıl yürütme iyileştirmeleri, zamanla, halihazırda kodsuz otomasyon platformlarını güçlendirenler dahil olmak üzere, her alt akış modelinin güvenilir şekilde yapabileceklerinin tavanını yükseltiyor. Daha ucuz, daha verimli eğitim teknikleri, zamanla, bu modeller üzerine inşa edilen özelleşmiş ajanların maliyetini düşürüyor. Bu haberlerin hiçbiri bu çeyrek ne inşa etmeniz gerektiğini değiştirmiyor — ama bir sonraki çeyrekte nelerin mümkün ve uygun fiyatlı olacağına dair makul ölçüde güvenilir bir sinyal. Pratik hamle araştırmanın peşinden koşmak değil; altta yatan model iyileştirmelerini otomatik olarak özümseyecek kadar esnek bir yapay zeka ajan platformu üzerine otomasyon inşa etmektir — tıpkı yalnızca birkaç hafta önce Claude Cowork‘ün ve rakiplerinin ajan manzarasını nasıl yeniden şekillendirdiğini ele aldığımızda önemli olan içgüdü gibi.

Önce Nereye Odaklanacağınızı Seçmek

Altta yatan modeller sizin altınızda gelişmeye devam ederken önce neyi otomatikleştireceğinize karar veriyorsanız, en güvenli başlangıç noktaları dar, iyi tanımlanmış ve doğrulanması kolay görevlerdir — Orchard’ın eğitim yaklaşımını etkili kılan aynı nitelikler. Anahtar kelime araştırması, belge özetleme ve yapılandırılmış veri çıkarma, tam olarak başarıyı kontrol etmenin kolay ve başarısızlığın ucuz olması nedeniyle yaygın başlangıç noktalarıdır. Akıl yürütme geliştikçe ve eğitim daha verimli hale geldikçe, aynı ilke daha iddialı, daha uzun süren iş akışlarına doğru ölçeklenir — ama her şey, ajanın gerçekten doğru yapıp yapmadığını hızlı ve ucuz şekilde anlayabileceğiniz bir görev seçmekle başlar.

Sonuç

Ağustos 2026, yüzeyde birbiriyle hiçbir ilgisi yokmuş gibi görünen iki yayınla açıldı — on yıllık matematik problemlerini çözen bir model ve kodlama ajanları için bir eğitim çerçevesi. Altta ikisi de aynı güçlerle ilgili: akıl yürütmenin ne kadar ileri itilebileceği ve bu akıl yürütmenin ne kadar ucuza çalışan bir ajana dönüştürülebileceği. Astra, tavanın hâlâ yükseldiğini gösteriyor. Orchard, o tavanın yararlı bir kesrine ulaşmanın maliyetinin hızla düştüğünü gösteriyor. Bir araya geldiklerinde, Gartner’ın iddialı benimseme tahmininin ilk bakışta göründüğünden daha makul olduğuna inanmak için iyi bir neden sunuyorlar — ve otomasyon inşa eden her ekibin, her iki eğilim devam ederken faydalanmaya devam edebilecek kadar esnek bir araç setine sahip olduğundan emin olması için iyi bir sebep.

Sıkça sorulan sorular

Yasha, Python, Java ve makine öğrenimi konusunda uzmanlaşmış yetenekli bir yazılım geliştiricisidir. Yasha, yapay zeka, prompt mühendisliği ve sohbet botu geliştirme konularında teknik makaleler yazar.

Yasha Boroumand
Yasha Boroumand
CTO, FlowHunt

Öncü Yapay Zeka Araştırmalarını Çalışan Otomasyona Dönüştürün

En son akıl yürütme ve ajan atılımlarından faydalanmak için bir araştırma laboratuvarına ihtiyacınız yok. FlowHunt, kod yazmadan en yeni modeller üzerine üretime hazır yapay zeka ajanları oluşturmanızı sağlar.

Daha fazla bilgi

OpenAI 500 Milyar Dolarlık Değerlemesini Neden Haklı Çıkaramıyor—ve Anthropic Neden Gerçekten Önemli Olan Tek Yapay Zekâ Pazarında Kazanıyor?
OpenAI 500 Milyar Dolarlık Değerlemesini Neden Haklı Çıkaramıyor—ve Anthropic Neden Gerçekten Önemli Olan Tek Yapay Zekâ Pazarında Kazanıyor?

OpenAI 500 Milyar Dolarlık Değerlemesini Neden Haklı Çıkaramıyor—ve Anthropic Neden Gerçekten Önemli Olan Tek Yapay Zekâ Pazarında Kazanıyor?

OpenAI'nin 500 milyar dolarlık değerlemesi, metalaşan yapay zekâ modelleri ve açık kaynak alternatifleriyle rekabetin eşitlenmesiyle sorgulanıyor. Anthropic'in ...

6 dakika okuma
OpenAI Anthropic +4
OpenAI
OpenAI

OpenAI

OpenAI, GPT, DALL-E ve ChatGPT'yi geliştiren, yapay genel zekânın (AGI) insanlık için güvenli ve faydalı olmasını hedefleyen, önde gelen bir yapay zekâ araştırm...

3 dakika okuma
OpenAI AI +4