نموذج Astra من OpenAI يحل مسائل رياضية عالقة منذ عقد بينما تفتح Microsoft مصدر إطار عمل تدريب الوكلاء
حلّ نموذج Astra من OpenAI عشر مسائل رياضية عالقة منذ عقد ببراهين قابلة للتحقق آلياً، وفتحت Microsoft مصدر Orchard، إطار عمل لتدريب وكلاء الذكاء الاصطناعي بجزء بسيط من التكلفة المعتادة. إليك ما يعنيه الأمران للفرق التي تبني الأتمتة.
AI News
AI Agents
AutomationLLMs
OpenAI
Microsoft
Research
تحكي قصتان من الأسبوع الأول من أغسطس 2026 قصة أكبر عن الاتجاه الذي يسير فيه الذكاء الاصطناعي. أطلقت OpenAI نسخة داخلية من نموذجها القادم، Astra، على عشر مسائل في الرياضيات وعلوم الحاسوب النظرية ظلت عالقة دون حل لعقد أو أكثر — وأنتجت براهين قابلة للتحقق آلياً لجميعها، مقابل نحو 2,000 دولار فقط من تكلفة الحوسبة. وبعد أيام، فتحت Microsoft Research مصدر Orchard، وهو إطار عمل يجعل تدريب وكيل ذكاء اصطناعي كفء أرخص بشكل كبير من خلال الفصل بين كيفية تعلّم الوكيل وكيفية تشغيله في النهاية في الإنتاج. لا تتعلق أي من القصتين بواجهة جديدة لروبوت محادثة. كلتاهما تتعلقان بمنحنى التكلفة والقدرة الأساسي لبناء أنظمة ذكاء اصطناعي تستدلّ وتتصرف — وهو بالضبط ما يحدد مدى جودة، ومدى القدرة على تحمل تكلفة، الجيل القادم من وكلاء الذكاء الاصطناعي.
نموذج Astra من OpenAI يحل عشر مسائل عجز الرياضيون عن حلها
في الأول من أغسطس، نشرت OpenAI ادعاءً لافتاً: أنتجت نسخة داخلية من Astra نتائج جديدة لعشر مسائل مفتوحة في الرياضيات البحتة وعلوم الحاسوب النظرية، بعضها ظل دون حل لأكثر من عقدين. النتيجة الأبرز هي بناء صريح لزمرة غير سوفيكية — مسألة ظلت مفتوحة منذ أن قدّم ميخائيل غروموف مفهوم السوفيكية عام 1999. كما دحض Astra تخمين Connes للجساءة من خلال بناء عدد لا نهائي من الزمر غير المتماثلة التي تشترك في نفس جبر فون نويمان، وأثبت تخمين إرهارت للحجم (Ehrhart’s volume conjecture). تمتد النتائج عبر نظرية الزمر، والهندسة عالية الأبعاد، والتعقيد الكمي، والتشفير الشبكي، والتوافقيات القصوى — وهي مجالات لا تظهر عادة في نفس الجملة مع نموذج لغوي.
ما يميز هذا الأمر عن عناوين “الذكاء الاصطناعي يحل مسألة صعبة” المعتادة هو التحقق. لم تكتفِ OpenAI بنشر ادعاءات — بل نشرت شهادات براهين Lean 4 قابلة للتحقق آلياً لجميع النتائج العشر على GitHub بترخيص Apache 2.0، إلى جانب مخطوطة تقنية من 249 صفحة. يقف عداد “sorry” في المستودع عند صفر، ما يعني أنه لم تُترك أي خطوة في أي من البراهين المُشكلنة دون إثبات أو تجاوز. هذا معيار مختلف بشكل ملموس عن مجرد ادعاء نموذج بأنه حل مسألة ما: فبرهان Lean إما أن يجتاز التحقق النوعي أو لا يجتازه، بغض النظر عما إذا كنت تثق بالنموذج الذي أنتجه. وقد قيل إن الحائز على ميدالية فيلدز تيموثي غاورز صرّح بأنه سيوصي بأحد البراهين لمجلة علمية مرموقة دون تردد — رغم أن من المهم التوضيح بدقة أن أياً من النتائج العشر لم يُكمل مراجعة الأقران فعلياً بعد.
هل أنت مستعد لتنمية عملك؟
ابدأ تجربتك المجانية اليوم وشاهد النتائج في غضون أيام.
من المغري تصنيف هذا الأمر ضمن خانة “مثير للإعجاب لكنه غير ذي صلة بعملي”. سيكون ذلك خطأً. القدرة التي أظهرها Astra — استدلال رسمي متواصل ومتعدد الخطوات حيث تُبطل خطوة واحدة خاطئة النتيجة بأكملها — هي من الناحية البنيوية نفس القدرة التي تجعل وكيل الذكاء الاصطناعي موثوقاً في سير عمل تجاري طويل. الوكيل الذي يعالج مطالبة تأمين، أو يوفّق مجموعة من الفواتير، أو يصيغ مستنداً قانونياً، يقوم بنسخة أصغر وأقل بريقاً من الشيء نفسه: اتباع سلسلة طويلة من الخطوات حيث يتراكم خطأ مبكر — وهو النمط نفسه الذي ستلاحظه في أي قائمة من أمثلة واقعية على وكلاء الذكاء الاصطناعي مبنية للاستخدام الإنتاجي. النماذج التي تتحسن بشكل قابل للقياس في اكتشاف أخطائها الخاصة في برهان رياضي من 249 صفحة تميل أيضاً إلى التحسن في اكتشاف الأخطاء في أتمتة من اثنتي عشرة خطوة. النتيجة الرياضية هي الحالة الحدّية القابلة للتحقق التي تعطي لمحة عن الاتجاه الذي يسير فيه سقف الاستدلال لكل وكيل تالٍ.
وظّف أحدث نماذج الاستدلال في أتمتتك
يتيح لك FlowHunt بناء وكلاء ذكاء اصطناعي متعددي الخطوات فوق أحدث النماذج — دون فريق بحثي، ودون بنية تحتية، فقط أتمتة عاملة فعلياً.
Microsoft تفتح مصدر Orchard: تدريب الوكلاء بدون ميزانية شركة رائدة
إذا كان Astra يتعلق بإلى أي مدى يمكن أن يصل الاستدلال، فإن إصدار Orchard من Microsoft يتعلق بمدى رخص بناء وكيل كفء. Orchard هو إطار عمل مفتوح المصدر من Microsoft Research يفصل عمداً بين تدريب الوكيل وتنفيذه — فبدلاً من إلقاء نموذج أساسي أكبر باستمرار على مهمة ما، يستخدم المطورون Orchard Env، وهي خدمة بيئة قابلة لإعادة الاستخدام، لتدريب وكلاء أصغر داخل محاكاة مهام واقعية قبل أن يلامسوا نظام إنتاج على الإطلاق. تدعم البنية التحتية نفسها وكلاء هندسة البرمجيات، ووكلاء التصفح على الويب، ووكلاء المساعدة الشخصية، وتتصل مباشرة ببيئات نشر حقيقية مثل Codex وOpenClaw وZeroClaw بمجرد اكتمال التدريب.
أرقام الكفاءة هي الجزء الذي يستحق الانتباه، وهي مهمة للسبب نفسه الذي تهم فيه مقارنات كفاءة التكلفة عبر أطر عمل وكلاء الذكاء الاصطناعي عندما تختار البنية التي ستبني عليها. يحقق Orchard-SWE، وهو وكيل برمجة تم تدريبه باستخدام هذا الإطار، نتيجة 69.7% على معيار SWE-bench Verified — وهو معيار مستخدم على نطاق واسع للمهام الواقعية في هندسة البرمجيات — ترتفع إلى 73.0% مع إعادة الترتيب بنموذج القيمة، باستخدام نحو 3 مليارات معامل نشط فقط. تلك نسبة ضئيلة من حجم نماذج البرمجة الرائدة التي يقترب منها في الأداء. بنى فريق Microsoft هذا من خلال تقطير نحو 107,000 مسار مهمة من نماذج أكبر، ثم تطبيق ما يسمونه الضبط الدقيق الخاضع للإشراف مع إسناد الفضل (credit-assignment supervised fine-tuning) — استخلاص إشارة مفيدة حتى من المسارات التي لم تنجح بالكامل — يتبعه تعلّم معزز.
انضم إلى نشرتنا الإخبارية
احصل على أحدث النصائح والاتجاهات والعروض مجانًا.
الفصل بين التدريب والتنفيذ هو الجزء الذي يجب أن يهمك
الاختيار البنيوي وراء Orchard — تدريب مهارات الوكيل بمعزل عن تشغيله في الإنتاج — يعكس تمييزاً مهماً لكل من يبني الأتمتة، وليس فقط لباحثي التعلم الآلي. وكيل الذكاء الاصطناعي الرأسي المبني لمهمة صناعية محددة لا يحتاج إلى عقل أكبر على جميع الأصعدة؛ بل يحتاج إلى تدريب مركّز على الشريحة الضيقة من القرارات التي سيواجهها فعلياً، وهذا بالضبط ما توفره بيئة تدريب على طراز Orchard بتكلفة أقل من توسيع نموذج عام الغرض. المنطق نفسه ينطبق سواء كنت تدرّب نموذجاً من الصفر أو تُهيئ وكيلاً بدون كود: التدريب الضيق والمحدد جيداً على مهام واقعية يتفوق باستمرار على إلقاء قدرة عامة أكبر على مسألة لم يُبنَ لحلها.
هذا يفسر أيضاً لماذا يُعد فتح مصدر الإطار، بدلاً من مجرد نشر أرقام معايير، الجزء الأكثر أهمية من إصدار Microsoft. الإطار الذي يمكن لأي شخص استخدامه لتدريب الوكلاء الأذكياء على بيئات مهامهم الخاصة له أثر متراكم — فكل فريق يتبناه ويشارك التحسينات يجعل بناء وكيل الفريق التالي أرخص، وهي الديناميكية نفسها التي جعلت البرمجيات مفتوحة المصدر تسيطر على قطاع البنية التحتية خلال العقدين الماضيين.
أين يترك هذا توقعات Gartner لوكلاء المؤسسات
بالنظر إلى الصورة الأوسع، تعزز القصتان معاً توقعاً وضعته Gartner حول وتيرة التبني المؤسسي: أنه بحلول نهاية عام 2026، ستضم 40% من تطبيقات المؤسسات وكلاء ذكاء اصطناعي مخصصين لمهام محددة، ارتفاعاً من أقل من 5% في عام 2025. قفزة بثمانية أضعاف في عام واحد توقع جريء، ونتائج مثل نتائج Astra وأطر عمل مثل Orchard هي بالضبط نوع التحول الأساسي في القدرة والتكلفة الذي يجب أن يحدث ليكون هذا التوقع معقولاً — فالتدريب الأرخص يجعل من المجدي اقتصادياً بناء وكلاء لمهام أضيق، والاستدلال الأفضل يجعل تلك الوكلاء الأضيق أكثر جدارة بالثقة لنشرها فعلياً.
تعريف Gartner دقيق ويستحق التذكر: الوكيل المخصص لمهمة محددة هو وكيل مبني للتعامل مع عمل محدد من البداية إلى النهاية — مثالهم هو وكيل للأمن السيبراني يفحص حركة الشبكة وسجلات النظام وسلوك المستخدم في الوقت الفعلي ويبادر بالاستجابة الخاصة به. هذا معيار مختلف عن “التطبيق فيه روبوت محادثة”. إنه الفرق بين ميزة ذكاء اصطناعي وعامل ذكاء اصطناعي، وهو التمييز نفسه الذي يفصل مساعداً عاماً عن مساعد بحثي حقيقي مبني للتعامل مع مهمة واحدة بموثوقية من البداية إلى النهاية.
ماذا يعني هذا لفرق بناء الأتمتة اليوم
لن تلامس معظم الشركات Astra أو Orchard مباشرة — لن تقوم بضبط نموذج دقيق على براهين Lean أو تُنشئ خط تدريب Orchard الخاص بك. ما يهم هو ما يتسرب إلى الأسفل. تحسينات الاستدلال الرائدة ترفع في النهاية سقف ما يمكن لكل نموذج تالٍ فعله بموثوقية، بما في ذلك النماذج التي تشغّل بالفعل منصات الأتمتة بدون كود. تقنيات التدريب الأرخص والأكثر كفاءة تخفض في النهاية تكلفة الوكلاء المتخصصين المبنيين فوق تلك النماذج. لا تغيّر أي من القصتين ما يجب عليك بناؤه هذا الربع — لكنهما إشارة موثوقة إلى حد معقول عما سيكون ممكناً، وبتكلفة معقولة، في الربع القادم. الخطوة العملية ليست ملاحقة الأبحاث؛ بل بناء الأتمتة على منصة وكلاء الذكاء الاصطناعي مرنة بما يكفي لاستيعاب تحسينات النموذج الأساسية تلقائياً، وهو الحدس نفسه الذي كان مهماً عندما تناولنا كيف أعاد Claude Cowork ومنافسوه تشكيل مشهد الوكلاء قبل أسابيع قليلة فقط.
اختيار أين تركز أولاً
إذا كنت تقرر ما تؤتمته أولاً بينما تستمر النماذج الأساسية في التحسن تحتك، فإن أكثر نقاط البداية أماناً هي المهام الضيقة والمحددة جيداً والسهلة التحقق منها — وهي نفس الصفات التي جعلت نهج تدريب Orchard فعالاً. بحث الكلمات المفتاحية، وتلخيص المستندات، واستخراج البيانات المهيكلة هي نقاط بداية شائعة تحديداً لأن النجاح سهل التحقق منه والفشل رخيص. مع تحسّن الاستدلال وازدياد كفاءة التدريب، يتوسع هذا المبدأ نفسه ليشمل سير عمل أكثر طموحاً وأطول أمداً — لكنه يبدأ باختيار مهمة يمكنك أن تعرف فيها، بسرعة وبتكلفة زهيدة، ما إذا كان الوكيل قد أنجزها بشكل صحيح فعلاً.
الخاتمة
افتتح أغسطس 2026 بإصدارين لا يبدو ظاهرياً أن لهما أي علاقة ببعضهما — نموذج يحل مسائل رياضية عالقة منذ عقد، وإطار عمل تدريب لوكلاء البرمجة. لكن في العمق، يتعلق كلاهما بالقوى نفسها: إلى أي مدى يمكن دفع الاستدلال، وبأي رخص يمكن تحويل ذلك الاستدلال إلى وكيل عامل فعلياً. يُظهر Astra أن السقف ما زال يرتفع. ويُظهر Orchard أن تكلفة بلوغ جزء مفيد من ذلك السقف تنخفض بسرعة. مجتمعين، هما سبب وجيه للاعتقاد بأن توقع Gartner الجريء للتبني أكثر معقولية مما يبدو للوهلة الأولى — وسبب وجيه لأي فريق يبني الأتمتة للتأكد من أن أدواته مرنة بما يكفي لمواصلة الاستفادة مع استمرار كلا الاتجاهين.
الأسئلة الشائعة
أنتجت نسخة داخلية من Astra، عائلة النماذج القادمة من OpenAI، نتائج جديدة لعشر مسائل في الرياضيات وعلوم الحاسوب النظرية كانت عالقة منذ عقد على الأقل، تمتد عبر نظرية الزمر، وجبريات فون نويمان، والهندسة عالية الأبعاد، والتعقيد الكمي، والتشفير الشبكي، والتوافقيات القصوى. النتيجة الأبرز هي بناء صريح لزمرة غير سوفيكية (non-sofic group)، وهي مسألة ظلت عالقة منذ عام 1999، ودحض لتخمين Connes للجساءة (Connes's rigidity conjecture). نشرت OpenAI براهين Lean 4 قابلة للتحقق آلياً لجميع النتائج العشر إلى جانب مخطوطة تقنية من 249 صفحة.
لا. لم تخضع أي من النتائج العشر لمراجعة أقران رسمية حتى الآن. ومع ذلك، نُشرت البراهين كشهادات Lean 4 قابلة للتحقق آلياً على GitHub بعدد أخطاء 'sorry' يساوي صفراً، أي أنه لم تُترك أي خطوة في أي برهان مُشكلن دون إثبات — وهو شكل من أشكال التحقق لا يتطلب حكماً بشرياً لتأكيد الصحة المنطقية، حتى قبل مراجعة المجلات العلمية.
Orchard هو إطار عمل مفتوح المصدر من Microsoft Research يفصل بين تدريب وكلاء الذكاء الاصطناعي وتنفيذهم، ويوفر للمطورين خدمة بيئة قابلة لإعادة الاستخدام لتدريب الوكلاء وتقييمهم عبر مجالات مهام مختلفة مثل هندسة البرمجيات، والتصفح على الويب، والمساعدة الشخصية، قبل نشرهم. صُمم لجعل بناء وكلاء قادرين أرخص من خلال السماح للنماذج الأصغر بالتعلم من بيئات مهام واقعية بدلاً من الاعتماد على نماذج أساسية أكبر باستمرار.
يحقق Orchard-SWE، وهو وكيل برمجة تم تدريبه باستخدام إطار عمل Orchard، نتيجة 69.7% على معيار SWE-bench Verified (ترتفع إلى 73.0% مع إعادة الترتيب بنموذج القيمة) باستخدام نحو 3 مليارات معامل نشط فقط — مقترباً من أداء نماذج البرمجة الرائدة التي تستخدم أكثر من عشرة أضعاف عدد المعاملات. هذه الكفاءة مهمة لأنها تخفض التكلفة الحسابية لتدريب وتشغيل وكيل برمجة قادر.
تتوقع Gartner أنه بحلول نهاية عام 2026، ستضم 40% من تطبيقات المؤسسات وكلاء ذكاء اصطناعي مخصصين لمهام محددة، ارتفاعاً من أقل من 5% في عام 2025. الوكيل المخصص لمهمة محددة هو وكيل مبني للتعامل مع عمل محدد من البداية إلى النهاية — مثل وكيل للأمن السيبراني يراقب حركة الشبكة ويبادر بالاستجابة — وليس مساعداً عام الغرض. يعكس هذا التوقع تحول الوكلاء إلى ميزة قياسية داخل برمجيات الأعمال القائمة، وليس مجرد منتجات مستقلة.
ليس بشكل مباشر — تُظهر نتائج Astra الرياضية تحسناً في الاستدلال الرسمي، وهي قدرة مختلفة عن تنفيذ سير عمل تجاري متعدد الخطوات. لكن تحسينات الاستدلال الأساسية التي تمكّن نموذجاً من بناء برهان رياضي دقيق تميل أيضاً إلى تحسين قدرة الوكيل على التخطيط، والتحقق من عمله الخاص، واكتشاف الأخطاء في المهام المهيكلة متعددة الخطوات، وهو أمر ذو صلة مباشرة بموثوقية الأتمتة.
يحدث التدريب في بيئة خاضعة للتحكم يمارس فيها الوكيل مهمة بشكل متكرر ويتم تصحيحه — وهذا ما تركز عليه أطر عمل مثل Orchard. أما النشر (أو التنفيذ) فهو تشغيل ذلك الوكيل المدرَّب في مهام حقيقية وحية في الإنتاج، غالباً عبر بيئة تشغيل مثل Codex أو منصة بدون كود. فصل الاثنين، كما يفعل Orchard، يعني أن بإمكان الفريق تحسين أو إعادة تدريب مهارات الوكيل دون الحاجة إلى لمس أو تعريض نظام الإنتاج الذي يعمل فيه في النهاية للخطر.
تتسرب الأبحاث الرائدة مثل Astra وOrchard إلى النماذج الأساسية والتقنيات التي تُبنى عليها المنصات بدون كود — لست بحاجة إلى إعادة إنتاجها بنفسك. تتيح منصات مثل FlowHunt للفرق تركيب وكلاء ذكاء اصطناعي إنتاجيين من كتل جاهزة مسبقاً، وربطهم بمصادر بيانات وأدوات حقيقية، بحيث تظهر فوائد الاستدلال الأفضل والتدريب الأكثر كفاءة كأداء أفضل للوكيل دون الحاجة إلى فريق تعلم آلي داخلي.
ياشا مطور برمجيات موهوب متخصص في بايثون وجافا وتعلم الآلة. يكتب ياشا مقالات تقنية عن الذكاء الاصطناعي، وهندسة البرومبت، وتطوير روبوتات الدردشة.
ياشا بوروماند
المدير التقني، FlowHunt
حوّل أبحاث الذكاء الاصطناعي الرائدة إلى أتمتة عاملة فعلياً
لست بحاجة إلى مختبر أبحاث للاستفادة من أحدث اختراقات الاستدلال والوكلاء. يتيح لك FlowHunt بناء وكلاء ذكاء اصطناعي إنتاجيين فوق أحدث النماذج — دون الحاجة إلى أي برمجة.
لماذا لا تستطيع OpenAI تبرير تقييمها البالغ 500 مليار دولار – وكيف تتفوق Anthropic في السوق الوحيد المهم للذكاء الاصطناعي
يواجه تقييم OpenAI البالغ 500 مليار دولار تدقيقًا مع تزايد قوة النماذج مفتوحة المصدر وتساوي فرص المنافسة في مجال الذكاء الاصطناعي. اكتشف كيف تتفوق استراتيجية An...
مستعرض أطلس من OpenAI: تصفح الويب بالذكاء الاصطناعي العامل
اكتشف مستعرض أطلس الجديد من OpenAI، وكيف يحدث ثورة في أتمتة الويب بالذكاء الاصطناعي، وما يعنيه ذلك لمستقبل تطبيقات الذكاء الاصطناعي العامل وسير العمل الإنتاجي....
16 دقيقة قراءة
AI
Automation
+3
الموافقة على ملفات تعريف الارتباط نستخدم ملفات تعريف الارتباط لتعزيز تجربة التصفح وتحليل حركة المرور لدينا. See our privacy policy.