
为什么强化学习胜出:AI模型微调的演进与OpenPipe故事
通过OpenPipe的发展历程及其被CoreWeave收购的故事,探讨强化学习和微调如何成为优化AI模型的主流方法,从GPT-4蒸馏到开源模型的崛起。...
OpenAI的Astra模型刚刚用可机器验证的证明解决了十个悬而未决数十年的数学难题,微软则开源了Orchard——一个能以远低于常规成本训练AI智能体的框架。这两件事对正在构建自动化的团队意味着什么?
2026年8月第一周的两则新闻,共同讲述了一个关于AI走向的更大故事。OpenAI让其下一代模型Astra的一个内部版本,去挑战十个悬而未决十年乃至更久的数学与理论计算机科学问题——结果它为全部十个问题都给出了可机器验证的证明,而算力成本大约只有2000美元。几天后,微软研究院开源了Orchard,这是一个通过将智能体的学习方式与其最终在生产环境中的运行方式分离开来、从而大幅降低训练一个能力合格的AI智能体成本的框架。这两则新闻都不是关于聊天机器人换了一身新皮肤。它们讲的都是构建能推理、能行动的AI系统时,底层的成本与能力曲线——而这恰恰决定了下一代AI智能体究竟能有多好、又能有多便宜。
8月1日,OpenAI发布了一项引人瞩目的成果:Astra的一个内部版本已经为纯数学和理论计算机科学领域十个悬而未决的问题给出了新结果,其中几个已经悬而未决超过二十年。最引人注目的成果是首次显式构造出一个非可索菲克群——这一问题自Mikhail Gromov在1999年提出可索菲克性概念以来就悬而未决。Astra还通过构造出无穷多个共享同一个冯·诺依曼代数、但彼此不同构的群,推翻了Connes刚性猜想,并证明了Ehrhart体积猜想。这些结果横跨群论、高维几何、量子复杂性、格密码学和极值组合数学——这些领域通常不会与语言模型出现在同一句话里。
真正让这件事区别于一般"AI解决了难题"式新闻标题的,是验证方式。OpenAI并非只是发布结论——它以Apache 2.0许可在GitHub上发布了全部十项结果的可机器验证Lean 4证明证书,并附带一份249页的技术手稿。该代码仓库的"sorry"计数为零,意味着所有形式化证明中没有任何一步是未经证明或含糊带过的。这与模型仅仅"声称"自己解决了某个问题,标准截然不同:一个Lean证明要么能通过类型检查,要么不能,这与你是否信任产出它的模型无关。据报道,菲尔兹奖得主Timothy Gowers表示,他会毫不犹豫地推荐其中一篇证明发表在顶级期刊上——不过需要明确的是,这十项结果目前实际上都还没有真正完成同行评审。
把这条新闻归入"令人惊叹但与我的业务无关"未免过于草率,这其实是一个误判。Astra所展现出的能力——持续的、多步骤的形式化推理,其中任何一步出错都会让整个结果失效——从结构上看,与让AI智能体能够可靠完成一项漫长业务工作流所需的能力是一回事。一个处理保险理赔、核对一批发票,或起草法律文件的智能体,做的其实是同一件事的更小、更朴素的版本:沿着一长串步骤走下去,其中任何一个早期错误都会不断累积——这正是你在任何一份为生产环境打造的真实的AI智能体案例清单中都能看到的模式。在249页的数学证明中能明显更擅长发现自身错误的模型,往往也会更擅长在一个十二步的自动化流程中发现错误。这项数学成果是一个极端但可验证的边界案例,预示着每一个下游智能体的推理天花板正在走向何方。
FlowHunt让您能够在最新模型之上构建多步骤AI智能体——无需研究团队,无需基础设施,只需可用的自动化。
如果说Astra展示的是推理能力能走多远,那么微软的Orchard发布展示的则是构建一个能力合格的智能体能有多便宜。Orchard是微软研究院推出的一个开源框架,它有意将智能体训练与智能体执行分离开来——开发者不再是一味用越来越大的基础模型去硬啃某项任务,而是使用Orchard Env这一可复用的环境服务,在贴近真实场景的任务模拟中训练更小的智能体,然后才让它们接触生产系统。同一套基础设施同时支持软件工程智能体、网页导航智能体和个人助理智能体,训练完成后可直接对接Codex、OpenClaw和ZeroClaw等真实部署框架。
真正值得关注的是效率数字,这一点的重要性,和你在挑选技术栈时比较各类AI智能体框架的成本效率时所看重的东西是一样的。Orchard-SWE是用该框架训练出的一个编程智能体,在SWE-bench Verified——一个被广泛使用、用于评估真实软件工程任务的基准测试——上取得69.7%的成绩,配合价值模型重排序后提升至73.0%,而它仅使用了约30亿激活参数。这只是它在性能上正在逼近的那些前沿编程模型规模的一小部分。微软团队的做法是:先从更大的模型中蒸馏出约10.7万条任务轨迹,再应用他们称之为"信用分配监督微调"的方法——即便是没有完全成功的轨迹,也能从中学到有用信号——之后再进行强化学习。
Orchard背后的架构选择——将智能体能力的训练与其在生产环境中的运行分离开来——映射出一个不仅对机器学习研究者、对任何构建自动化的人都至关重要的区分。一个为特定行业任务打造的垂直AI智能体并不需要在方方面面都拥有一个更大的"大脑";它需要的是针对它实际将要面对的那一小部分决策进行的专项训练,而这正是Orchard式训练环境相比一味扩大通用模型规模更划算的地方。无论你是从零训练一个模型,还是在配置一个无代码智能体,同样的逻辑都成立:针对真实任务进行的窄而明确的训练,始终胜过向一个并非为此设计的问题投喂更多通用能力。
这也解释了为什么开源这一框架、而不只是发布基准测试数字,才是微软这次发布中更具深远影响的部分。一个任何人都可以用来在自己的任务环境中训练智能代理的框架,其价值会不断累积——每一个采用它并分享改进的团队,都会让下一个团队构建智能体的成本更低,这与开源软件在过去二十年里蚕食基础设施市场的动力是同一种逻辑。
再放远一点看,这两则新闻都印证了Gartner关于企业采用速度的一项预测:到2026年底,40%的企业应用程序将内嵌面向特定任务的AI智能体,而2025年这一比例还不到5%。一年之内实现八倍增长,是一个相当激进的预测,而像Astra这样的成果和像Orchard这样的框架,恰恰就是让这一预测变得可信所需要的那种底层能力与成本转变——更便宜的训练让为更窄任务构建智能体变得经济可行,更强的推理则让这些更窄的智能体值得真正被部署和信任。
Gartner的定义十分具体,值得牢记:一个面向特定任务的智能体,是专为处理一项明确的端到端工作而构建的智能体——他们给出的例子是一个能实时扫描网络流量、系统日志和用户行为、并主动发起自身响应的网络安全智能体。这与"这款应用里有个聊天机器人"完全不是一个层次。这正是AI功能与AI员工之间的区别,也正是将一个通用助手与一个从头到尾可靠完成同一件事的正统研究助手区分开来的那条界线。
无论是Astra还是Orchard,都不是大多数企业会直接接触到的东西——你不会去在Lean证明上微调一个模型,也不会自己搭建一套Orchard训练流水线。真正重要的是那些会渗透下来的东西。前沿推理能力的提升,最终会抬高每一个下游模型能可靠做到的事情的上限,其中也包括那些已经在为无代码自动化平台提供支持的模型。更便宜、更高效的训练技术,最终会降低建立在这些模型之上的专用智能体的成本。这两则新闻都不会改变你这个季度该构建什么——但它们相当可靠地预示着,下一个季度会有哪些事情变得可能、又变得可负担。真正务实的做法不是去追逐研究本身,而是把自动化构建在一个足够灵活、能够自动吸收底层模型改进的AI智能体平台之上——这与我们几周前报道Claude Cowork及其竞品如何重塑智能体格局时所强调的是同一种直觉。
如果你正在考虑,在底层模型不断改进的同时,应该先自动化什么,最稳妥的起点是那些范围小、定义明确、又易于核验的任务——这正是Orchard的训练方式之所以有效的相同特质。关键词研究、文档摘要和结构化数据提取之所以是常见的起点,正是因为成功与否容易核实、失败的代价也很低。随着推理能力提升、训练效率提高,同样的原则也能扩展到更雄心勃勃、运行时间更长的工作流——但一切都要从选择一个你能快速、低成本判断智能体是否真正做对了的任务开始。
2026年8月开局的这两则发布,表面上看毫不相关——一个是模型解决了悬而未决数十年的数学难题,另一个是面向编程智能体的训练框架。但在表象之下,它们其实指向同一股力量:推理能力究竟能被推向多远,以及这种推理能力转化为一个可用智能体的成本究竟能有多低。Astra表明这个天花板仍在不断上升。Orchard表明,触及这个天花板中有用那一部分所需的成本正在迅速下降。两者放在一起,都是让人相信Gartner那个激进的采用预测比乍看之下更可信的好理由——也是任何一支构建自动化的团队,都该确保自己的工具足够灵活、能持续从这两股趋势中获益的好理由。
Yasha 是一位才华横溢的软件开发者,专攻 Python、Java 以及机器学习。Yasha 撰写关于人工智能、提示工程和聊天机器人开发的技术文章。

您不需要拥有一支研究团队,也能从最新的推理与智能体突破中获益。FlowHunt让您无需编写代码,即可在最新模型之上构建生产级AI智能体。

通过OpenPipe的发展历程及其被CoreWeave收购的故事,探讨强化学习和微调如何成为优化AI模型的主流方法,从GPT-4蒸馏到开源模型的崛起。...

2025年关于多智能体AI的争论已经结束。Anthropic、Cognition和OpenAI都汇聚到了orchestrator + 隔离子智能体这一模式。本文揭示2026年研究的最新结论、多智能体何时真正胜过单智能体,以及如何在FlowHunt中无需写代码即可构建。...

探索 OpenAI O1 的高级推理能力和强化学习如何在 RAG 准确率上超越 GPT4o,并附有基准测试与成本分析。
Cookie 同意
我们使用 cookie 来增强您的浏览体验并分析我们的流量。 See our privacy policy.