
GPT-5 — 基准测试、能力与应用场景
GPT-5 是 OpenAI 开发的专有 AI 模型,属于 Frontier 层级,拥有 40 万 Token 的上下文窗口。可直接在 FlowHunt 中使用。了解基准测试分数、优势及推荐应用场景。...
GPT-5.5 是一款顶级前沿 AI 模型,由 OpenAI 开发并于 2026 年 4 月发布。这是一个专有封闭权重模型,可通过 OpenAI API 使用。其 100 万 token 的上下文窗口足以容纳整个代码库、长篇技术文档或扩展的智能体会话而无需截断。
在 FlowHunt AI 排行榜上,它是 24 个被追踪模型之一,已在 6 项基准测试上经过评估。突出成绩:Terminal-Bench 82.7%(8 个模型中排名第 1);SWE-bench Verified 88.7%(13 个模型中排名第 2);GPQA Diamond 93.6%(14 个模型中排名第 2)。
GPT-5.5 由 OpenAI 于 2026 年 4 月 23 日发布,是 GPT-5 的迭代优化版本。发布时,它在 GPQA Diamond 上以 93.6% 的成绩与 Claude Opus 4.6 持平,并在 Terminal-Bench 上取得了所有已测模型中的最高分——82.7%——这反映了其在自主系统管理、Shell 脚本编写和 DevOps 自动化方面的特别优势。OpenAI 将 GPT-5.5 定位为其 API 中的主要通用模型,并成为大多数用户使用 ChatGPT 的默认模型。它还在 SWE-bench Pro 上获得了 68.4%,在 SWE-bench Verified 上获得了 88.7%,使其跻身全球前三的编程模型之列。
注:Fable 5 之前最高的 SWE-bench Verified 分数。OpenAI 最佳 Terminal-Bench 分数。
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 88.7% | 2 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 58.6% | 7 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 93.6% | 2 of 14 | SR | Graduate-level Google-proof science Q&A |
| Terminal-Bench | 82.7% | 1 of 8 | SR | Agentic Linux terminal task completion |
| HLE | 41.4% | 3 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 60.2 pts | 2 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | GPT-5.5 | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 88.7% | 88.6% | 87.6% |
| SWE-Pro | 58.6% | 69.2% | 64.3% |
| GPQA ◇ | 93.6% | 93.6% | 94.2% |
| Terminal | 82.7% | 74.6% | 66.1% |
| HLE | 41.4% | — | — |
| AA Idx | 60.2 pts | 61.4 pts | 57.3 pts |
OpenAI于2015年12月由Sam Altman、Elon Musk、Greg Brockman、Ilya Sutskever、John Schulman和Wojciech Zaremba共同创立,最初是一家非营利性AI研究实验室,其使命是开发造福全人类的人工通用智能(AGI)。2019年,它创建了利润上限子公司OpenAI LP,以筹集机构资本并扩大模型训练规模。该公司以GPT系列语言模型(GPT-1至GPT-5.5)、DALL-E图像生成系列、Whisper语音识别和Sora视频生成而闻名。OpenAI运营ChatGPT消费者应用程序、开发者API,并通过Microsoft Azure提供企业服务。截至2026年,它与微软保持着密切的战略合作伙伴关系,微软是该公司最大的投资者和云服务提供商。
使用场景
GPT-5.5 在 SWE-bench Verified 上获得 88% 的分数——在此追踪的 13 个模型中排名第 2。它能够解决真实的 GitHub 问题,使用多种语言编写生产级代码,并处理多步骤的智能体编程工作流——是 AI 辅助软件开发团队的强力选择。
GPT-5.5 在 GPQA Diamond 上达到 93%(14 个模型中排名第 2),超越了人类博士专家约 65% 的基线水平,涵盖研究生级别的生物学、化学和物理学问题。适用于科学文献综合、假设评估、医学与法律问答,以及需要深厚领域知识的多学科研究任务。
GPT-5.5 在 Terminal-Bench 上获得 82% 的分数(8 个模型中排名第 1),非常适合智能体 DevOps 和基础设施自动化。Terminal-Bench 衡量自主完成 Linux Shell 任务的能力——包括包管理、文件系统操作、进程控制和多步骤系统管理——无需在任务过程中进行人工干预。
凭借 100 万 token 的上下文窗口,GPT-5.5 可以在单次提示中摄入整个软件仓库、长篇法律合同、书籍长度的研究报告或大量对话历史——实现深度文档问答、跨文件代码库推理以及全面的摘要总结,无需分块策略或 RAG 流程。
更多对比

GPT-5 是 OpenAI 开发的专有 AI 模型,属于 Frontier 层级,拥有 40 万 Token 的上下文窗口。可直接在 FlowHunt 中使用。了解基准测试分数、优势及推荐应用场景。...

GPT-5.4 是 OpenAI 的专有 AI 模型,属于 Frontier 级别,拥有 100 万 token 的上下文窗口。可直接在 FlowHunt 中使用。了解基准测试分数、优势与推荐用例。...

GPT-4.1 是 OpenAI 推出的专有 AI 模型,属于高级(Advanced)层级,拥有 100 万 token 的上下文窗口。现可直接在 FlowHunt 中使用。了解其基准测试分数、优势及推荐使用场景。...
Cookie 同意
我们使用 cookie 来增强您的浏览体验并分析我们的流量。 See our privacy policy.