OpenAI logo

OpenAI

GPT-5.5

FrontierAvailable in FlowHunt

GPT-5.5 是一款顶级前沿 AI 模型,由 OpenAI 开发并于 2026 年 4 月发布。这是一个专有封闭权重模型,可通过 OpenAI API 使用。其 100 万 token 的上下文窗口足以容纳整个代码库、长篇技术文档或扩展的智能体会话而无需截断。

在 FlowHunt AI 排行榜上,它是 24 个被追踪模型之一,已在 6 项基准测试上经过评估。突出成绩:Terminal-Bench 82.7%(8 个模型中排名第 1);SWE-bench Verified 88.7%(13 个模型中排名第 2);GPQA Diamond 93.6%(14 个模型中排名第 2)。

GPT-5.5 由 OpenAI 于 2026 年 4 月 23 日发布,是 GPT-5 的迭代优化版本。发布时,它在 GPQA Diamond 上以 93.6% 的成绩与 Claude Opus 4.6 持平,并在 Terminal-Bench 上取得了所有已测模型中的最高分——82.7%——这反映了其在自主系统管理、Shell 脚本编写和 DevOps 自动化方面的特别优势。OpenAI 将 GPT-5.5 定位为其 API 中的主要通用模型,并成为大多数用户使用 ChatGPT 的默认模型。它还在 SWE-bench Pro 上获得了 68.4%,在 SWE-bench Verified 上获得了 88.7%,使其跻身全球前三的编程模型之列。

注:Fable 5 之前最高的 SWE-bench Verified 分数。OpenAI 最佳 Terminal-Bench 分数。

发布时间
2026 年 4 月
上下文窗口
100 万 token
权重
封闭
层级
Frontier
提供商
OpenAI

GPT-5.5 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified88.7%2 of 13SRReal GitHub issue resolution (500 verified issues)
SWE-bench Pro58.6%7 of 9SRMulti-language, standardised scaffold
GPQA Diamond93.6%2 of 14SRGraduate-level Google-proof science Q&A
Terminal-Bench82.7%1 of 8SRAgentic Linux terminal task completion
HLE41.4%3 of 6SRHumanity's Last Exam (50+ STEM disciplines)
AA Intelligence Index60.2 pts2 of 9AAArtificial Analysis composite score (independent)

Detailed Benchmark Scores

SWE-V SR
88.7%
Real GitHub issue resolution (500 verified issues)
SWE-Pro SR
58.6%
Multi-language, standardised scaffold
GPQA ◇ SR
93.6%
Graduate-level Google-proof science Q&A
Terminal SR
82.7%
Agentic Linux terminal task completion
HLE SR
41.4%
Humanity's Last Exam (50+ STEM disciplines)
AA Idx AA
60.2 pts
Artificial Analysis composite score (independent)

GPT-5.5 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkGPT-5.5Claude Opus 4.8Claude Opus 4.7
SWE-V88.7%88.6%87.6%
SWE-Pro58.6%69.2%64.3%
GPQA ◇93.6%93.6%94.2%
Terminal82.7%74.6%66.1%
HLE41.4%
AA Idx60.2 pts61.4 pts57.3 pts

About OpenAI

OpenAI Founded 2015 · San Francisco, CA
Website →

OpenAI于2015年12月由Sam Altman、Elon Musk、Greg Brockman、Ilya Sutskever、John Schulman和Wojciech Zaremba共同创立,最初是一家非营利性AI研究实验室,其使命是开发造福全人类的人工通用智能(AGI)。2019年,它创建了利润上限子公司OpenAI LP,以筹集机构资本并扩大模型训练规模。该公司以GPT系列语言模型(GPT-1至GPT-5.5)、DALL-E图像生成系列、Whisper语音识别和Sora视频生成而闻名。OpenAI运营ChatGPT消费者应用程序、开发者API,并通过Microsoft Azure提供企业服务。截至2026年,它与微软保持着密切的战略合作伙伴关系,微软是该公司最大的投资者和云服务提供商。

使用场景

GPT-5.5 适合做什么

软件工程
科学与技术推理
智能体 CLI 自动化
长文档与代码库分析

Strengths & Limitations

Strengths

  • 强大的软件工程能力——SWE-bench Verified 88%
  • 研究生级别的科学推理能力——GPQA Diamond 93%
  • 智能体 Linux / CLI 自动化——Terminal-Bench 82%
  • 综合智能——AA Intelligence Index 60 分(独立验证)
  • 超长文档与大型代码库处理(100 万上下文)

Limitations

  • 封闭权重——无法自行托管或在私有数据上微调

浏览完整 AI 模型排行榜

常见问题

了解更多

GPT-5 — 基准测试、能力与应用场景
GPT-5 — 基准测试、能力与应用场景

GPT-5 — 基准测试、能力与应用场景

GPT-5 是 OpenAI 开发的专有 AI 模型,属于 Frontier 层级,拥有 40 万 Token 的上下文窗口。可直接在 FlowHunt 中使用。了解基准测试分数、优势及推荐应用场景。...

2 分钟阅读
GPT-5.4 — 基准测试、能力与用例
GPT-5.4 — 基准测试、能力与用例

GPT-5.4 — 基准测试、能力与用例

GPT-5.4 是 OpenAI 的专有 AI 模型,属于 Frontier 级别,拥有 100 万 token 的上下文窗口。可直接在 FlowHunt 中使用。了解基准测试分数、优势与推荐用例。...

2 分钟阅读
GPT-4.1 — 基准测试、能力与使用场景
GPT-4.1 — 基准测试、能力与使用场景

GPT-4.1 — 基准测试、能力与使用场景

GPT-4.1 是 OpenAI 推出的专有 AI 模型,属于高级(Advanced)层级,拥有 100 万 token 的上下文窗口。现可直接在 FlowHunt 中使用。了解其基准测试分数、优势及推荐使用场景。...

2 分钟阅读