OpenAI 标志

OpenAI

GPT-5.4

FrontierAvailable in FlowHunt

GPT-5.4 是由 OpenAI 开发并于 2026 年 3 月发布的顶级前沿 AI 模型。它是一个专有封闭权重模型,可通过 OpenAI API 使用。100 万 token 的上下文窗口足以容纳整个代码库、长篇技术文档或扩展的智能体会话而无需截断。

在 FlowHunt AI 排行榜上,它是 24 个追踪模型之一,在 1 个基准测试上进行了评估。突出成绩:SWE-bench Pro 上为 59.1%(9 个模型中排名第 5)。

GPT-5.4 于 2026 年 3 月 5 日发布,是 GPT-5 和 GPT-5.5 之间的中间版本。OpenAI 在发布时提供了有限的公开基准数据,但 AA Intelligence Index 独立测评其得分为 56.8 分,稳居 Frontier 级别。GPT-5.4 主要侧重于改进指令遵循、结构化输出可靠性以及多轮对话上下文连贯性,而非原始基准性能。它是为 OpenAI 准备功能更大幅提升的 GPT-5.5 而推出的桥梁版本,并保持了与 GPT-5 的完整 API 向后兼容性。

注:内置计算机使用功能。事实错误比 5.2 版本减少 33%。OSWorld 75%。

发布日期
2026 年 3 月
上下文
100 万 token
权重
封闭
级别
Frontier
提供商
OpenAI

GPT-5.4 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Pro59.1%5 of 93PMulti-language, standardised scaffold

Detailed Benchmark Scores

SWE-Pro 3P
59.1%
Multi-language, standardised scaffold

GPT-5.4 vs. Frontier Peers

Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.

BenchmarkGPT-5.4Claude Opus 4.8Claude Opus 4.7
SWE-Pro59.1%69.2%64.3%

About OpenAI

OpenAI Founded 2015 · San Francisco, CA
Website →

OpenAI于2015年12月由Sam Altman、Elon Musk、Greg Brockman、Ilya Sutskever、John Schulman和Wojciech Zaremba共同创立,最初是一家非营利性AI研究实验室,其使命是开发造福全人类的人工通用智能(AGI)。2019年,它创建了利润上限子公司OpenAI LP,以筹集机构资本并扩大模型训练规模。该公司以GPT系列语言模型(GPT-1至GPT-5.5)、DALL-E图像生成系列、Whisper语音识别和Sora视频生成而闻名。OpenAI运营ChatGPT消费者应用程序、开发者API,并通过Microsoft Azure提供企业服务。截至2026年,它与微软保持着密切的战略合作伙伴关系,微软是该公司最大的投资者和云服务提供商。

用例

GPT-5.4 适合做什么

长文档与代码库分析

Strengths & Limitations

Strengths

  • 超长文档和大规模代码库(100 万上下文)

Limitations

  • 封闭权重——无法自托管或在私有数据上进行微调

浏览完整 AI 模型排行榜

常见问题

了解更多

GPT-5 — 基准测试、能力与应用场景
GPT-5 — 基准测试、能力与应用场景

GPT-5 — 基准测试、能力与应用场景

GPT-5 是 OpenAI 开发的专有 AI 模型,属于 Frontier 层级,拥有 40 万 Token 的上下文窗口。可直接在 FlowHunt 中使用。了解基准测试分数、优势及推荐应用场景。...

2 分钟阅读
GPT-5.5 — 基准测试、能力与使用场景
GPT-5.5 — 基准测试、能力与使用场景

GPT-5.5 — 基准测试、能力与使用场景

GPT-5.5 是 OpenAI 专有 AI 模型,属于 Frontier 层级,拥有 100 万 token 的上下文窗口。可直接在 FlowHunt 中使用。探索基准测试分数、优势与推荐使用场景。...

3 分钟阅读
GPT-4.1 — 基准测试、能力与使用场景
GPT-4.1 — 基准测试、能力与使用场景

GPT-4.1 — 基准测试、能力与使用场景

GPT-4.1 是 OpenAI 推出的专有 AI 模型,属于高级(Advanced)层级,拥有 100 万 token 的上下文窗口。现可直接在 FlowHunt 中使用。了解其基准测试分数、优势及推荐使用场景。...

2 分钟阅读