
GPT-5 — 基准测试、能力与应用场景
GPT-5 是 OpenAI 开发的专有 AI 模型,属于 Frontier 层级,拥有 40 万 Token 的上下文窗口。可直接在 FlowHunt 中使用。了解基准测试分数、优势及推荐应用场景。...
GPT-5.4 是由 OpenAI 开发并于 2026 年 3 月发布的顶级前沿 AI 模型。它是一个专有封闭权重模型,可通过 OpenAI API 使用。100 万 token 的上下文窗口足以容纳整个代码库、长篇技术文档或扩展的智能体会话而无需截断。
在 FlowHunt AI 排行榜上,它是 24 个追踪模型之一,在 1 个基准测试上进行了评估。突出成绩:SWE-bench Pro 上为 59.1%(9 个模型中排名第 5)。
GPT-5.4 于 2026 年 3 月 5 日发布,是 GPT-5 和 GPT-5.5 之间的中间版本。OpenAI 在发布时提供了有限的公开基准数据,但 AA Intelligence Index 独立测评其得分为 56.8 分,稳居 Frontier 级别。GPT-5.4 主要侧重于改进指令遵循、结构化输出可靠性以及多轮对话上下文连贯性,而非原始基准性能。它是为 OpenAI 准备功能更大幅提升的 GPT-5.5 而推出的桥梁版本,并保持了与 GPT-5 的完整 API 向后兼容性。
注:内置计算机使用功能。事实错误比 5.2 版本减少 33%。OSWorld 75%。
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Pro | 59.1% | 5 of 9 | 3P | Multi-language, standardised scaffold |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | GPT-5.4 | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-Pro | 59.1% | 69.2% | 64.3% |
OpenAI于2015年12月由Sam Altman、Elon Musk、Greg Brockman、Ilya Sutskever、John Schulman和Wojciech Zaremba共同创立,最初是一家非营利性AI研究实验室,其使命是开发造福全人类的人工通用智能(AGI)。2019年,它创建了利润上限子公司OpenAI LP,以筹集机构资本并扩大模型训练规模。该公司以GPT系列语言模型(GPT-1至GPT-5.5)、DALL-E图像生成系列、Whisper语音识别和Sora视频生成而闻名。OpenAI运营ChatGPT消费者应用程序、开发者API,并通过Microsoft Azure提供企业服务。截至2026年,它与微软保持着密切的战略合作伙伴关系,微软是该公司最大的投资者和云服务提供商。
用例
凭借 100 万 token 的上下文窗口,GPT-5.4 可以在单次提示中处理整个软件仓库、长篇法律合同、书籍长度的研究报告或大量对话历史——无需分块策略或 RAG 流程即可实现深度文档问答、跨文件代码库推理和全面摘要。
More to Compare

GPT-5 是 OpenAI 开发的专有 AI 模型,属于 Frontier 层级,拥有 40 万 Token 的上下文窗口。可直接在 FlowHunt 中使用。了解基准测试分数、优势及推荐应用场景。...

GPT-5.5 是 OpenAI 专有 AI 模型,属于 Frontier 层级,拥有 100 万 token 的上下文窗口。可直接在 FlowHunt 中使用。探索基准测试分数、优势与推荐使用场景。...

GPT-4.1 是 OpenAI 推出的专有 AI 模型,属于高级(Advanced)层级,拥有 100 万 token 的上下文窗口。现可直接在 FlowHunt 中使用。了解其基准测试分数、优势及推荐使用场景。...
Cookie 同意
我们使用 cookie 来增强您的浏览体验并分析我们的流量。 See our privacy policy.