OpenAI logo

OpenAI

GPT-4o

EstablishedAvailable in FlowHunt

GPT-4o 是 OpenAI 开发的一款久经考验的 AI 模型,于 2024 年 5 月发布,目前仍广泛部署于生产系统中。它是一个专有的闭源权重模型,可通过 OpenAI API 访问,支持 128K token 的上下文窗口,足以应对大多数文档及多轮交互应用。

在 FlowHunt AI 排行榜上,它是 24 个跟踪模型之一,在 3 项基准测试中获得了评估。突出成绩:MMLU-Pro 得分 72.6%(8 个模型中排名第 6);GPQA Diamond 得分 53.6%(14 个模型中排名第 12);SWE-bench Verified 得分 33.2%(13 个模型中排名第 13)。

GPT-4o(‘omni’)于 2024 年 5 月 13 日发布,是 OpenAI 首个原生多模态模型——文本、图像和音频由单一架构处理,而非通过专门子模型进行路由。4o 中的 ‘o’ 代表 omni,体现了统一架构的设计理念。GPT-4o 的实时语音模式于 2024 年下半年推出,首次实现了类人对话延迟,并引发了一波语音 AI 产品浪潮。它在整个 2024 年成为驱动 ChatGPT 的默认模型,并用于构建第一代具备视觉能力的 AI 代理。到 2026 年,它处于 Established 层级——在硬推理基准上已被 GPT-5 系列明显超越——但在对成本敏感、高吞吐量的多模态应用中仍然广受欢迎。

注:最初旗舰多模态模型。广泛部署的基准模型。

发布时间
2024 年 5 月
上下文窗口
128K tokens
权重
闭源
层级
Established
提供商
OpenAI

GPT-4o Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified33.2%13 of 13SRReal GitHub issue resolution (500 verified issues)
GPQA Diamond53.6%12 of 14SRGraduate-level Google-proof science Q&A
MMLU-Pro72.6%6 of 8SRHard knowledge reasoning, 12K questions

Detailed Benchmark Scores

SWE-V SR
33.2%
Real GitHub issue resolution (500 verified issues)
GPQA ◇ SR
53.6%
Graduate-level Google-proof science Q&A
MMLU-P SR
72.6%
Hard knowledge reasoning, 12K questions

GPT-4o vs. Established Peers

Head-to-head benchmark comparison with other Established-tier models. Higher is better for all metrics.

BenchmarkGPT-4oLlama 4 MaverickLlama 4 Scout
SWE-V33.2%
GPQA ◇53.6%69.8%
MMLU-P72.6%80.5%52.2%

About OpenAI

OpenAI Founded 2015 · San Francisco, CA
Website →

OpenAI于2015年12月由Sam Altman、Elon Musk、Greg Brockman、Ilya Sutskever、John Schulman和Wojciech Zaremba共同创立,最初是一家非营利性AI研究实验室,其使命是开发造福全人类的人工通用智能(AGI)。2019年,它创建了利润上限子公司OpenAI LP,以筹集机构资本并扩大模型训练规模。该公司以GPT系列语言模型(GPT-1至GPT-5.5)、DALL-E图像生成系列、Whisper语音识别和Sora视频生成而闻名。OpenAI运营ChatGPT消费者应用程序、开发者API,并通过Microsoft Azure提供企业服务。截至2026年,它与微软保持着密切的战略合作伙伴关系,微软是该公司最大的投资者和云服务提供商。

应用场景

GPT-4o 的适用场景

软件工程
科学与技术推理

Strengths & Limitations

Strengths

  • 长上下文任务(128K 上下文窗口)

Limitations

  • 低于前沿水平的硬科学推理能力(GPQA 53%——前沿达 90%+)
  • 在自主编码和复杂推理方面显著落后于 2026 年前沿模型
  • 闭源权重——无法自行托管或在私有数据上进行微调

浏览完整 AI 模型排行榜

常见问题

了解更多

GPT-4.1 — 基准测试、能力与使用场景
GPT-4.1 — 基准测试、能力与使用场景

GPT-4.1 — 基准测试、能力与使用场景

GPT-4.1 是 OpenAI 推出的专有 AI 模型,属于高级(Advanced)层级,拥有 100 万 token 的上下文窗口。现可直接在 FlowHunt 中使用。了解其基准测试分数、优势及推荐使用场景。...

2 分钟阅读
GPT-5 — 基准测试、能力与应用场景
GPT-5 — 基准测试、能力与应用场景

GPT-5 — 基准测试、能力与应用场景

GPT-5 是 OpenAI 开发的专有 AI 模型,属于 Frontier 层级,拥有 40 万 Token 的上下文窗口。可直接在 FlowHunt 中使用。了解基准测试分数、优势及推荐应用场景。...

2 分钟阅读
GPT-5.4 — 基准测试、能力与用例
GPT-5.4 — 基准测试、能力与用例

GPT-5.4 — 基准测试、能力与用例

GPT-5.4 是 OpenAI 的专有 AI 模型,属于 Frontier 级别,拥有 100 万 token 的上下文窗口。可直接在 FlowHunt 中使用。了解基准测试分数、优势与推荐用例。...

2 分钟阅读