OpenAI logo

OpenAI

GPT-4.1

AdvancedAvailable in FlowHunt

GPT-4.1 是 OpenAI 开发并于 2025 年 4 月发布的一款高级 AI 模型,适用于对性能要求严苛的生产工作负载。它是一款专有的闭源权重模型,可通过 OpenAI API 使用。其 100 万 token 的上下文窗口足以容纳整个代码库、长篇技术文档或长时间的代理会话而无需截断。

在 FlowHunt AI 排行榜上,它是 24 个被跟踪模型之一,在 1 项基准测试上进行了评估。突出成绩:SWE-bench Verified 54.6%(13 个模型中排名第 12)。

GPT-4.1 于 2025 年 4 月 14 日发布,是 OpenAI 为 API 优化的模型,衔接了 GPT-4o 系列与 GPT-5。它并非追求基准测试分数的最大化,而是针对生产环境的可靠性进行了调优:更一致的函数调用、在长对话中更好地遵循指令,以及 100 万 token 的上下文窗口——使其成为首个能够在单次提示中容纳整个软件仓库的 OpenAI 模型。在 GPT-5 发布之前,许多长文档和基于 RAG 的应用都围绕 GPT-4.1 稳定的 API 构建,并且对于更看重 100 万上下文能力且预算低于 GPT-5 系列的工作负载,它仍在使用中。

注:面向开发者;长上下文(IFEval 87.4%)和指令跟随能力突出。

发布日期
2025 年 4 月
上下文窗口
100 万 token
权重
闭源
层级
高级
提供商
OpenAI

GPT-4.1 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified54.6%12 of 13SRReal GitHub issue resolution (500 verified issues)

Detailed Benchmark Scores

SWE-V SR
54.6%
Real GitHub issue resolution (500 verified issues)

GPT-4.1 vs. Advanced Peers

Head-to-head benchmark comparison with other Advanced-tier models. Higher is better for all metrics.

BenchmarkGPT-4.1Claude Sonnet 4.6DeepSeek V4-Flash
SWE-V54.6%79.6%79.0%

About OpenAI

OpenAI Founded 2015 · San Francisco, CA
Website →

OpenAI于2015年12月由Sam Altman、Elon Musk、Greg Brockman、Ilya Sutskever、John Schulman和Wojciech Zaremba共同创立,最初是一家非营利性AI研究实验室,其使命是开发造福全人类的人工通用智能(AGI)。2019年,它创建了利润上限子公司OpenAI LP,以筹集机构资本并扩大模型训练规模。该公司以GPT系列语言模型(GPT-1至GPT-5.5)、DALL-E图像生成系列、Whisper语音识别和Sora视频生成而闻名。OpenAI运营ChatGPT消费者应用程序、开发者API,并通过Microsoft Azure提供企业服务。截至2026年,它与微软保持着密切的战略合作伙伴关系,微软是该公司最大的投资者和云服务提供商。

使用场景

GPT-4.1 适合做什么

软件工程
长文档与代码库分析

Strengths & Limitations

Strengths

  • 可靠的编码辅助——SWE-bench Verified 54%
  • 超长文档和大型代码库处理(100 万上下文)

Limitations

  • 闭源权重——无法自行托管或在私有数据上进行微调

浏览完整 AI 模型排行榜

常见问题

了解更多

GPT-5.4 — 基准测试、能力与用例
GPT-5.4 — 基准测试、能力与用例

GPT-5.4 — 基准测试、能力与用例

GPT-5.4 是 OpenAI 的专有 AI 模型,属于 Frontier 级别,拥有 100 万 token 的上下文窗口。可直接在 FlowHunt 中使用。了解基准测试分数、优势与推荐用例。...

2 分钟阅读
GPT-5 — 基准测试、能力与应用场景
GPT-5 — 基准测试、能力与应用场景

GPT-5 — 基准测试、能力与应用场景

GPT-5 是 OpenAI 开发的专有 AI 模型,属于 Frontier 层级,拥有 40 万 Token 的上下文窗口。可直接在 FlowHunt 中使用。了解基准测试分数、优势及推荐应用场景。...

2 分钟阅读
GPT-4o — 基准测试、能力与应用场景
GPT-4o — 基准测试、能力与应用场景

GPT-4o — 基准测试、能力与应用场景

GPT-4o 是 OpenAI 推出的专有 AI 模型,属于 Established 层级,拥有 128K token 上下文窗口,可直接在 FlowHunt 中使用。了解其基准评分、优势及推荐使用场景。...

2 分钟阅读