
GPT-4.1 — ベンチマーク、機能、およびユースケース
GPT-4.1はOpenAIのプロプライエタリAIモデルで、Advancedレベルの100万トークン対応コンテキストウィンドウを備えています。FlowHuntで直接利用可能です。ベンチマークスコア、強み、推奨されるユースケースをご覧ください。...
GPT-4oは、OpenAIが開発し2024年5月にリリースされた、実績のあるAIモデルで、現在も多くの本番システムで広く利用されています。これはプロプライエタリなクローズドウェイトモデルであり、OpenAI APIを通じて利用可能です。128Kトークンのコンテキストウィンドウをサポートし、ほとんどのドキュメントやマルチターンアプリケーションに十分対応できます。
FlowHunt AIリーダーボードでは、追跡対象の24モデルのうちの1つであり、3つのベンチマークで評価されています。主なスコア:MMLU-Pro 72.6%(8モデル中6位)、GPQA Diamond 53.6%(14モデル中12位)、SWE-bench Verified 33.2%(13モデル中13位)。
GPT-4o(「オムニ」)は、2024年5月13日にOpenAI初のネイティブ・マルチモーダルモデルとしてリリースされました。テキスト、画像、音声を専用サブモデルにルーティングするのではなく、単一のアーキテクチャで処理します。4oの「o」は「omni」(万能)を意味し、その統一アーキテクチャを反映しています。GPT-4oのリアルタイム音声モードは、2024年後半にリリースされ、初めて人間のような会話レイテンシを実現し、音声AI製品の波を引き起こしました。2024年を通じてChatGPTを動かすデフォルトモデルとなり、初代ビジョン対応エージェントの構築に使用されました。2026年現在、Established層に位置しており — 高度な推論ベンチマークではGPT-5シリーズに大きく劣るものの — コスト重視の高ボリューム・マルチモーダルアプリケーションでは今なお人気があります。
注記:初の旗艦マルチモーダルモデル。広く展開されたベースライン。
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 33.2% | 13 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| GPQA Diamond | 53.6% | 12 of 14 | SR | Graduate-level Google-proof science Q&A |
| MMLU-Pro | 72.6% | 6 of 8 | SR | Hard knowledge reasoning, 12K questions |
Head-to-head benchmark comparison with other Established-tier models. Higher is better for all metrics.
| Benchmark | GPT-4o | Llama 4 Maverick | Llama 4 Scout |
|---|---|---|---|
| SWE-V | 33.2% | — | — |
| GPQA ◇ | 53.6% | 69.8% | — |
| MMLU-P | 72.6% | 80.5% | 52.2% |
OpenAIは、2015年12月にSam Altman氏、Elon Musk氏、Greg Brockman氏、Ilya Sutskever氏、John Schulman氏、Wojciech Zaremba氏によって非営利AI研究機関として設立され、全人類に利益をもたらす人工汎用知能(AGI)の開発を使命としています。2019年には利益上限付き子会社OpenAI LPを設立し、機関投資家からの資金調達とモデルトレーニングの大規模化を実現しました。同社はGPTシリーズの言語モデル(GPT-1からGPT-5.5)、DALL-E画像生成シリーズ、Whisper音声認識、Sora動画生成で知られています。OpenAIは消費者向けアプリケーションChatGPT、開発者向けAPI、およびMicrosoft Azureを通じたエンタープライズサービスを運営しています。2026年現在、同社は最大の投資家兼クラウドプロバイダーであるMicrosoftとの緊密な戦略的パートナーシップを維持しています。
ユースケース
GPT-4oはSWE-bench Verifiedで33%を達成 — ここで追跡されている13モデル中13位。一般的な開発タスクにおいてコード生成、バグ修正、コードレビューを処理できますが、最先端モデルは完全自律型の複雑なエンジニアリングでは大幅に高いスコアを記録しています。
GPT-4oはGPQA Diamondで53%(14モデル中12位)を達成。一般的な科学的Q&Aを確実なレベルで処理できますが、最先端モデルは最も難しい大学院レベルの問題で25ポイント以上高いスコアを記録しています。
比較するなら

GPT-4.1はOpenAIのプロプライエタリAIモデルで、Advancedレベルの100万トークン対応コンテキストウィンドウを備えています。FlowHuntで直接利用可能です。ベンチマークスコア、強み、推奨されるユースケースをご覧ください。...

GPT-5は、OpenAIが開発したプロプライエタリなAIモデルで、400Kトークンのコンテキストウィンドウを持つFrontier層に分類されます。FlowHuntで直接利用可能です。ベンチマークスコア、強み、推奨ユースケースをご紹介します。...

GPT-5.4はOpenAIが開発したプロプライエタリなAIモデルで、フロンティア層に分類され、100万トークンのコンテキストウィンドウを備えています。FlowHuntで直接利用可能です。ベンチマークスコア、強み、推奨ユースケースをご確認ください。...