
GPT-5 — ベンチマーク、性能、ユースケース
GPT-5は、OpenAIが開発したプロプライエタリなAIモデルで、400Kトークンのコンテキストウィンドウを持つFrontier層に分類されます。FlowHuntで直接利用可能です。ベンチマークスコア、強み、推奨ユースケースをご紹介します。...
GPT-5.5は、OpenAIが開発し2026年4月にリリースされた、最上位のフロンティアAIモデルです。プロプライエタリなクローズドウェイトモデルであり、OpenAI APIを通じて利用可能です。100万トークンのコンテキストウィンドウは、コードベース全体、長大な技術文書、または長時間のエージェントセッションを切り詰めることなく保持するのに十分な大きさです。
FlowHunt AI Leaderboardでは、6つのベンチマークで評価された24の追跡モデルのうちの1つです。特筆すべきスコア:Terminal-Bench 82.7%(8モデル中1位)、SWE-bench Verified 88.7%(13モデル中2位)、GPQA Diamond 93.6%(14モデル中2位)。
GPT-5.5は、OpenAIによって2026年4月23日にGPT-5の反復的改良版としてリリースされました。リリース時点では、GPQA DiamondでClaude Opus 4.6と並んで93.6%を記録し、測定された全モデルの中で最高のTerminal-Benchスコア(82.7%)を達成しており、自律的なシステム管理、シェルスクリプティング、DevOps自動化における特に高い強みを示しています。OpenAIはGPT-5.5をAPIにおける主要な汎用モデルとして位置づけ、ChatGPTを利用するほとんどのユーザー向けのデフォルトモデルとなりました。また、SWE-bench Proで68.4%、SWE-bench Verifiedで88.7%を記録し、世界的にトップ3のコーディングモデルに位置しています。
注:Fable 5以前の最高SWE-bench Verifiedスコア。OpenAI最高のTerminal-Benchスコア。
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 88.7% | 2 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 58.6% | 7 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 93.6% | 2 of 14 | SR | Graduate-level Google-proof science Q&A |
| Terminal-Bench | 82.7% | 1 of 8 | SR | Agentic Linux terminal task completion |
| HLE | 41.4% | 3 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 60.2 pts | 2 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | GPT-5.5 | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 88.7% | 88.6% | 87.6% |
| SWE-Pro | 58.6% | 69.2% | 64.3% |
| GPQA ◇ | 93.6% | 93.6% | 94.2% |
| Terminal | 82.7% | 74.6% | 66.1% |
| HLE | 41.4% | — | — |
| AA Idx | 60.2 pts | 61.4 pts | 57.3 pts |
OpenAIは、2015年12月にSam Altman氏、Elon Musk氏、Greg Brockman氏、Ilya Sutskever氏、John Schulman氏、Wojciech Zaremba氏によって非営利AI研究機関として設立され、全人類に利益をもたらす人工汎用知能(AGI)の開発を使命としています。2019年には利益上限付き子会社OpenAI LPを設立し、機関投資家からの資金調達とモデルトレーニングの大規模化を実現しました。同社はGPTシリーズの言語モデル(GPT-1からGPT-5.5)、DALL-E画像生成シリーズ、Whisper音声認識、Sora動画生成で知られています。OpenAIは消費者向けアプリケーションChatGPT、開発者向けAPI、およびMicrosoft Azureを通じたエンタープライズサービスを運営しています。2026年現在、同社は最大の投資家兼クラウドプロバイダーであるMicrosoftとの緊密な戦略的パートナーシップを維持しています。
ユースケース
GPT-5.5はSWE-bench Verifiedで88%を記録 — ここで追跡されている13モデル中2位。実際のGitHub Issueを解決し、複数の言語でプロダクション品質のコードを記述し、マルチステップのエージェント型コーディングワークフローを処理します — AI支援ソフトウェア開発チームにとって強力な選択肢です。
GPQA Diamondで93%(14モデル中2位)を記録したGPT-5.5は、大学院レベルの生物学、化学、物理学の質問において人間の博士号専門家ベースライン(約65%)を上回ります。科学文献の統合、仮説評価、医療・法律Q&A、深いドメイン知識が求められる学際的なリサーチタスクに使用してください。
Terminal-Benchで82%(8モデル中1位)を記録したGPT-5.5は、エージェント型DevOpsおよびインフラ自動化に適しています。Terminal-Benchは、Linuxシェルタスク(パッケージ管理、ファイルシステム操作、プロセス制御、マルチステップのシステム管理)の自律的な完了を、タスク中の人間のガイダンスなしで測定します。
100万トークンのコンテキストウィンドウにより、GPT-5.5はソフトウェアリポジトリ全体、長大な法的契約書、書籍サイズの調査レポート、または広範な会話履歴を単一のプロンプトで取り込むことが可能です。これにより、チャンキングヒューリスティクスやRAGパイプラインを必要とせず、深い文書Q&A、ファイル横断的なコードベース推論、包括的な要約を実現します。
比較対象

GPT-5は、OpenAIが開発したプロプライエタリなAIモデルで、400Kトークンのコンテキストウィンドウを持つFrontier層に分類されます。FlowHuntで直接利用可能です。ベンチマークスコア、強み、推奨ユースケースをご紹介します。...

GPT-5.4はOpenAIが開発したプロプライエタリなAIモデルで、フロンティア層に分類され、100万トークンのコンテキストウィンドウを備えています。FlowHuntで直接利用可能です。ベンチマークスコア、強み、推奨ユースケースをご確認ください。...

ChatGPT-5の革新的な進歩、ユースケース、ベンチマーク、セキュリティ、価格、今後の展望を網羅したFlowHuntの決定版ガイド。...