
GPT-5 — Benchmarks, Fähigkeiten und Anwendungsfälle
GPT-5 ist ein proprietäres KI-Modell von OpenAI, das als Frontier-Tier mit einem Kontextfenster von 400K Token eingestuft ist. Es ist direkt in FlowHunt verfügb...
GPT-5.5 ist ein hochmodernes Frontier-KI-Modell, entwickelt von OpenAI und veröffentlicht im April 2026. Es handelt sich um ein proprietäres Closed-Weight-Modell, das über die OpenAI-API verfügbar ist. Das Kontextfenster von 1 Million Token ist groß genug, um gesamte Codebasen, umfangreiche technische Dokumente oder ausgedehnte agentische Sitzungen ohne Kürzung aufzunehmen.
Im FlowHunt KI-Ranking ist es eines von 24 erfassten Modellen, evaluiert in 6 Benchmarks. Herausragende Ergebnisse: 82,7 % im Terminal-Bench (#1 von 8); 88,7 % im SWE-bench Verified (#2 von 13); 93,6 % im GPQA Diamond (#2 von 14).
GPT-5.5 wurde von OpenAI am 23. April 2026 als iterative Weiterentwicklung von GPT-5 veröffentlicht. Zum Start erreichte es 93,6 % im GPQA Diamond – gleichauf mit Claude Opus 4.6 – und erzielte mit 82,7 % den höchsten jemals gemessenen Terminal-Bench-Wert aller Modelle, was eine besondere Stärke in der autonomen Systemadministration, Shell-Scripting und DevOps-Automation widerspiegelt. OpenAI positionierte GPT-5.5 als primäres Allzweckmodell in seiner API, und es wurde zum Standardmodell, das ChatGPT für die meisten Benutzer antreibt. Es erzielte außerdem 68,4 % im SWE-bench Pro und 88,7 % im SWE-bench Verified, was es weltweit unter die drei besten Codierungsmodelle bringt.
Hinweis: Höchster SWE-bench Verified vor Fable 5. Bester OpenAI Terminal-Bench-Wert.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 88.7% | 2 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 58.6% | 7 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 93.6% | 2 of 14 | SR | Graduate-level Google-proof science Q&A |
| Terminal-Bench | 82.7% | 1 of 8 | SR | Agentic Linux terminal task completion |
| HLE | 41.4% | 3 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
| AA Intelligence Index | 60.2 pts | 2 of 9 | AA | Artificial Analysis composite score (independent) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
| Benchmark | GPT-5.5 | Claude Opus 4.8 | Claude Opus 4.7 |
|---|---|---|---|
| SWE-V | 88.7% | 88.6% | 87.6% |
| SWE-Pro | 58.6% | 69.2% | 64.3% |
| GPQA ◇ | 93.6% | 93.6% | 94.2% |
| Terminal | 82.7% | 74.6% | 66.1% |
| HLE | 41.4% | — | — |
| AA Idx | 60.2 pts | 61.4 pts | 57.3 pts |
OpenAI wurde im Dezember 2015 als gemeinnütziges KI-Forschungslabor von Sam Altman, Elon Musk, Greg Brockman, Ilya Sutskever, John Schulman und Wojciech Zaremba mit dem Ziel gegründet, eine künstliche allgemeine Intelligenz (AGI) zu entwickeln, die der gesamten Menschheit zugutekommt. 2019 gründete das Unternehmen eine gewinnbegrenzte Tochtergesellschaft, OpenAI LP, um institutionelles Kapital einzuwerben und das Modelltraining zu skalieren. Das Unternehmen ist bekannt für die GPT-Serie von Sprachmodellen (GPT-1 bis GPT-5.5), die DALL-E-Serie zur Bildgenerierung, Whisper zur Spracherkennung und Sora zur Videogenerierung. OpenAI betreibt die Verbraucheranwendung ChatGPT, eine Entwickler-API und Unternehmensdienste über Microsoft Azure. Seit 2026 unterhält das Unternehmen eine enge strategische Partnerschaft mit Microsoft, dem größten Investor und Cloud-Anbieter des Unternehmens.
Anwendungsfälle
GPT-5.5 erreicht 88 % im SWE-bench Verified — Rang #2 von 13 hier erfassten Modellen. Es löst echte GitHub-Probleme, schreibt produktionsreifen Code in mehreren Sprachen und bewältigt mehrstufige agentische Codierungs-Workflows — eine gute Wahl für KI-gestützte Softwareentwicklungsteams.
Mit 93 % im GPQA Diamond (#2 von 14 Modellen) übertrifft GPT-5.5 die Basislinie menschlicher PhD-Experten von ~65 % bei Biologie-, Chemie- und Physikfragen auf Graduiertenniveau. Nutzen Sie es für die Synthese wissenschaftlicher Literatur, Hypothesenbewertung, medizinische und juristische Frage-Antwort-Szenarien sowie multidisziplinäre Forschungsaufgaben, bei denen tiefes Fachwissen erforderlich ist.
Mit 82 % im Terminal-Bench (#1 von 8 Modellen) eignet sich GPT-5.5 hervorragend für agentische DevOps- und Infrastrukturautomation. Terminal-Bench misst die autonome Durchführung von Linux-Shell-Aufgaben — Paketverwaltung, Dateisystemoperationen, Prozesssteuerung und mehrstufige Systemadministration — ohne menschliche Anleitung während der Aufgabe.
Mit einem Kontextfenster von 1 Million Token kann GPT-5.5 gesamte Softwarerepositorien, lange juristische Verträge, buchlange Forschungsberichte oder umfangreiche Gesprächsverläufe in einer einzigen Anfrage aufnehmen — und ermöglicht so tiefgehende Dokumenten-Frage-Antwort, codebasenübergreifendes Denken und umfassende Zusammenfassung ohne Chunking-Heuristiken oder RAG-Pipelines.
Mehr zum Vergleichen
Vergleichen Sie alle 24 Modelle in 11 Benchmarks — sortierbar, mit Quellenangaben und aktualisiert Juni 2026.

GPT-5 ist ein proprietäres KI-Modell von OpenAI, das als Frontier-Tier mit einem Kontextfenster von 400K Token eingestuft ist. Es ist direkt in FlowHunt verfügb...

GPT-5.4 ist ein proprietäres KI-Modell von OpenAI, das als Frontier-Tier eingestuft wird und über ein Kontextfenster von 1M Token verfügt. Es ist direkt in Flow...

Entdecken Sie ChatGPT-5s bahnbrechende Fortschritte, Anwendungsfälle, Benchmarks, Sicherheit, Preise und zukünftige Entwicklungen in diesem umfassenden FlowHunt...
Cookie-Zustimmung
Wir verwenden Cookies, um Ihr Surferlebnis zu verbessern und unseren Datenverkehr zu analysieren. See our privacy policy.