
Claude Opus 4.8 — Benchmarks, Mogelijkheden en Gebruiksscenario's
Claude Opus 4.8 is een eigen AI-model van Anthropic, geclassificeerd als Frontier-niveau met een contextvenster van 1M tokens. Ontdek benchmarkscores, sterke pu...
Claude Opus 4.6 is een top-tier frontier AI-model, ontwikkeld door Anthropic en uitgebracht in februari 2026. Het is een eigen gesloten-weight-model, beschikbaar via de Anthropic API. Het contextvenster van 1M tokens is groot genoeg om volledige codebases, uitgebreide technische documenten of langdurige agentische sessies zonder truncatie te verwerken.
Op het FlowHunt AI Leaderboard is het een van de 24 gevolgde modellen, geëvalueerd op 6 benchmarks. Opvallende scores: 69,2% op ARC-AGI-2 (#1 van 3); 53,0% op HLE (#1 van 6); 80,8% op SWE-bench Verified (#5 van 13).
Claude Opus 4.6 werd uitgebracht op 5 februari 2026 en kreeg bijzondere aandacht vanwege zijn prestaties op het gebied van nieuwe visuele redeneertaken. Het heeft de hoogste publiekelijk geverifieerde score op ARC-AGI-2 met 69,17% — een benchmark voor abstracte visuele patroonherkenning, onafhankelijk geverifieerd door de ARC Prize Foundation en specifiek ontworpen om memorisatie te voorkomen. Dit resultaat plaatste Opus 4.6 boven de ongeveer 60% menselijke baseline op een test waar eerdere frontier-modellen moeite mee hadden om te overtreffen. Het behaalde ook 91,3% op GPQA Diamond en 53,0% op Humanity’s Last Exam, waarmee het in de eerste helft van 2026 het leidende model was voor moeilijke redeneertaken.
Opmerking: SOTA ARC-AGI-2 69,17% (3P ARC Prize). ASL-3 veiligheidsclassificatie.
Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.
| Benchmark | Score | Rank | Source | What it measures |
|---|---|---|---|---|
| SWE-bench Verified | 80.8% | 5 of 13 | SR | Real GitHub issue resolution (500 verified issues) |
| SWE-bench Pro | 57.3% | 8 of 9 | SR | Multi-language, standardised scaffold |
| GPQA Diamond | 91.3% | 5 of 14 | SR | Graduate-level Google-proof science Q&A |
| Terminal-Bench | 65.4% | 7 of 8 | SR | Agentic Linux terminal task completion |
| ARC-AGI-2 | 69.2% | 1 of 3 | 3P | Novel visual reasoning, no memorisation |
| HLE | 53.0% | 1 of 6 | SR | Humanity's Last Exam (50+ STEM disciplines) |
Head-to-head benchmark comparison with other Frontier-tier models. Higher is better for all metrics.
Anthropic is een AI-veiligheidsbedrijf dat in 2021 werd opgericht door voormalige OpenAI-onderzoekers Dario Amodei en Daniela Amodei, samen met een groep collega's die leiding hadden gegeven aan de veiligheids- en beleidsteams van OpenAI. De aangegeven missie van het bedrijf is de verantwoorde ontwikkeling van AI voor het welzijn van de mensheid op de lange termijn, en haar onderzoeksagenda wordt bepaald door die toewijding: Constitutionele AI (CAI), een techniek voor het trainen van modellen om behulpzaam, onschadelijk en eerlijk te zijn via zelfkritiek; mechanistische interpreteerbaarheid, die tot doel heeft te achterhalen wat individuele neuronen en circuits in grote netwerken daadwerkelijk berekenen; en schaalwetenschap, die probeert te voorspellen hoe modelgedrag verandert met rekenkracht en data. Anthropic publiceert dit onderzoek openlijk en is een van de meest geciteerde AI-veiligheidslaboratoria in de academische literatuur geworden. Claude is de openbare modellenfamilie van Anthropic — genoemd naar Claude Shannon, de grondlegger van de informatietheorie — en omvat vier generaties (1 tot en met 4.x/Fable 5). Anthropic heeft een commerciële API en het consumentengerichte Claude.ai-product, en onderhoudt diepe cloudpartnerschappen met AWS (Amazon Bedrock) en Google Cloud (Vertex AI).
Gebruiksscenario's
Claude Opus 4.6 scoort 80% op SWE-bench Verified — gerangschikt op #5 van de 13 hier gevolgde modellen. Het lost echte GitHub-problemen op, schrijft productiekwaliteitcode in meerdere talen en verwerkt meerstaps agentische codeworkflows — een sterke keuze voor AI-ondersteunde softwareontwikkelingsteams.
Met 91% op GPQA Diamond (#5 van 14 modellen) overtreft Claude Opus 4.6 de ~65% menselijke PhD-expert-baseline op afgestudeerd niveau voor biologie-, chemie- en natuurkundevragen. Gebruik het voor synthese van wetenschappelijke literatuur, hypothesetoetsing, medische en juridische Q&A, en multidisciplinaire onderzoekstaken waar diepgaande domeinkennis van belang is.
Claude Opus 4.6 behaalt 65% op Terminal-Bench (#7 van 8 modellen), waardoor het geschikt is voor veelvoorkomende shell-scripting, command-line-workflows en lichte systeembeheertaken in agentische pijplijnen.
Met een contextvenster van 1M tokens kan Claude Opus 4.6 volledige softwarerepository's, lange juridische contracten, onderzoeksrapporten van boeklengte of uitgebreide gespreksgeschiedenissen in één prompt verwerken — wat diepgaande document-Q&A, cross-file codebase-redenering en uitgebreide samenvatting mogelijk maakt zonder chunking-heuristieken of RAG-pijplijnen.
Meer om te vergelijken
Vergelijk alle 24 modellen op 11 benchmarks — sorteerbaar, met bronvermelding en bijgewerkt tot juni 2026.

Claude Opus 4.8 is een eigen AI-model van Anthropic, geclassificeerd als Frontier-niveau met een contextvenster van 1M tokens. Ontdek benchmarkscores, sterke pu...

Claude Opus 4.7 is een eigen AI-model van Anthropic, geclassificeerd als Frontier-niveau met een contextvenster van 1M tokens. Ontdek benchmarkscores, sterke pu...

Claude Sonnet 4.6 is een propriëtair AI-model van Anthropic, geclassificeerd als gevorderd niveau met een contextvenster van 1M tokens. Het is direct beschikbaa...
Cookie Toestemming
We gebruiken cookies om uw browse-ervaring te verbeteren en ons verkeer te analyseren. See our privacy policy.