Anthropic logo

Anthropic

Claude Sonnet 4.6

AdvancedAvailable in FlowHunt

Claude Sonnet 4.6 is een geavanceerd AI-model, geschikt voor veeleisende productieworkloads, ontwikkeld door Anthropic en uitgebracht in februari 2026. Het is een propriëtair closed-weight model, beschikbaar via de Anthropic API. Het contextvenster van 1M tokens is groot genoeg om volledige codebases, uitgebreide technische documenten of langdurige agentische sessies zonder afkapping te verwerken.

Op het FlowHunt AI Leaderboard is het een van de 24 gevolgde modellen, geëvalueerd op 4 benchmarks. Opvallende scores: 89,0% op MATH-500 (#2 van 4); 58,3% op ARC-AGI-2 (#2 van 3); 79,6% op SWE-bench Verified (#8 van 13).

Claude Sonnet 4.6 werd uitgebracht op 17 februari 2026 als het middensegmentmodel in de Claude 4-generatie, gepositioneerd tussen de Opus-serie en de Haiku-lijn qua zowel capaciteit als prijs. Het Sonnet-segment heeft historisch gezien de beste prijs-prestatieverhouding in Anthropic’s aanbod geboden — krachtig genoeg voor de overgrote meerderheid van codeer- en redeneertaken tegen ongeveer een vijfde van de Opus-prijs. Sonnet 4.6 scoorde 58,3% op ARC-AGI-2 (onafhankelijk geverifieerd door de ARC Prize Foundation), waarmee het bij uitgave de op een na hoogste score wereldwijd op die benchmark behaalde. Het ondersteunt hetzelfde contextvenster van 1M tokens als de Opus-modellen.

Opmerking: Best-in-class finance agent (63,3%) en MCP-Atlas (61,3%). Adaptief denken.

Uitgebracht
Februari 2026
Context
1M tokens
Gewichten
Gesloten
Niveau
Gevorderd
Aanbieder
Anthropic

Claude Sonnet 4.6 Benchmark Rankings

Rank among all 24 models tracked on this leaderboard. SR = self-reported · 3P / AA / C = independently verified.

BenchmarkScoreRankSourceWhat it measures
SWE-bench Verified79.6%8 of 13SRReal GitHub issue resolution (500 verified issues)
Terminal-Bench59.1%8 of 8SRAgentic Linux terminal task completion
MATH-50089.0%2 of 4SRHendrycks math (500 problems)
ARC-AGI-258.3%2 of 33PNovel visual reasoning, no memorisation

Detailed Benchmark Scores

SWE-V SR
79.6%
Real GitHub issue resolution (500 verified issues)
Terminal SR
59.1%
Agentic Linux terminal task completion
MATH SR
89.0%
Hendrycks math (500 problems)
ARC-2 3P
58.3%
Novel visual reasoning, no memorisation

Claude Sonnet 4.6 vs. Advanced Peers

Head-to-head benchmark comparison with other Advanced-tier models. Higher is better for all metrics.

BenchmarkClaude Sonnet 4.6GPT-4.1DeepSeek V4-Flash
SWE-V79.6%54.6%79.0%
Terminal59.1%
MATH89.0%
ARC-258.3%

About Anthropic

Anthropic Founded 2021 · San Francisco, CA
Website →

Anthropic is een AI-veiligheidsbedrijf dat in 2021 werd opgericht door voormalige OpenAI-onderzoekers Dario Amodei en Daniela Amodei, samen met een groep collega's die leiding hadden gegeven aan de veiligheids- en beleidsteams van OpenAI. De aangegeven missie van het bedrijf is de verantwoorde ontwikkeling van AI voor het welzijn van de mensheid op de lange termijn, en haar onderzoeksagenda wordt bepaald door die toewijding: Constitutionele AI (CAI), een techniek voor het trainen van modellen om behulpzaam, onschadelijk en eerlijk te zijn via zelfkritiek; mechanistische interpreteerbaarheid, die tot doel heeft te achterhalen wat individuele neuronen en circuits in grote netwerken daadwerkelijk berekenen; en schaalwetenschap, die probeert te voorspellen hoe modelgedrag verandert met rekenkracht en data. Anthropic publiceert dit onderzoek openlijk en is een van de meest geciteerde AI-veiligheidslaboratoria in de academische literatuur geworden. Claude is de openbare modellenfamilie van Anthropic — genoemd naar Claude Shannon, de grondlegger van de informatietheorie — en omvat vier generaties (1 tot en met 4.x/Fable 5). Anthropic heeft een commerciële API en het consumentengerichte Claude.ai-product, en onderhoudt diepe cloudpartnerschappen met AWS (Amazon Bedrock) en Google Cloud (Vertex AI).

Gebruiksscenario's

Waarvoor u Claude Sonnet 4.6 kunt gebruiken

Software-engineering
Agentische CLI-automatisering
Lange documenten en codebase-analyse

Strengths & Limitations

Strengths

  • Sterke software-engineering — 79% SWE-bench Verified
  • Innovatief visueel redeneren — 58% ARC-AGI-2 (onafhankelijk geverifieerd)
  • Geavanceerde wiskunde — 89% MATH-500
  • Zeer lange documenten en grote codebases (1M context)

Limitations

  • Closed-weight — kan niet zelf worden gehost of worden gefinetuned op privégegevens

Bekijk het volledige AI Model Leaderboard

Veelgestelde vragen

Meer informatie