Claude
AA Index
De nipte leider in onafhankelijke intelligentie-evaluaties en opvallend sterk bij lang, zelfstandig kenniswerk.
- ✓ Agentisch kenniswerk
- ✓ Complexe codebases
- ✓ Lange opdrachten
Geen merkstrijd, maar een onderbouwde keuze per klus. Vergelijk kwaliteit, snelheid, taakprijs en denkniveau — afgestemd op jouw ontwikkelwerk.
Gebaseerd op onafhankelijke benchmarks, API-prijzen en praktijkverhalen.
Geen enkel model wint alles. Kies eerst wat je ermee wilt doen.
Het verschil met Claude is klein, terwijl snelheid, coding en presentatiekwaliteit samen een sterke dagelijkse mix vormen.
De nipte leider in onafhankelijke intelligentie-evaluaties en opvallend sterk bij lang, zelfstandig kenniswerk.
Bijna dezelfde intelligentie als de leider, maar sneller en goedkoper per zware taak. De huidige coding-koploper.
De snelste werkmodelkeuze voor zeer lange, multimodale context, iteratief codingwerk en diepe Google-integratie.
Nuxt/Vue, Express, FileMaker, end-to-end debugging en uitleg in helder Nederlands.
Snel en goedkoop voor één component, stylingfix of afgebakende route.
Alternatief: Gemini 3.6 Flash bij veel screenshots of context.Sterke coding-agent, goed in ketens volgen en runtimecontracten controleren.
Alternatief: Opus 5 high als het probleem bijzonder grillig is.Geschikt voor lange wijzigingen over UI, sessie, API, FileMaker-layout en tests.
Alternatief: Sol xhigh voor sneller en goedkoper resultaat.Sterke structuur en nuance zonder direct de duurste Opus-laag nodig te hebben.
Alternatief: Terra high voor compactere documentatie.Snelste output en de sterkste gemeten 128k-contextscore in deze selectie.
Alternatief: Opus 5 high voor moeilijkere ontwerpbeslissingen.Sterk met beeld, diagrammen en grote multimodale context.
Alternatief: Sol high voor de aansluitende implementatie.Algemene tekst- en visionmodellen. Losse beeld-, audio- en embeddingmodellen zijn bewust niet vermengd.
| Model | Status | AA-score | API $ in / uit | Context | Denkstanden | Beste inzet |
|---|---|---|---|---|---|---|
| ClaudeOpus 5 | Actueel | 61 | $5 / $25 | 1M | adaptive · low · medium · high · xhigh · max | Zwaar coding- en kenniswerk |
| ClaudeSonnet 5 | Actueel | 53 | $2 / $10 | 1M | uit · adaptive · low · medium · high · xhigh · max | Dagelijks agentwerk |
| ClaudeFable 5 | Specialist | 60 | $10 / $50 | 1M+ | adaptive · max + fallback | Langste autonome projecten |
| ClaudeHaiku 4.5 | Actueel | — | $1 / $5 | 200k | extended thinking | Snelle subtaken en volume |
| ClaudeOpus 4.8 | Vorige generatie | 56 | $5 / $25 | 1M | low · medium · high · xhigh · max | Bewezen workhorse |
| GPT-5.6Sol | Actueel | 59 | $5 / $30 | 1,05M | none · low · medium · high · xhigh · max | Coding, ontwerp en agents |
| GPT-5.6Terra | Actueel | 55 | $2.5 / $15 | 1,05M | none · low · medium · high · xhigh · max | Gebalanceerd dagelijks werk |
| GPT-5.6Luna | Actueel | 51 | $1 / $6 | 1,05M | none · low · medium · high · xhigh · max | Volume, subtaken en scouting |
| GPT-5.5Instant | Chatmodel | — | Productprijs | Product | automatisch | Snel alledaags gesprek |
| Gemini3.6 Flash | Actueel | 50 | $1.5 / $7.5 | 1M | minimal · low · medium · high | Multimodaal, snel, lange context |
| Gemini3.5 Flash-Lite | Actueel | 36 | $0.3 / $2.5 | 1M | minimal · low · medium · high | Hoog volume en classificatie |
| Gemini3.5 Flash | Vervangen | 50 | $1.5 / $9 | 1M | minimal · low · medium · high | Gebruik nu 3.6 Flash |
| Gemini3.1 Pro | Vorige generatie | 46 | $2 / $12 | 1M | low · medium · high | Diep multimodaal redeneren |
API-prijzen zijn per 1M tokens. Sonnet 5 gebruikt tot en met 31 augustus 2026 de introductieprijs van $2 / $10. De denkgrafiek toont alleen onafhankelijk gemeten standen.
AA Intelligence Index. Dezelfde tokenprijs per model, maar hogere standen gebruiken doorgaans meer redeneertokens en verhogen dus de taakprijs en wachttijd.
Schakel tussen meetlatten. Een streepje is eerlijker dan een verzonnen vergelijking.
51 punten voor circa $0,21 per indextaak.
59 punten voor $1,04; één derde van Fable.
242 tok/s, 1M context en beeld, audio en video.
ⓘ Onafhankelijke samengestelde score, actuele topmodellen.
Zelfde tests en harnas, gepubliceerd bij Gemini 3.6 Flash.
| Benchmark | Gemini 3.6 | GPT Luna | Claude Sonnet 5 | Wat meet dit? |
|---|---|---|---|---|
| SWE-Bench Pro | 58,7% | 62,7% | 63,2% | Diverse echte code-issues |
| DeepSWE 1.1 | 49% | 67% | 54% | Langdurig softwarewerk |
| Terminal-Bench 2.1 | 78,0% | 84,7% | 80,4% | Terminal en systeemwerk |
| GDPval-AA v2 | 1421 | 1584 | 1607 | Economisch kenniswerk |
| OSWorld-Verified | 83,0% | 72,6% | 81,2% | Computerbediening |
| CharXiv | 85,2% | 82,7% | 77,0% | Grafieken en figuren lezen |
| MRCR 128k | 91,8% | 74,8% | 71,6% | Informatie uit lange context |
De dagmeting houdt Opus 5 op 61 punten, gevolgd door GPT-5.6 Sol op 59 en Gemini 3.6 Flash op 50.
Lees de bron ↗De nieuwe Opus evenaart Fable-klasse intelligentie tegen een lagere taakprijs en leidt op agentisch kenniswerk.
Lees de bron ↗Sol, Terra en Luna richten zich op verschillende verhoudingen tussen maximale kwaliteit, snelheid en kosten.
Lees de bron ↗Anthropic herstelde de toegang met aangescherpte beveiligingsfilters en automatische terugval naar een ander model.
Lees de bron ↗Googles actuele werkmodel haalt circa 242 outputtokens per seconde, met 1M context en prijzen van $1,50 in en $7,50 uit.
Lees de bron ↗Momentopnames uit communities — anekdotisch, niet hetzelfde als een benchmark.
Acht uur gewerkt en maar ongeveer vijf procent van mijn weeklimiet gebruikt — sterk, maar reacties over snelheid en limieten blijven gemengd.Claude-community · Opus 5 · jul 2026“
In een middelgrote codebase vond Sol meerdere kritieke problemen die ik kon valideren en eerder niet had gezien.ChatGPT-community · GPT-5.6 · jul 2026“
Een codebase van 48k tokens ging erin en ruim 55k outputtokens kwamen compleet terug — zonder afgebroken bestanden.Gemini-community · 3.1 Pro · feb 2026
De hoofdscore komt uit de onafhankelijke Artificial Analysis Intelligence Index v4.1, die negen evaluaties voor redeneren, kennis, coding, agents en instructievolging bundelt. Producentbenchmarks tonen we alleen met datum en modelversie.
Uitkomsten veranderen door redeneerstand, hulpmiddelen, prompt, prijs en productomgeving. Test daarom altijd een eigen representatieve taak voordat je een abonnement of API-keuze vastlegt.
Laatste volledige datacheck: 28 juli 2026. Prijzen, contextvensters, beschikbare denkstanden en actuele kopgroepscores zijn opnieuw gecontroleerd.