GitHubBook a demoStart routing
AA

Claude Opus 4.8

Azure AIChat200K context· released 2026-05-28Floating alias

azure_ai/claude-opus-4-8

Prices as of 2026-07-14 · rev 179affb· unknown is shown as unknown, never $0.00

Strongest atReasoning · Mathematics · Code & agentictop-quartile among comparable models scored on these domains
Value position90th pctile GPQA11 cheaper models match or beat it on GPQA — see the value chart
Data confidence5/5 exactbenchmarks measured on this exact model · prices 2026-07-14
Cost / request$0.01751K in · 500 out
Input / M$5.00
Output / M$25.00
Cache read / M$0.50
Context200K200,000 tokens
Max output128K128,000 tokens

Capability fingerprint

independent benchmarks, grouped by domain · higher is better · not our measurement

Reasoning

GPQA Diamondgraduate-level science reasoning
88%90th pctile
exact modeloptimized runEpoch evaluations · Claude Opus 4.8
SimpleBencheveryday reasoning (unsaturated)
58%85th pctile
exact modelhttps://lmcouncil.ai/benchmarks · Claude Opus 4.8

Mathematics

AIME (OTIS mock)olympiad math
98%96th pctile
exact modeloptimized runEpoch evaluations · Claude Opus 4.8

Code & agentic

WeirdMLnovel out-of-distribution ML coding
83%97th pctile
exact modelhttps://htihle.github.io/weirdml.html · Claude Opus 4.8

Factuality

SimpleQAfactual accuracy (higher = fewer hallucinations)
40%52nd pctile
exact modelEpoch evaluations · Claude Opus 4.8

peer median  ·  percentile ranks this model among distinct comparable models (deduped — one entry per model, not per provider) scored on that benchmark  ·  exact model / family proxy per row.

Source: Epoch AI — “AI Benchmarking Hub” (epoch.ai), CC-BY (Epoch AI). Some rows carry an upstream leaderboard (shown per row); Aider & Terminal-Bench are additionally Apache-2.0. Each benchmark measures a different thing on a different scale — rows are not comparable across domains, and a score is not a guarantee of quality on your task.

Capabilities Index

Epoch AI's cross-model capability re-fit · one comparable axis · not our measurement
158.0ECI
96th percentile of 150 modelsexact model
84.0111.4138.7166.1Epoch Capabilities Index (relative re-fit scale)peer median 139.7: 158.0 (95% CI 155.6–160.1)158.0

The dot is Claude Opus 4.8; the whisker is its 95% CI; the firm tick is the peer median; faint ticks are every other scored model. Unlike a raw benchmark, the ECI axis is comparable across models — but it's a relative re-fit scale, so a model's exact position can shift when Epoch recomputes it.

Model facts · Epoch AI, confident confidence

Developer
Anthropic
First published
2026-05-28
Access
API access

Source: Epoch AI — Capabilities Index & Notable-Models data (epoch.ai), CC-BY (Epoch AI). The ECI is Epoch's index, not TokenTriage's; per-fact confidence labels are Epoch's own.

Human preference (LMArena)

blind pairwise human votes · Elo · style-controlled · not a correctness score
exact modelmeasured on claude-opus-4-8statistically tied with 12 models overall
1065123714081580Arena score (Elo · higher = more often preferred)Overallpeer median 1357Overall: 1474 (95% CI 1469–1479)1474#22 · 33K votesCodingpeer median 1400Coding: 1528 (95% CI 1521–1536)1528#12 · 9.4K votesHard promptspeer median 1370Hard prompts: 1505 (95% CI 1499–1511)1505#12 · 22K votes

Each dot is Claude Opus 4.8's Arena score in that category; the whisker is the 95% CI; the firm tick is the peer median across distinct models; faint ticks are the field. This is human preference — which answer people pick in a blind A/B — not a correctness or capability score, and adjacent ranks routinely overlap within their intervals.

Source: LMArena (LMArena Leaderboard (lmarena.ai) — lmarena-ai/leaderboard-dataset on Hugging Face, CC BY 4.0.). Ratings are the style-controlled estimates (length/formatting confound removed), as of 2026-07-27.

Cost vs quality

where Claude Opus 4.8 sits among GPQA-scored models
cheaper & higher-scoring0%25%50%75%100%$0.00001$0.0001$0.001$0.01$0.1$1$10$100$1KCost per request · 1K in / 500 out (log)GPQA DiamondClaude 3.7 Sonnet — 73% GPQA · $0.0105/reqClaude 3 Haiku — 15% GPQA · $0.000875/reqClaude 3 Opus — 30% GPQA · $0.0525/reqClaude Haiku 4.5 — 62% GPQA · $0.0035/reqClaude Haiku 4.5 — 62% GPQA · $0.0035/reqClaude Opus 4.1 — 70% GPQA · $0.0525/reqClaude Opus 4.1 — 70% GPQA · $0.0525/reqClaude Opus 4 — 68% GPQA · $0.0525/reqClaude Opus 4.5 — 81% GPQA · $0.0175/reqClaude Opus 4.5 — 81% GPQA · $0.0175/reqClaude Opus 4.6 — 87% GPQA · $0.0175/reqClaude Opus 4.6 — 87% GPQA · $0.0175/reqClaude Opus 4.7 — 87% GPQA · $0.0175/reqClaude Opus 4.7 — 87% GPQA · $0.0175/reqClaude Opus 4.8 — 88% GPQA · $0.0175/reqClaude Sonnet 4 — 72% GPQA · $0.0105/reqClaude Sonnet 4.5 — 76% GPQA · $0.0105/reqClaude Sonnet 4.5 — 76% GPQA · $0.0105/reqClaude Sonnet 4.6 — 83% GPQA · $0.0105/reqClaude Sonnet 5 — 87% GPQA · $0.007/reqLlama 2 70b Chat HF — 2% GPQA · $0.0015/reqMeta Llama 3 70B Instruct — 21% GPQA · $0.0015/reqMeta Llama 3 8B Instruct — 1% GPQA · $0.000225/reqMixtral 8x7B Instruct — 7% GPQA · $0.000225/reqGPT 4o — 32% GPQA · $0.00825/reqGPT 4o — 31% GPQA · $0.00825/reqGPT 4o Mini — 17% GPQA · $0.000495/reqGPT 5 — 82% GPQA · $0.006875/reqGPT 5 Mini — 67% GPQA · $0.001375/reqGPT 5 Nano — 59% GPQA · $0.000275/reqGPT 5.1 — 84% GPQA · $0.00688/reqGPT 5.4 — 91% GPQA · $0.011/reqGPT 5.4 — 91% GPQA · $0.011/reqGPT 5.5 — 92% GPQA · $0.022/reqGPT 5.5 — 92% GPQA · $0.022/reqGPT 5.6 Luna — 89% GPQA · $0.0044/reqGPT 5.6 Sol — 91% GPQA · $0.022/reqGPT 5.6 Terra — 91% GPQA · $0.011/reqO1 — 69% GPQA · $0.0495/reqO1 Mini — 50% GPQA · $0.00363/reqO1 Preview — 34% GPQA · $0.0495/reqO3 Mini — 69% GPQA · $0.00363/reqGPT 4o — 32% GPQA · $0.0075/reqGPT 4o — 31% GPQA · $0.0075/reqGPT 4o Mini — 17% GPQA · $0.00045/reqGPT 4o — 32% GPQA · $0.0075/reqGPT 4o — 31% GPQA · $0.0075/reqGPT 5.1 — 84% GPQA · $0.00625/reqGPT 3.5 Turbo — 4% GPQA · $0.00125/reqGPT 3.5 Turbo 0125 — 3% GPQA · $0.00125/reqGPT 35 Turbo — 4% GPQA · $0.00125/reqGPT 35 Turbo 0125 — 3% GPQA · $0.00125/reqGPT 35 Turbo 1106 — 4% GPQA · $0.002/reqGPT 4 — 8% GPQA · $0.06/reqGPT 4.0125 Preview — 8% GPQA · $0.025/reqGPT 4.0613 — 8% GPQA · $0.06/reqGPT 4.1106 Preview — 8% GPQA · $0.025/reqGPT 4 Turbo — 29% GPQA · $0.025/reqGPT 4 Turbo — 29% GPQA · $0.025/reqGPT 4.1 — 56% GPQA · $0.006/reqGPT 4.1 — 56% GPQA · $0.006/reqGPT 4.1 Mini — 54% GPQA · $0.0012/reqGPT 4.1 Mini — 54% GPQA · $0.0012/reqGPT 4.1 Nano — 32% GPQA · $0.0003/reqGPT 4.1 Nano — 32% GPQA · $0.0003/reqGPT 4.5 Preview — 58% GPQA · $0.15/reqGPT 4o — 31% GPQA · $0.0075/reqGPT 4o — 32% GPQA · $0.0125/reqGPT 4o — 32% GPQA · $0.0075/reqGPT 4o — 31% GPQA · $0.00825/reqGPT 4o Mini — 17% GPQA · $0.000495/reqGPT 4o Mini — 17% GPQA · $0.000495/reqGPT 5 — 82% GPQA · $0.00625/reqGPT 5 — 82% GPQA · $0.00625/reqGPT 5 Mini — 67% GPQA · $0.00125/reqGPT 5 Mini — 67% GPQA · $0.00125/reqGPT 5 Nano — 59% GPQA · $0.00025/reqGPT 5 Nano — 59% GPQA · $0.00025/reqGPT 5.1 — 84% GPQA · $0.00625/reqGPT 5.1 — 84% GPQA · $0.00625/reqGPT 5.2 — 89% GPQA · $0.00875/reqGPT 5.2 — 89% GPQA · $0.00875/reqGPT 5.4 — 91% GPQA · $0.01/reqGPT 5.4 — 91% GPQA · $0.01/reqGPT 5.4 Mini — 78% GPQA · $0.003/reqGPT 5.4 Mini — 78% GPQA · $0.003/reqGPT 5.4 Nano — 71% GPQA · $0.000825/reqGPT 5.4 Nano — 71% GPQA · $0.000825/reqGPT 5.4 Pro — 93% GPQA · $0.12/reqGPT 5.4 Pro — 93% GPQA · $0.12/reqGPT 5.5 — 92% GPQA · $0.02/reqGPT 5.5 — 92% GPQA · $0.02/reqGPT 5.6 Luna — 89% GPQA · $0.004/reqGPT 5.6 Sol — 91% GPQA · $0.02/reqGPT 5.6 Terra — 91% GPQA · $0.01/reqMistral Large 2402 — 18% GPQA · $0.02/reqMistral Large Latest — 35% GPQA · $0.02/reqO1 — 69% GPQA · $0.045/reqO1 — 69% GPQA · $0.045/reqO1 Mini — 50% GPQA · $0.00363/reqO1 Mini — 50% GPQA · $0.0033/reqO1 Preview — 69% GPQA · $0.045/reqO1 Preview — 34% GPQA · $0.045/reqO3 — 76% GPQA · $0.006/reqO3 — 76% GPQA · $0.006/reqO3 Mini — 69% GPQA · $0.0033/reqO3 Mini — 69% GPQA · $0.0033/reqO4 Mini — 73% GPQA · $0.0033/reqO4 Mini — 73% GPQA · $0.0033/reqGPT 4.1 — 56% GPQA · $0.0066/reqGPT 4.1 Mini — 54% GPQA · $0.00132/reqGPT 4.1 Nano — 32% GPQA · $0.00033/reqGPT 4o — 32% GPQA · $0.00825/reqGPT 4o — 31% GPQA · $0.00825/reqGPT 4o Mini — 17% GPQA · $0.000495/reqGPT 5 — 82% GPQA · $0.006875/reqGPT 5 Mini — 67% GPQA · $0.001375/reqGPT 5 Nano — 59% GPQA · $0.000275/reqGPT 5.1 — 84% GPQA · $0.00688/reqGPT 5.4 — 91% GPQA · $0.011/reqGPT 5.4 — 91% GPQA · $0.011/reqGPT 5.5 — 92% GPQA · $0.022/reqGPT 5.5 — 92% GPQA · $0.022/reqGPT 5.6 Luna — 89% GPQA · $0.0044/reqGPT 5.6 Sol — 91% GPQA · $0.022/reqGPT 5.6 Terra — 91% GPQA · $0.011/reqO1 — 69% GPQA · $0.0495/reqO1 Mini — 50% GPQA · $0.00363/reqO1 Preview — 34% GPQA · $0.0495/reqO3 — 76% GPQA · $0.0066/reqO3 Mini — 69% GPQA · $0.00363/reqO4 Mini — 73% GPQA · $0.00363/reqClaude Haiku 4.5 — 62% GPQA · $0.0035/reqClaude Opus 4.1 — 70% GPQA · $0.0525/reqClaude Opus 4.5 — 81% GPQA · $0.0175/reqClaude Opus 4.6 — 87% GPQA · $0.0175/reqClaude Opus 4.7 — 87% GPQA · $0.0175/reqClaude Sonnet 4.5 — 76% GPQA · $0.0105/reqClaude Sonnet 4.6 — 83% GPQA · $0.0105/reqClaude Sonnet 5 — 87% GPQA · $0.007/reqDeepseek R1 — 62% GPQA · $0.00405/reqDeepseek — 42% GPQA · $0.00342/reqDeepseek v3 0324 — 57% GPQA · $0.00342/reqDeepseek V4 Pro — 86% GPQA · $0.00348/reqGPT 5.4 — 91% GPQA · $0.01/reqGPT 5.4 — 91% GPQA · $0.01/reqGPT 5.4 Mini — 78% GPQA · $0.003/reqGPT 5.4 Mini — 78% GPQA · $0.003/reqGPT 5.4 Nano — 71% GPQA · $0.000825/reqGPT 5.4 Nano — 71% GPQA · $0.000825/reqGPT 5.4 Pro — 93% GPQA · $0.12/reqGPT 5.4 Pro — 93% GPQA · $0.12/reqGPT 5.5 — 92% GPQA · $0.02/reqGPT 5.5 — 92% GPQA · $0.02/reqGPT Oss 120b — 68% GPQA · $0.00045/reqGrok 4 — 83% GPQA · $0.0105/reqKimi K2.6 — 88% GPQA · $0.00295/reqLlama 3.2 90B Vision Instruct — 21% GPQA · $0.00306/reqLlama 3.3 70B Instruct — 30% GPQA · $0.001065/reqLlama 4 Maverick 17B 128E Instruct Fp8 — 56% GPQA · $0.001585/reqLlama 4 Scout 17B 16E Instruct — 36% GPQA · $0.00059/reqMeta Llama 3 70B Instruct — 21% GPQA · $0.001285/reqMistral Large — 35% GPQA · $0.01/reqMistral Large 2407 — 32% GPQA · $0.005/reqMistral Large Latest — 35% GPQA · $0.005/reqMistral Medium 2505 — 46% GPQA · $0.0014/reqMistral Small — 30% GPQA · $0.0025/reqMistral Small 2503 — 30% GPQA · $0.00025/reqPhi 3 Medium 128k Instruct — 3% GPQA · $0.00051/reqPhi 4 — 41% GPQA · $0.000375/reqGPT 3.5 Turbo Instruct 0914 — 4% GPQA · $0.0025/reqGPT 35 Turbo Instruct — 4% GPQA · $0.0025/reqGPT 35 Turbo Instruct 0914 — 4% GPQA · $0.0025/reqDeepseek v3 0324 — 57% GPQA · $0.001155/reqGPT Oss 120b — 68% GPQA · $0.00035/reqGlm 4.7 — 78% GPQA · $0.0017/reqGlm 5 — 84% GPQA · $0.002525/reqGPT Oss 120b — 68% GPQA · $0.000725/reqLlama 3.3 70b — 30% GPQA · $0.00145/reqLlama3.1 70b — 26% GPQA · $0.0009/reqLlama3.1 8b — 1% GPQA · $0.00015/reqLlama 4 Scout 17b 16e Instruct — 36% GPQA · $0.000695/reqKimi K2.6 — 88% GPQA · $0.00295/reqKimi K2.7 Code — 86% GPQA · $0.00295/reqGPT Oss 120b — 68% GPQA · $0.000725/reqGlm 5.2 — 89% GPQA · $0.0036/reqDeepseek R1 0528 — 68% GPQA · $0.0065/reqDeepseek v3 0324 — 57% GPQA · $0.00225/reqLlama 3.3 70B Instruct — 30% GPQA · $0.0003/reqGPT Oss 120b — 68% GPQA · $0.0012/reqQwen Max — 41% GPQA · $0.0048/reqClaude 3.7 Sonnet Latest — 73% GPQA · $0.01155/reqDeepseek R1 — 62% GPQA · $0.0019/reqDeepseek R1 0528 — 68% GPQA · $0.001575/reqDeepseek — 42% GPQA · $0.000825/reqDeepseek v3 0324 — 57% GPQA · $0.00069/reqGemini 2.0 Flash 001 — 52% GPQA · $0.0003/reqGemini 2.5 Pro — 80% GPQA · $0.00625/reqGemma 3 27b It — 32% GPQA · $0.00017/reqLlama 3.3 70B Instruct — 30% GPQA · $0.00043/reqLlama 4 Maverick 17B 128E Instruct Fp8 — 56% GPQA · $0.00045/reqLlama 4 Scout 17B 16E Instruct — 36% GPQA · $0.00023/reqMeta Llama 3 8B Instruct — 1% GPQA · $0.00006/reqPhi 4 — 41% GPQA · $0.00014/reqMixtral 8x7B Instruct — 7% GPQA · $0.0006/reqGPT Oss 120b — 68% GPQA · $0.000275/reqQwen2.5 72B Instruct — 32% GPQA · $0.000315/reqQwen3 235B A22b — 61% GPQA · $0.00045/reqQwen3 235B A22b Thinking 2507 — 73% GPQA · $0.00175/reqDeepseek Reasoner — 78% GPQA · $0.00049/reqDeepseek V4 Pro — 86% GPQA · $0.00087/reqDeepseek R1 — 62% GPQA · $0.001645/reqDeepseek Reasoner — 78% GPQA · $0.00049/reqDeepseek — 42% GPQA · $0.00082/reqDeepseek V4 Pro — 86% GPQA · $0.00087/reqDeepseek R1 — 62% GPQA · $0.007/reqDeepseek R1 0528 — 68% GPQA · $0.007/reqDeepseek — 42% GPQA · $0.00135/reqDeepseek v3 0324 — 57% GPQA · $0.00135/reqDeepseek V4 Pro — 86% GPQA · $0.00348/reqGemma 3 27b It — 32% GPQA · $0.00135/reqGemma2 9b It — 3% GPQA · $0.0003/reqGPT Oss 120b — 68% GPQA · $0.00045/reqKimi K2p5 — 83% GPQA · $0.0021/reqQwen2 72b Instruct — 21% GPQA · $0.00135/reqQwen3 235b A22b — 61% GPQA · $0.00066/reqQwen3 235b A22b Thinking 2507 — 73% GPQA · $0.00066/reqYi 34b Chat — 0% GPQA · $0.00135/reqDeepseek V4 Pro — 86% GPQA · $0.00348/reqGPT Oss 120b — 68% GPQA · $0.00045/reqKimi K2p5 — 83% GPQA · $0.0021/reqGemini 2.0 Flash 001 — 52% GPQA · $0.0003/reqGemini 2.5 Pro — 80% GPQA · $0.00625/reqGemini 3 Flash Preview — 78% GPQA · $0.002/reqGemini 3 Pro Preview — 90% GPQA · $0.008/reqGemini 3.1 Pro Preview — 92% GPQA · $0.008/reqGemini 3.5 Flash — 90% GPQA · $0.006/reqClaude Opus 4 — 68% GPQA · $0.0525/reqClaude Opus 4.5 — 81% GPQA · $0.0175/reqClaude Sonnet 4 — 72% GPQA · $0.0105/reqClaude Sonnet 4.5 — 76% GPQA · $0.0105/reqDeepseek v3 0324 — 57% GPQA · $0.00072/reqGemini 3 Flash Preview — 78% GPQA · $0.002/reqGemini 3 Pro Preview — 90% GPQA · $0.008/reqGPT 4o — 31% GPQA · $0.0075/reqGPT 4o Mini — 17% GPQA · $0.00045/reqGPT 5 — 82% GPQA · $0.00625/reqGPT 5.1 — 84% GPQA · $0.00625/reqGPT 5.2 — 89% GPQA · $0.00875/reqLlama3.3 70b Instruct — 30% GPQA · $0.000975/reqLlama 4 Scout 17b 16e Instruct — 36% GPQA · $0.00028/reqGPT Oss 120b — 68% GPQA · $0.00045/reqDeepseek R1 — 62% GPQA · $0.0006/reqDeepseek R1 0528 — 68% GPQA · $0.000375/reqDeepseek — 42% GPQA · $0.0003/reqDeepseek v3 0324 — 57% GPQA · $0.0006/reqLlama 3.3 70B Instruct — 30% GPQA · $0.00027/reqMeta Llama 3 70B Instruct — 21% GPQA · $0.00027/reqQwen2.5 72B Instruct — 32% GPQA · $0.00027/reqQwen3 235B A22b — 61% GPQA · $0.003/reqDeepseek R1 0528 — 68% GPQA · $0.0005/reqDeepseek v3 0324 — 57% GPQA · $0.0005/reqLlama 4 Maverick 17b 128e Instruct Fp8 — 56% GPQA · $0.0001/reqLlama 4 Scout 17b 16e Instruct — 36% GPQA · $0.0001/reqLlama3.1 8b Instruct — 1% GPQA · $0.000045/reqLlama 3.1 8b — 1% GPQA · $0.000055/reqMagistral Small 2506 — 31% GPQA · $0.00125/reqMagistral Small Latest — 31% GPQA · $0.00125/reqMistral Large 2402 — 18% GPQA · $0.01/reqMistral Large 2407 — 32% GPQA · $0.0075/reqMistral Large 2411 — 35% GPQA · $0.005/reqMistral Large 2512 — 35% GPQA · $0.00125/reqMistral Large Latest — 35% GPQA · $0.00125/reqMistral Medium — 46% GPQA · $0.00675/reqMistral Medium 2312 — 46% GPQA · $0.00675/reqMistral Medium 2505 — 46% GPQA · $0.0014/reqMistral Medium 2508 — 46% GPQA · $0.0014/reqMistral Medium 2604 — 46% GPQA · $0.00525/reqMistral Medium Latest — 46% GPQA · $0.00525/reqMistral Small — 30% GPQA · $0.00025/reqMistral Small Latest — 30% GPQA · $0.00015/reqOpen Mistral Nemo — 7% GPQA · $0.00045/reqOpen Mistral Nemo 2407 — 7% GPQA · $0.00045/reqOpen Mixtral 8x22b — 12% GPQA · $0.005/reqKimi K2 Thinking Turbo — 79% GPQA · $0.00515/reqKimi K2.6 — 88% GPQA · $0.00295/reqDeepseek R1 — 62% GPQA · $0.002/reqDeepseek R1 0528 — 68% GPQA · $0.002/reqDeepseek — 42% GPQA · $0.00125/reqDeepseek v3 0324 — 57% GPQA · $0.00125/reqGemma 3 27b It — 32% GPQA · $0.00016/reqLlama 3.3 70B Instruct — 30% GPQA · $0.00033/reqQwen2.5 72B Instruct — 32% GPQA · $0.00033/reqQwen3 235B A22b — 61% GPQA · $0.0005/reqDeepseek R1 0528 — 68% GPQA · $0.00195/reqDeepseek v3 0324 — 57% GPQA · $0.00083/reqGemma 3 27b It — 32% GPQA · $0.000219/reqLlama 3.1 8b Instruct — 1% GPQA · $0.000045/reqLlama 3.3 70b Instruct — 30% GPQA · $0.000335/reqLlama 4 Maverick 17b 128e Instruct Fp8 — 56% GPQA · $0.000695/reqLlama 4 Scout 17b 16e Instruct — 36% GPQA · $0.000475/reqGPT Oss 120b — 68% GPQA · $0.000175/reqQwen 2.5 72b Instruct — 32% GPQA · $0.00058/reqQwen3 235b A22b Thinking 2507 — 73% GPQA · $0.0018/reqQwen3 Max — 63% GPQA · $0.006335/reqGlm 4.7 — 78% GPQA · $0.0017/reqLlama 3.1 8B Instruct — 1% GPQA · $0.000045/reqLlama 3.3 70B Instruct — 30% GPQA · $0.0003/reqLlama 4 Scout 17B 16E Instruct — 36% GPQA · $0.000235/reqGPT 3.5 Turbo — 4% GPQA · $0.00125/reqGPT 3.5 Turbo 0125 — 3% GPQA · $0.00125/reqGPT 3.5 Turbo 1106 — 4% GPQA · $0.002/reqGPT 4 — 8% GPQA · $0.06/reqGPT 4.0125 Preview — 8% GPQA · $0.025/reqGPT 4.0314 — 14% GPQA · $0.06/reqGPT 4.0613 — 8% GPQA · $0.06/reqGPT 4.1106 Preview — 8% GPQA · $0.025/reqGPT 4 Turbo — 29% GPQA · $0.025/reqGPT 4 Turbo — 29% GPQA · $0.025/reqGPT 4 Turbo Preview — 29% GPQA · $0.025/reqGPT 4.1 — 56% GPQA · $0.006/reqGPT 4.1 — 56% GPQA · $0.006/reqGPT 4.1 Mini — 54% GPQA · $0.0012/reqGPT 4.1 Mini — 54% GPQA · $0.0012/reqGPT 4.1 Nano — 32% GPQA · $0.0003/reqGPT 4.1 Nano — 32% GPQA · $0.0003/reqGPT 4o — 31% GPQA · $0.0075/reqGPT 4o — 32% GPQA · $0.0125/reqGPT 4o — 32% GPQA · $0.0075/reqGPT 4o — 31% GPQA · $0.0075/reqGPT 4o Mini — 17% GPQA · $0.00045/reqGPT 4o Mini — 17% GPQA · $0.00045/reqGPT 5 — 82% GPQA · $0.00625/reqGPT 5 — 82% GPQA · $0.00625/reqGPT 5 Mini — 67% GPQA · $0.00125/reqGPT 5 Mini — 67% GPQA · $0.00125/reqGPT 5 Nano — 59% GPQA · $0.00025/reqGPT 5 Nano — 59% GPQA · $0.00025/reqGPT 5.1 — 84% GPQA · $0.00625/reqGPT 5.1 — 84% GPQA · $0.00625/reqGPT 5.2 — 89% GPQA · $0.00875/reqGPT 5.2 — 89% GPQA · $0.00875/reqGPT 5.4 — 91% GPQA · $0.01/reqGPT 5.4 — 91% GPQA · $0.01/reqGPT 5.4 Mini — 78% GPQA · $0.003/reqGPT 5.4 Mini — 78% GPQA · $0.003/reqGPT 5.4 Nano — 71% GPQA · $0.000825/reqGPT 5.4 Nano — 71% GPQA · $0.000825/reqGPT 5.4 Pro — 93% GPQA · $0.12/reqGPT 5.4 Pro — 93% GPQA · $0.12/reqGPT 5.5 — 92% GPQA · $0.02/reqGPT 5.5 — 92% GPQA · $0.02/reqGPT 5.6 Luna — 89% GPQA · $0.004/reqGPT 5.6 Sol — 91% GPQA · $0.02/reqGPT 5.6 Terra — 91% GPQA · $0.01/reqO1 — 69% GPQA · $0.045/reqO1 — 69% GPQA · $0.045/reqO3 — 76% GPQA · $0.006/reqO3 — 76% GPQA · $0.006/reqO3 Mini — 69% GPQA · $0.0033/reqO3 Mini — 69% GPQA · $0.0033/reqO4 Mini — 73% GPQA · $0.0033/reqO4 Mini — 73% GPQA · $0.0033/reqClaude 3 Haiku — 15% GPQA · $0.000875/reqClaude 3.5 Sonnet — 40% GPQA · $0.0105/reqClaude 3.7 Sonnet — 73% GPQA · $0.0105/reqClaude Haiku 4.5 — 62% GPQA · $0.0035/reqClaude Opus 4 — 68% GPQA · $0.0525/reqClaude Opus 4.1 — 70% GPQA · $0.0525/reqClaude Opus 4.5 — 81% GPQA · $0.0175/reqClaude Opus 4.6 — 87% GPQA · $0.0175/reqClaude Opus 4.7 — 87% GPQA · $0.0175/reqClaude Sonnet 4 — 72% GPQA · $0.0105/reqClaude Sonnet 4.5 — 76% GPQA · $0.0105/reqClaude Sonnet 4.6 — 83% GPQA · $0.0105/reqDeepseek R1 — 62% GPQA · $0.001645/reqDeepseek R1 0528 — 68% GPQA · $0.001575/reqGemini 2.0 Flash 001 — 52% GPQA · $0.0003/reqGemini 2.5 Pro — 80% GPQA · $0.00625/reqGemini 3 Flash Preview — 78% GPQA · $0.002/reqGemini 3 Pro Preview — 90% GPQA · $0.008/reqGemini 3.1 Pro Preview — 92% GPQA · $0.008/reqMistral Large — 35% GPQA · $0.02/reqMistral Large 2512 — 35% GPQA · $0.00125/reqGPT 3.5 Turbo — 4% GPQA · $0.0025/reqGPT 4 — 8% GPQA · $0.06/reqGPT 4.1 — 56% GPQA · $0.006/reqGPT 4.1 Mini — 54% GPQA · $0.0012/reqGPT 4.1 Nano — 32% GPQA · $0.0003/reqGPT 4o — 31% GPQA · $0.0075/reqGPT 4o — 32% GPQA · $0.0125/reqGPT 5 — 82% GPQA · $0.00625/reqGPT 5 Mini — 67% GPQA · $0.00125/reqGPT 5 Nano — 59% GPQA · $0.00025/reqGPT 5.2 — 89% GPQA · $0.00875/reqGPT Oss 120b — 68% GPQA · $0.00058/reqO1 — 69% GPQA · $0.045/reqO3 Mini — 69% GPQA · $0.0033/reqQwen3 235b A22b 2507 — 61% GPQA · $0.000121/reqQwen3 235b A22b Thinking 2507 — 73% GPQA · $0.00041/reqQwen3.5 Flash 02.23 — 78% GPQA · $0.0003/reqQwen3.5 Plus 02.15 — 79% GPQA · $0.0016/reqQwen3.6 Plus — 83% GPQA · $0.0013/reqGrok 4 — 83% GPQA · $0.0105/reqGlm 4.7 — 78% GPQA · $0.00115/reqGlm 5 — 84% GPQA · $0.00208/reqGlm 5.1 — 81% GPQA · $0.0028/reqGPT Oss 120b — 68% GPQA · $0.00028/reqLlama 3.1 8B Instruct — 1% GPQA · $0.00015/reqMixtral 8x7B Instruct — 7% GPQA · $0.000945/reqLlama 3.1 70b Instruct — 26% GPQA · $0.0015/reqLlama 3.1 8b Instruct — 1% GPQA · $0.0003/reqClaude 3.5 Haiku — 18% GPQA · $0.0035/reqClaude 3.5 Sonnet — 40% GPQA · $0.013125/reqClaude 3.7 Sonnet — 73% GPQA · $0.0105/reqDeepseek R1 — 62% GPQA · $0.00875/reqDeepseek — 42% GPQA · $0.002175/reqGemini 3 Pro — 90% GPQA · $0.008/reqMixtral 8x7b Instruct — 7% GPQA · $0.0008/reqGPT 4.1 — 56% GPQA · $0.006/reqGPT 4.1 Mini — 54% GPQA · $0.0012/reqGPT 4.1 Nano — 32% GPQA · $0.0003/reqGPT 4o — 31% GPQA · $0.0075/reqGPT 4o Mini — 17% GPQA · $0.00045/reqGPT 5 — 82% GPQA · $0.00625/reqGPT 5 Mini — 67% GPQA · $0.00125/reqGPT 5 Nano — 59% GPQA · $0.00025/reqGPT Oss 120b — 68% GPQA · $0.00054/reqO1 — 69% GPQA · $0.045/reqO1 Mini — 50% GPQA · $0.0033/reqO4 Mini — 73% GPQA · $0.003/reqGrok 4 — 83% GPQA · $0.0252/reqDeepseek R1 — 62% GPQA · $0.0085/reqDeepseek v3 0324 — 57% GPQA · $0.00525/reqGPT Oss 120b — 68% GPQA · $0.000515/reqLlama 4 Scout 17B 16E Instruct — 36% GPQA · $0.00075/reqGemma 3 27b It — 32% GPQA · $0.0005/reqLlama 3.3 70b Instruct — 30% GPQA · $0.00135/reqGPT Oss 120b — 68% GPQA · $0.00045/reqClaude 3.5 Sonnet — 40% GPQA · $0.0105/reqClaude 3.7 Sonnet — 73% GPQA · $0.0105/reqClaude Haiku 4.5 — 62% GPQA · $0.0035/reqClaude Sonnet 4.5 — 76% GPQA · $0.0105/reqClaude Sonnet 4.6 — 83% GPQA · $0.0105/reqDeepseek R1 — 62% GPQA · $0.00405/reqLlama3.1 405b — 35% GPQA · $0.0018/reqLlama3.1 70b — 26% GPQA · $0.00108/reqLlama3.1 8b — 1% GPQA · $0.00036/reqLlama3.3 70b — 30% GPQA · $0.00108/reqDeepseek V4 Pro — 86% GPQA · $0.00087/reqKimi K2.6 — 88% GPQA · $0.00296/reqGPT Oss 120b — 68% GPQA · $0.00045/reqGPT 3.5 Turbo Instruct — 4% GPQA · $0.0025/reqGPT 3.5 Turbo Instruct 0914 — 4% GPQA · $0.0025/reqDeepseek R1 — 62% GPQA · $0.0065/reqDeepseek — 42% GPQA · $0.001875/reqLlama 4 Maverick 17B 128E Instruct Fp8 — 56% GPQA · $0.000695/reqLlama 4 Scout 17B 16E Instruct — 36% GPQA · $0.000475/reqMixtral 8x7B Instruct — 7% GPQA · $0.0009/reqGPT Oss 120b — 68% GPQA · $0.00045/reqQwen3 235B A22b Thinking 2507 — 73% GPQA · $0.00215/reqGlm 4.7 — 78% GPQA · $0.00145/reqClaude 3.5 Sonnet — 40% GPQA · $0.0105/reqClaude 3.5 Sonnet — 40% GPQA · $0.0105/reqClaude 3.7 Sonnet — 73% GPQA · $0.0105/reqClaude 3 Haiku — 15% GPQA · $0.000875/reqClaude 3 Opus — 30% GPQA · $0.0525/reqClaude 3.5 Haiku — 18% GPQA · $0.0028/reqClaude 3.5 Sonnet — 40% GPQA · $0.0105/reqClaude 3.7 Sonnet — 73% GPQA · $0.0105/reqClaude Haiku 4.5 — 62% GPQA · $0.0035/reqClaude Opus 4 — 68% GPQA · $0.0525/reqClaude Opus 4.1 — 70% GPQA · $0.0525/reqClaude Opus 4.5 — 81% GPQA · $0.0175/reqClaude Opus 4.6 — 87% GPQA · $0.0175/reqClaude Sonnet 4 — 72% GPQA · $0.0105/reqClaude Sonnet 4.5 — 76% GPQA · $0.0105/reqDeepseek R1 — 62% GPQA · $0.001645/reqDeepseek — 42% GPQA · $0.00135/reqGemini 2.5 Pro — 80% GPQA · $0.0075/reqGemma 2 9b — 3% GPQA · $0.0003/reqLlama 3.1 70b — 26% GPQA · $0.00108/reqLlama 3.1 8b — 1% GPQA · $0.00009/reqLlama 3.3 70b — 30% GPQA · $0.00108/reqMagistral Small — 31% GPQA · $0.00125/reqMistral Large — 35% GPQA · $0.005/reqMistral Small — 30% GPQA · $0.00025/reqGPT 3.5 Turbo — 4% GPQA · $0.00125/reqGPT 3.5 Turbo Instruct — 4% GPQA · $0.0025/reqGPT 4 Turbo — 29% GPQA · $0.025/reqGPT 4.1 — 56% GPQA · $0.006/reqGPT 4.1 Mini — 54% GPQA · $0.0012/reqGPT 4.1 Nano — 32% GPQA · $0.0003/reqGPT 4o — 31% GPQA · $0.0075/reqGPT 4o Mini — 17% GPQA · $0.00045/reqO1 — 69% GPQA · $0.045/reqO3 — 76% GPQA · $0.006/reqO3 Mini — 69% GPQA · $0.0033/reqO4 Mini — 73% GPQA · $0.0033/reqGrok 2 — 38% GPQA · $0.007/reqGrok 4 — 83% GPQA · $0.0105/reqGemini 3 Flash Preview — 78% GPQA · $0.002/reqGemini 3 Pro Preview — 90% GPQA · $0.008/reqGemini 3.1 Pro Preview — 92% GPQA · $0.008/reqGemini 3.5 Flash — 90% GPQA · $0.006/reqClaude 3.5 Haiku — 18% GPQA · $0.0035/reqClaude 3.5 Haiku — 18% GPQA · $0.0035/reqClaude 3.5 Sonnet — 40% GPQA · $0.0105/reqClaude 3.5 Sonnet — 39% GPQA · $0.0105/reqClaude 3.7 Sonnet — 73% GPQA · $0.0105/reqClaude 3 Haiku — 15% GPQA · $0.000875/reqClaude 3 Haiku — 15% GPQA · $0.000875/reqClaude 3 Opus — 30% GPQA · $0.0525/reqClaude 3 Opus — 30% GPQA · $0.0525/reqClaude 3 Sonnet — 21% GPQA · $0.0105/reqClaude 3 Sonnet — 21% GPQA · $0.0105/reqClaude Haiku 4.5 — 62% GPQA · $0.0035/reqClaude Haiku 4.5 — 62% GPQA · $0.0035/reqClaude Opus 4 — 68% GPQA · $0.0525/reqClaude Opus 4.1 — 70% GPQA · $0.0525/reqClaude Opus 4.1 — 70% GPQA · $0.0525/reqClaude Opus 4.5 — 81% GPQA · $0.0175/reqClaude Opus 4.5 — 81% GPQA · $0.0175/reqClaude Opus 4.6 — 87% GPQA · $0.0175/reqClaude Opus 4.7 — 87% GPQA · $0.0175/reqClaude Opus 4.8 — 88% GPQA · $0.0175/reqClaude Opus 4 — 68% GPQA · $0.0525/reqClaude Sonnet 4 — 72% GPQA · $0.0105/reqClaude Sonnet 4.5 — 76% GPQA · $0.0105/reqClaude Sonnet 4.5 — 76% GPQA · $0.0105/reqClaude Sonnet 4.6 — 83% GPQA · $0.0105/reqClaude Sonnet 4 — 72% GPQA · $0.0105/reqClaude Sonnet 5 — 87% GPQA · $0.007/reqGemini 2.0 Flash 001 — 52% GPQA · $0.00045/reqGemini 2.5 Pro — 80% GPQA · $0.00625/reqGemini 3 Flash Preview — 78% GPQA · $0.002/reqGemini 3 Pro Preview — 90% GPQA · $0.008/reqGemini 3.1 Pro Preview — 92% GPQA · $0.008/reqGemini 3.5 Flash — 90% GPQA · $0.006/reqMistral Large 2411 — 35% GPQA · $0.005/reqMistral Large — 32% GPQA · $0.005/reqMistral Small 2503 — 30% GPQA · $0.0025/reqDeepseek R1 0528 — 68% GPQA · $405.00/reqDeepseek v3 0324 — 57% GPQA · $251.50/reqLlama 3.1 8B Instruct — 1% GPQA · $33.00/reqLlama 3.3 70B Instruct — 30% GPQA · $106.50/reqLlama 4 Scout 17B 16E Instruct — 36% GPQA · $50.00/reqGPT Oss 120b — 68% GPQA · $45.00/reqQwen3 235B A22b Thinking 2507 — 73% GPQA · $15.00/reqLlama 3.2 90b Vision Instruct — 21% GPQA · $0.003/reqLlama 3.3 70b Instruct — 30% GPQA · $0.001065/reqMistral Large — 35% GPQA · $0.008/reqMistral Medium 2505 — 46% GPQA · $0.008/reqMistral Small 2503 — 30% GPQA · $0.00025/reqGPT Oss 120b — 68% GPQA · $0.00045/reqGrok 2 — 38% GPQA · $0.007/reqGrok 2.1212 — 38% GPQA · $0.007/reqGrok 2 Latest — 38% GPQA · $0.007/reqGrok 3 Beta — 68% GPQA · $0.0105/reqGrok 3 Latest — 68% GPQA · $0.0105/reqGrok 3 Mini Beta — 68% GPQA · $0.00055/reqGrok 3 Mini Latest — 68% GPQA · $0.00055/reqGrok 4 — 83% GPQA · $0.0105/reqGrok 4.0709 — 83% GPQA · $0.0105/reqGrok 4 Latest — 83% GPQA · $0.0105/reqGrok 4.20.0309 Reasoning — 86% GPQA · $0.005/reqGrok 4.3 — 85% GPQA · $0.0025/reqGrok 4.3 Latest — 85% GPQA · $0.0025/reqGrok 4.5 — 91% GPQA · $0.005/reqGrok 4.5 Latest — 91% GPQA · $0.005/reqGlm 4.7 — 78% GPQA · $0.0017/reqGlm 5 — 84% GPQA · $0.0026/reqGlm 5.1 — 81% GPQA · $0.0036/reqClaude Opus 4.8 — 88% GPQA at $0.0175/reqClaude Opus 4.8

Each dot is a model with a GPQA Diamond score, priced at a 1K-in / 500-out request; Claude Opus 4.8 is highlighted. The shaded corner holds models that are both cheaper and higher-scoring; the dashed staircase is the value frontier. Hover any dot for its model.

11 cheaper models match or beat Claude Opus 4.8 on GPQA— see the full table below, switchable by benchmark.

Also worth considering

cheaper models that score about as well — pick the benchmark that matters to you

8 cheaper models score within 3 points of Claude Opus 4.8 on GPQA Diamond.

ModelGPQA DiamondCost / reqSavings
DEDeepseek V4 Pro86%-2$0.00087−95%
XAGrok 4.385%-3$0.0025−86%
XAGrok 4.3 Latest85%-3$0.0025−86%
AAKimi K2.688%0$0.00295−83%
CLKimi K2.7 Code86%-2$0.00295−83%
CLGlm 5.289%+1$0.0036−79%
AOGPT 5.6 Luna89%+1$0.004−77%
XAGrok 4.20.0309 Reasoning86%-2$0.005−71%

Deduped to one entry per model (cheapest offering), priced at the reference 1K-in / 500-out request. Filtered only on the benchmark score — a model with an unknown capability is never silently excluded. A lower price is only cheaper if quality holds on your task — that's what routing proves.

Pricing

Input · fresh prompt tokens$5.00 / M
Output · generated tokens$25.00 / M
Cache read · cached-input hit$0.50 / M
Cache write · 5-minute TTL$6.25 / M
Cache write · 1-hour TTL$10.00 / M
Reasoning · thinking tokensunknown

Reasoning tokens: no separate rate is published. Providers typically bill thinking tokens at the output rate ($25.00 / M) — which is what the estimator assumes, so an extended-thinking workload isn't silently undercounted.

Model info

Provider
Azure AI
Catalog key
azure_ai/azure_ai/claude-opus-4-8
Identifier
Floating alias (may re-point over time)
Type
Chat
Max input
200,000 tokens
Max output
128,000 tokens
Released
2026-05-28
Knowledge cutoff
2026-01
Weights
Proprietary
Price snapshot
2026-07-14 · rev 179affb

Pricing from TokenTriage's resolved price artifact (TokenTriage resolved price artifact (internal/pricing/data/prices.json)); capability + model metadata is third-party (LiteLLM model_prices_and_context_window.json, models.dev). Unknown means unstated, not absent.

Prompt-cache break-even

reuse the same prefix ≥ 2 times and caching wins
01234Times the prefix is reusedCumulative costbreaks even at 2 reusesNo cacheWith cache

Writing a prefix to cache costs a premium, but each subsequent hit reads at $0.50/M instead of $5.00/M. For this model the crossover is 2 reuses — past that, the same prompt keeps getting cheaper. TokenTriage's semantic cache is built to cross that line for you.

Capabilities

7 documented as supported

Input & output

Vision
PDF input
?Audio input
?Audio output

API behaviour

?Streaming
Structured output
Prompt caching
Reasoning

Agents & tools

Function calling
?Parallel tool calls
?Web search
Computer use

supported · not supported ·? not documented · sources disagree. A models.dev tag means the LiteLLM catalog was silent and an independent source supplied the value (lower confidence); ? is never silently turned into a confident ✕.

Estimate a request

disjoint token buckets · input = fresh (uncached) tokens
Preset
Cost / request
Projected / month

How output length drives the bill

at a 1K-token prompt · cost scales linearly with output
$0.85$0.64$0.43$0.21$0032K64K96K128KOutput tokensCost / requestmax outputoutput spend = input spend at ~200 tokensoutput spend overtakes input at ~200

Output tokens overtake input spend at ~200 tokens for this model — past that, generation is your bill, whatever the headline input price says. Computed by the same cost engine as the estimate above.

Route to Claude Opus 4.8

OpenAI-compatible · one base URL
curl https://YOUR-TOKENTRIAGE-HOST/v1/chat/completions \
  -H "Authorization: Bearer $TOKENTRIAGE_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "azure_ai/azure_ai/claude-opus-4-8",
    "messages": [{"role": "user", "content": "Hello"}]
  }'

Point your existing OpenAI client at your TokenTriage host and pass the catalog key as the model. TokenTriage attributes the real cost per request and can route to a cheaper model once it's proven just as good on your traffic.

Data & API

machine-readable · rev 179affb

Pull this model's pricing, capabilities, benchmarks and cross-source provenance programmatically — every field carries the snapshot rev, and unknown is null, never 0. Free to reuse with attribution: benchmarks & Capabilities Index © Epoch AI (CC-BY (Epoch AI)); human-preference Elo © LMArena (CC-BY-4.0); capability & price cross-check via models.dev v2 (MIT) · Portkey (MIT) · TrueFoundry (MIT); open-weights facts via Hugging Face (per-repo license).

A price is a guess until it meets your traffic.

This page tells you what Claude Opus 4.8 charges per token. TokenTriage tells you what it costs on your real requests — and cuts the bill only after proving a cheaper model is just as good.