← Choose models

Historical benchmark snapshot

Evaluation metricClaude Opus 4.6 ↗Max · AnthropicGPT-5.4 ↗xHigh · OpenAI
SWE-bench VerifiedResolved %80.8Not reported
GPQA DiamondPass@1 %91.393.0
HMMT 2026 FebPass@1 %96.297.7
MMLU-ProEM %89.187.5
LiveCodeBenchPass@1 %88.8Not reported
Terminal-Bench 2.0Accuracy %65.475.1
SWE-bench ProResolved %57.357.7
Humanity’s Last ExamPass@1 %40.039.8
BrowseCompPass@1 %83.782.7
MRCR 1MMMR %92.9Not reported
Model weightsClosed weightsClosed weights
Source: DeepSeek V4 preview model card. Checked 2026-09-24. Highest reported values appear in green, but reasoning budgets and tool frameworks may differ. These scores are not an evaluation of newer models.