← Choose models

Historical benchmark snapshot

Evaluation metricGPT-5.4 ↗xHigh · OpenAIClaude Opus 4.6 ↗Max · Anthropic
SWE-bench VerifiedResolved %Not reported80.8
GPQA DiamondPass@1 %93.091.3
HMMT 2026 FebPass@1 %97.796.2
MMLU-ProEM %87.589.1
LiveCodeBenchPass@1 %Not reported88.8
Terminal-Bench 2.0Accuracy %75.165.4
SWE-bench ProResolved %57.757.3
Humanity’s Last ExamPass@1 %39.840.0
BrowseCompPass@1 %82.783.7
MRCR 1MMMR %Not reported92.9
Model weightsClosed weightsClosed weights
Source: DeepSeek V4 preview model card. Checked 2026-09-24. Highest reported values appear in green, but reasoning budgets and tool frameworks may differ. These scores are not an evaluation of newer models.