← Choose models

Historical benchmark snapshot

Evaluation metricGLM-5.1 ↗Thinking · Z.aiClaude Opus 4.6 ↗Max · Anthropic
SWE-bench VerifiedResolved %Not reported80.8
GPQA DiamondPass@1 %86.291.3
HMMT 2026 FebPass@1 %89.496.2
MMLU-ProEM %86.089.1
LiveCodeBenchPass@1 %Not reported88.8
Terminal-Bench 2.0Accuracy %63.565.4
SWE-bench ProResolved %58.457.3
Humanity’s Last ExamPass@1 %34.740.0
BrowseCompPass@1 %79.383.7
MRCR 1MMMR %Not reported92.9
Model weightsOpen weightsClosed weights
Source: DeepSeek V4 preview model card. Checked 2026-09-24. Highest reported values appear in green, but reasoning budgets and tool frameworks may differ. These scores are not an evaluation of newer models.