DeepSeek Benchmarks DeepSeek-V4 in führenden Evaluierungen
Starke Ergebnisse bei Reasoning, Code, Wissen und chinesischen Suiten — Zahlen, die erklären, warum Spezialisten DeepSeek wählen.
87.5%
MMLU-Pro
Herausragende Multitask-Wissens- und Reasoning-Leistung
90.1%
GPQA Diamond
Schwierige Wissenschafts-Q&A auf Flagship-Niveau
84.4%
Chinese-SimpleQA
Solide chinesische Faktenbeantwortung
93.5%
LiveCodeBench
Live-Coding-Scores führen im Open-Source-Feld
3206
Codeforces
Wettkampf-Rating spiegelt starkes Code-Reasoning wider
70.98
SuperCLUE Pro
Top-Tier chinesisches Gesamtranking
1M
Langer Kontext
Millionen-Token-Fenster in der gesamten Linie
+20
Agent-Zuwachs
Deutliche Agent-Gewinne gegenüber der Vorgängergeneration
+10
Mathe-Reasoning
Fortlaufende STEM- und Mathe-Verbesserungen
27%
1M-Rechenanteil
Deutlich weniger Rechenleistung für denselben langen Kontext
Scores und Deltas stammen aus öffentlichen Evaluierungen und offiziellen Materialien; Versionen und Setups können abweichen. Prüfen Sie stets die neuesten offiziellen DeepSeek-Hinweise.