DeepSeek V4 Pro 0813: 1,7T MoE model s milionovým kontextem
DeepSeek V4 Pro 0813 je 1,7T Mixture-of-Experts model s milionovým kontextem, třemi úrovněmi reasoning effort a veřejně dostupnými vahami.
DeepSeek vydal DeepSeek V4 Pro 0813, nový Mixture-of-Experts model s veřejně dostupnými vahami.
Model card na Hugging Face uvádí 1,7 bilionu parametrů a kontextové okno o velikosti 1 milion tokenů.
Architektura a reasoning effort
DeepSeek V4 Pro 0813 používá Mixture-of-Experts architekturu.
Model podporuje tři úrovně reasoning effort:
low,high,max.
Model card zmiňuje také DSpark speculative decoding, které má zrychlovat generování.
Jde o technické parametry uváděné přímo výrobcem modelu.
Veřejně dostupné váhy
Váhy jsou dostupné na Hugging Face a model je vydaný pod MIT licencí.
DeepSeek uvádí možnost provozu například přes vLLM nebo SGLang.
To je důležitý rozdíl proti situaci, kdy je model dostupný pouze přes jedno hostované API.
Cena přes OpenRouter
OpenRouter uvádí cenu:
- 0,435 USD za milion vstupních tokenů,
- 0,87 USD za milion výstupních tokenů.
Tyto ceny se vztahují ke konkrétnímu poskytovateli a mohou se v čase měnit.
Benchmarky výrobce
DeepSeek zveřejnil také vlastní benchmarkovou tabulku.
Model card například uvádí skóre 87,9 na Terminal Bench 2.1 a 62,7 na DeepSWE v konfiguracích popsaných výrobcem.
Tyto výsledky je potřeba číst jako firemní benchmarky DeepSeeku, ne jako nezávislé hodnocení.
Část testů navíc používá interní nebo specificky nakonfigurované datasety a harnessy, takže výsledky není vhodné převádět na obecný závěr, že model je „lepší“ než jiné modely ve všech úlohách.
Co je na vydání zajímavé
Nejzajímavější kombinací je velikost modelu, milionové kontextové okno, veřejné váhy a podpora různých úrovní reasoning effort.
Pro praktické použití ale bude záležet na konkrétní infrastruktuře, požadované latenci a tom, jak se model chová v reálných úlohách mimo benchmarky výrobce.