LLM Inference Benchmark Explorer

DeepSeek-V4-Pro-0813 op DGX B300 — FP8, vLLM, TP4 inferentiebenchmark

Open deze configuratie in de LLM Inference Benchmark Explorer

ModelDeepSeek-V4-Pro-0813
Parameters1.65T
Intelligence Index36
Agentic Index41.3
ApparaatDGX B300
KwantisatieFP8
Max C32
Chatcapaciteit128
Agentische capaciteit48
TP4
DP—
PP—
EnginevLLM
Speculatieve decodering—
CTTFT (ms)TPS (tok/s)Status
1279117.77PASS
287107.49PASS
428480.85PASS
810772.79PASS
1630752.36PASS
3231445.17PASS
6458416.64FAIL

In de meting van OpenZeka bereikte DeepSeek-V4-Pro-0813 (1.65T parameters), aangeboden in FP8-formaat met vLLM op DGX B300 (TP=4), met één verzoek een generatiesnelheid van 117.8 tok/s per verzoek en een time to first token (TTFT) van 279 ms.

Rekening houdend met de snelheidsdoelen en de beschikbare KV-cachecapaciteit, bedraagt de geschatte capaciteit 128 gebruikers voor chatgebruik en 48 voor agentisch gebruik. De realistische capaciteit ligt waarschijnlijk tussen deze twee waarden. In scenario's waarin programmeren, toolgebruik, lange workflows en multi-agentgebruik overheersen, benadert de capaciteit de agentische schatting; waar kortere interacties, standaardgesprekken en lichtere taken overheersen, benadert zij de chatschatting.

Opmerkingen: 1M context

De waarden van Intelligence Index en Agentic Index worden gepubliceerd door Artificial Analysis en worden hier met bronvermelding overgenomen.