LLM Inference Benchmark Explorer

DeepSeek-V3.1 op DGX B300 — NVFP4, vLLM, TP2 inferentiebenchmark

Open deze configuratie in de LLM Inference Benchmark Explorer

ModelDeepSeek-V3.1
Parameters685B
Intelligence Index13.7
Agentic Index—
ApparaatDGX B300
KwantisatieNVFP4
Max C32+
Chatcapaciteit68
Agentische capaciteit17
TP2
DP—
PP—
EnginevLLM
Speculatieve decodering—
CTTFT (ms)TPS (tok/s)Status
1140108.59PASS
229190.52PASS
428885.63PASS
828779.59PASS
1629970.96PASS
3235362.21PASS

In de meting van OpenZeka bereikte DeepSeek-V3.1 (685B parameters), aangeboden in NVFP4-formaat met vLLM op DGX B300 (TP=2), met één verzoek een generatiesnelheid van 108.6 tok/s per verzoek en een time to first token (TTFT) van 140 ms.

Rekening houdend met de snelheidsdoelen en de beschikbare KV-cachecapaciteit, bedraagt de geschatte capaciteit 68 gebruikers voor chatgebruik en 17 voor agentisch gebruik. De realistische capaciteit ligt waarschijnlijk tussen deze twee waarden. In scenario's waarin programmeren, toolgebruik, lange workflows en multi-agentgebruik overheersen, benadert de capaciteit de agentische schatting; waar kortere interacties, standaardgesprekken en lichtere taken overheersen, benadert zij de chatschatting.

De waarden van Intelligence Index en Agentic Index worden gepubliceerd door Artificial Analysis en worden hier met bronvermelding overgenomen.