LLM Inference Benchmark Explorer

Gemma-4-31B-it op 2× DGX Spark — NVFP4, vLLM, TP2 inferentiebenchmark

Open deze configuratie in de LLM Inference Benchmark Explorer

ModelGemma-4-31B-it
Parameters31B
Intelligence Index19
Agentic Index4.2
Apparaat2× DGX Spark
KwantisatieNVFP4
Max C0
Chatcapaciteit0
Agentische capaciteit0
TP2
DP—
PP—
EnginevLLM
Speculatieve decodering—
CTTFT (ms)TPS (tok/s)Status
113619.42FAIL
222719.59FAIL
424619.17FAIL
828018.20FAIL
1629315.81FAIL
3233713.21FAIL
644209.16FAIL

In de meting van OpenZeka bereikte Gemma-4-31B-it (31B parameters), aangeboden in NVFP4-formaat met vLLM op 2× DGX Spark (TP=2), met één verzoek een generatiesnelheid van 19.4 tok/s per verzoek en een time to first token (TTFT) van 136 ms.

Bij de standaard snelheidsdoelen (ten minste 20 tok/s per verzoek, TTFT ten hoogste 1,000 ms) is er voor deze configuratie geen capaciteitsschatting: geen enkel gemeten belastingsniveau voldeed eraan.

De waarden van Intelligence Index en Agentic Index worden gepubliceerd door Artificial Analysis en worden hier met bronvermelding overgenomen.