LLM Inference Benchmark Explorer

Gemma-4-31B-it op 4× DGX Spark — NVFP4, vLLM, TP4 inferentiebenchmark

Open deze configuratie in de LLM Inference Benchmark Explorer

ModelGemma-4-31B-it
Parameters31B
Intelligence Index19
Agentic Index4.2
Apparaat4× DGX Spark
KwantisatieNVFP4
Max C16
Chatcapaciteit64
Agentische capaciteit24
TP4
DP—
PP—
EnginevLLM
Speculatieve decodering—
CTTFT (ms)TPS (tok/s)Status
128030.53PASS
224529.31PASS
430628.25PASS
837926.18PASS
1636820.80PASS
3248013.93FAIL
645657.94FAIL

In de meting van OpenZeka bereikte Gemma-4-31B-it (31B parameters), aangeboden in NVFP4-formaat met vLLM op 4× DGX Spark (TP=4), met één verzoek een generatiesnelheid van 30.5 tok/s per verzoek en een time to first token (TTFT) van 280 ms.

Rekening houdend met de snelheidsdoelen en de beschikbare KV-cachecapaciteit, bedraagt de geschatte capaciteit 64 gebruikers voor chatgebruik en 24 voor agentisch gebruik. De realistische capaciteit ligt waarschijnlijk tussen deze twee waarden. In scenario's waarin programmeren, toolgebruik, lange workflows en multi-agentgebruik overheersen, benadert de capaciteit de agentische schatting; waar kortere interacties, standaardgesprekken en lichtere taken overheersen, benadert zij de chatschatting.

De waarden van Intelligence Index en Agentic Index worden gepubliceerd door Artificial Analysis en worden hier met bronvermelding overgenomen.