LLM Inference Benchmark Explorer

Gemma-4-31B-it op 1× DGX Spark — NVFP4, vLLM, TP1 inferentiebenchmark

Open deze configuratie in de LLM Inference Benchmark Explorer

ModelGemma-4-31B-it
Parameters31B
Intelligence Index19
Agentic Index4.2
Apparaat1× DGX Spark
KwantisatieNVFP4
Max C0
Chatcapaciteit0
Agentische capaciteit0
TP—
DP—
PP—
EnginevLLM
Speculatieve decodering—
CTTFT (ms)TPS (tok/s)Status
120210.81FAIL
228311.06FAIL
429410.89FAIL
831610.51FAIL
1634710.04FAIL
323998.87FAIL
645327.36FAIL

In de meting van OpenZeka bereikte Gemma-4-31B-it (31B parameters), aangeboden in NVFP4-formaat met vLLM op 1× DGX Spark, met één verzoek een generatiesnelheid van 10.8 tok/s per verzoek en een time to first token (TTFT) van 202 ms.

Bij de standaard snelheidsdoelen (ten minste 20 tok/s per verzoek, TTFT ten hoogste 1,000 ms) is er voor deze configuratie geen capaciteitsschatting: geen enkel gemeten belastingsniveau voldeed eraan.

Opmerkingen: Model: RedHatAI/gemma-4-31B-it-NVFP4 (31B dense)

De waarden van Intelligence Index en Agentic Index worden gepubliceerd door Artificial Analysis en worden hier met bronvermelding overgenomen.