LLM Inference Benchmark Explorer

Gemma-4-31B-it op Thor — NVFP4, vLLM, TP1, speculatieve decodering k=3 inferentiebenchmark

Open deze configuratie in de LLM Inference Benchmark Explorer

ModelGemma-4-31B-it
Parameters31B
Intelligence Index14.7
Agentic Index4.2
ApparaatThor
KwantisatieNVFP4
Max C0
Chatcapaciteit0
Agentische capaciteit0
TP—
DP—
PP—
EnginevLLM
Speculatieve decoderingJa
CTTFT (ms)TPS (tok/s)Status
133616.16FAIL
247815.38FAIL
449114.59FAIL
850714.72FAIL

In de meting van OpenZeka bereikte Gemma-4-31B-it (31B parameters), aangeboden in NVFP4-formaat met vLLM en speculatieve decodering op Thor, met één verzoek een generatiesnelheid van 16.2 tok/s per verzoek en een time to first token (TTFT) van 336 ms.

Bij de standaard snelheidsdoelen (ten minste 20 tok/s per verzoek, TTFT ten hoogste 1,000 ms) is er voor deze configuratie geen capaciteitsschatting: geen enkel gemeten belastingsniveau voldeed eraan.

Opmerkingen: Speculative MTP k=3. Served as gemma-4-31b-it. Model: nvidia/gemma-4-31B-it-NVFP4. 256K context

De waarden van Intelligence Index en Agentic Index worden gepubliceerd door Artificial Analysis en worden hier met bronvermelding overgenomen.