LLM Inference Benchmark Explorer
Gemma-4-31B-it op 2× DGX Spark — NVFP4, vLLM, TP2 inferentiebenchmark
Open deze configuratie in de LLM Inference Benchmark Explorer
| Model | Gemma-4-31B-it |
|---|---|
| Parameters | 31B |
| Intelligence Index | 19 |
| Agentic Index | 4.2 |
| Apparaat | 2× DGX Spark |
| Kwantisatie | NVFP4 |
| Max C | 0 |
| Chatcapaciteit | 0 |
| Agentische capaciteit | 0 |
| TP | 2 |
| DP | — |
| PP | — |
| Engine | vLLM |
| Speculatieve decodering | — |
| C | TTFT (ms) | TPS (tok/s) | Status |
|---|---|---|---|
| 1 | 136 | 19.42 | FAIL |
| 2 | 227 | 19.59 | FAIL |
| 4 | 246 | 19.17 | FAIL |
| 8 | 280 | 18.20 | FAIL |
| 16 | 293 | 15.81 | FAIL |
| 32 | 337 | 13.21 | FAIL |
| 64 | 420 | 9.16 | FAIL |
In de meting van OpenZeka bereikte Gemma-4-31B-it (31B parameters), aangeboden in NVFP4-formaat met vLLM op 2× DGX Spark (TP=2), met één verzoek een generatiesnelheid van 19.4 tok/s per verzoek en een time to first token (TTFT) van 136 ms.
Bij de standaard snelheidsdoelen (ten minste 20 tok/s per verzoek, TTFT ten hoogste 1,000 ms) is er voor deze configuratie geen capaciteitsschatting: geen enkel gemeten belastingsniveau voldeed eraan.
De waarden van Intelligence Index en Agentic Index worden gepubliceerd door Artificial Analysis en worden hier met bronvermelding overgenomen.
In de meting van OpenZeka bereikte Gemma-4-31B-it (31B parameters), aangeboden in NVFP4-formaat met vLLM op 2× DGX Spark (TP=2), met één verzoek een generatiesnelheid van 19.4 tok/s per verzoek en een time to first token (TTFT) van 136 ms.
Bij de standaard snelheidsdoelen (ten minste 20 tok/s per verzoek, TTFT ten hoogste 1,000 ms) is er voor deze configuratie geen capaciteitsschatting: geen enkel gemeten belastingsniveau voldeed eraan.