LLM Inference Benchmark Explorer
Qwen3.6-27B op 1× DGX Spark — NVFP4, vLLM, TP1 inferentiebenchmark
Open deze configuratie in de LLM Inference Benchmark Explorer
| Model | Qwen3.6-27B |
|---|---|
| Parameters | 27B |
| Intelligence Index | 21.4 |
| Agentic Index | 18.5 |
| Apparaat | 1× DGX Spark |
| Kwantisatie | NVFP4 |
| Max C | 0 |
| Chatcapaciteit | 0 |
| Agentische capaciteit | 0 |
| TP | — |
| DP | — |
| PP | — |
| Engine | vLLM |
| Speculatieve decodering | — |
| C | TTFT (ms) | TPS (tok/s) | Status |
|---|---|---|---|
| 1 | 228 | 9.86 | FAIL |
| 2 | 340 | 9.79 | FAIL |
| 4 | 387 | 9.48 | FAIL |
| 8 | 451 | 9.03 | FAIL |
| 16 | 660 | 8.00 | FAIL |
In de meting van OpenZeka bereikte Qwen3.6-27B (27B parameters), aangeboden in NVFP4-formaat met vLLM op 1× DGX Spark, met één verzoek een generatiesnelheid van 9.9 tok/s per verzoek en een time to first token (TTFT) van 228 ms.
Bij de standaard snelheidsdoelen (ten minste 20 tok/s per verzoek, TTFT ten hoogste 1,000 ms) is er voor deze configuratie geen capaciteitsschatting: geen enkel gemeten belastingsniveau voldeed eraan.
Opmerkingen: unsloth NVFP4. nvidia eugr variant exists with +28% TPS but full sweep unavailable
De waarden van Intelligence Index en Agentic Index worden gepubliceerd door Artificial Analysis en worden hier met bronvermelding overgenomen.
In de meting van OpenZeka bereikte Qwen3.6-27B (27B parameters), aangeboden in NVFP4-formaat met vLLM op 1× DGX Spark, met één verzoek een generatiesnelheid van 9.9 tok/s per verzoek en een time to first token (TTFT) van 228 ms.
Bij de standaard snelheidsdoelen (ten minste 20 tok/s per verzoek, TTFT ten hoogste 1,000 ms) is er voor deze configuratie geen capaciteitsschatting: geen enkel gemeten belastingsniveau voldeed eraan.