LLM Inference Benchmark Explorer

Qwen3.6-27B op 1× DGX Spark — NVFP4, vLLM, TP1 inferentiebenchmark

Open deze configuratie in de LLM Inference Benchmark Explorer

ModelQwen3.6-27B
Parameters27B
Intelligence Index21.4
Agentic Index18.5
Apparaat1× DGX Spark
KwantisatieNVFP4
Max C0
Chatcapaciteit0
Agentische capaciteit0
TP—
DP—
PP—
EnginevLLM
Speculatieve decodering—
CTTFT (ms)TPS (tok/s)Status
12289.86FAIL
23409.79FAIL
43879.48FAIL
84519.03FAIL
166608.00FAIL

In de meting van OpenZeka bereikte Qwen3.6-27B (27B parameters), aangeboden in NVFP4-formaat met vLLM op 1× DGX Spark, met één verzoek een generatiesnelheid van 9.9 tok/s per verzoek en een time to first token (TTFT) van 228 ms.

Bij de standaard snelheidsdoelen (ten minste 20 tok/s per verzoek, TTFT ten hoogste 1,000 ms) is er voor deze configuratie geen capaciteitsschatting: geen enkel gemeten belastingsniveau voldeed eraan.

Opmerkingen: unsloth NVFP4. nvidia eugr variant exists with +28% TPS but full sweep unavailable

De waarden van Intelligence Index en Agentic Index worden gepubliceerd door Artificial Analysis en worden hier met bronvermelding overgenomen.