LLM Inference Benchmark Explorer

Qwen3.6-27B op 1× DGX Spark — FP8, vLLM, TP1 inferentiebenchmark

Open deze configuratie in de LLM Inference Benchmark Explorer

ModelQwen3.6-27B
Parameters27B
Intelligence Index21.4
Agentic Index18.5
Apparaat1× DGX Spark
KwantisatieFP8
Max C0
Chatcapaciteit0
Agentische capaciteit0
TP—
DP—
PP—
EnginevLLM
Speculatieve decodering—
CTTFT (ms)TPS (tok/s)Status
12718.13FAIL
23588.13FAIL
44477.89FAIL
85117.57FAIL
168676.76FAIL

In de meting van OpenZeka bereikte Qwen3.6-27B (27B parameters), aangeboden in FP8-formaat met vLLM op 1× DGX Spark, met één verzoek een generatiesnelheid van 8.1 tok/s per verzoek en een time to first token (TTFT) van 271 ms.

Bij de standaard snelheidsdoelen (ten minste 20 tok/s per verzoek, TTFT ten hoogste 1,000 ms) is er voor deze configuratie geen capaciteitsschatting: geen enkel gemeten belastingsniveau voldeed eraan.

Opmerkingen: vLLM v0.22.0

De waarden van Intelligence Index en Agentic Index worden gepubliceerd door Artificial Analysis en worden hier met bronvermelding overgenomen.