LLM Inference Benchmark Explorer

Qwen3.6-27B op 1× DGX Spark — FP8, vLLM, TP1, speculatieve decodering inferentiebenchmark

Open deze configuratie in de LLM Inference Benchmark Explorer

ModelQwen3.6-27B
Parameters27B
Intelligence Index21.4
Agentic Index18.5
Apparaat1× DGX Spark
KwantisatieFP8
Max C0
Chatcapaciteit0
Agentische capaciteit0
TP—
DP—
PP—
EnginevLLM
Speculatieve decoderingJa
CTTFT (ms)TPS (tok/s)Status
132319.50FAIL
251619.83FAIL
453118.56FAIL
862116.62FAIL
1681313.84FAIL

In de meting van OpenZeka bereikte Qwen3.6-27B (27B parameters), aangeboden in FP8-formaat met vLLM en speculatieve decodering op 1× DGX Spark, met één verzoek een generatiesnelheid van 19.5 tok/s per verzoek en een time to first token (TTFT) van 323 ms.

Bij de standaard snelheidsdoelen (ten minste 20 tok/s per verzoek, TTFT ten hoogste 1,000 ms) is er voor deze configuratie geen capaciteitsschatting: geen enkel gemeten belastingsniveau voldeed eraan.

Opmerkingen: MTP gives 2.4x TPS improvement

De waarden van Intelligence Index en Agentic Index worden gepubliceerd door Artificial Analysis en worden hier met bronvermelding overgenomen.