LLM Inference Benchmark Explorer

Qwen3.8-27B op 1× DGX Spark — NVFP4, vLLM, TP1 inferentiebenchmark

Open deze configuratie in de LLM Inference Benchmark Explorer

ModelQwen3.8-27B
Parameters27B
Intelligence Index33.7
Agentic Index45.8
Apparaat1× DGX Spark
KwantisatieNVFP4
Max C0
Chatcapaciteit0
Agentische capaciteit0
TP—
DP—
PP—
EnginevLLM
Speculatieve decodering—
CTTFT (ms)TPS (tok/s)Status
11559.71FAIL

In de meting van OpenZeka bereikte Qwen3.8-27B (27B parameters), aangeboden in NVFP4-formaat met vLLM op 1× DGX Spark, met één verzoek een generatiesnelheid van 9.7 tok/s per verzoek en een time to first token (TTFT) van 155 ms.

Bij de standaard snelheidsdoelen (ten minste 20 tok/s per verzoek, TTFT ten hoogste 1,000 ms) is er voor deze configuratie geen capaciteitsschatting: geen enkel gemeten belastingsniveau voldeed eraan.

Opmerkingen: Single C=1 test (config matrix)

De waarden van Intelligence Index en Agentic Index worden gepubliceerd door Artificial Analysis en worden hier met bronvermelding overgenomen.