LLM Inference Benchmark Explorer

Qwen3.8-Flash-Next op 2× DGX Spark — NVFP4, SGLang, TP2 inferentiebenchmark

Open deze configuratie in de LLM Inference Benchmark Explorer

ModelQwen3.8-Flash-Next
Parameters176B
Intelligence Index39.8
Agentic Index53.6
Apparaat2× DGX Spark
KwantisatieNVFP4
Max C4
Chatcapaciteit16
Agentische capaciteit6
TP2
DP—
PP—
EngineSGLang
Speculatieve decodering—
CTTFT (ms)TPS (tok/s)Status
120035.80PASS
220629.94PASS
424322.39PASS
8267113.80FAIL

In de meting van OpenZeka bereikte Qwen3.8-Flash-Next (176B parameters), aangeboden in NVFP4-formaat met SGLang op 2× DGX Spark (TP=2), met één verzoek een generatiesnelheid van 35.8 tok/s per verzoek en een time to first token (TTFT) van 200 ms.

Rekening houdend met de snelheidsdoelen en de beschikbare KV-cachecapaciteit, bedraagt de geschatte capaciteit 16 gebruikers voor chatgebruik en 6 voor agentisch gebruik. De realistische capaciteit ligt waarschijnlijk tussen deze twee waarden. In scenario's waarin programmeren, toolgebruik, lange workflows en multi-agentgebruik overheersen, benadert de capaciteit de agentische schatting; waar kortere interacties, standaardgesprekken en lichtere taken overheersen, benadert zij de chatschatting.

Opmerkingen: 262K context. 176B MoE, 6B active, 512 experts.

De waarden van Intelligence Index en Agentic Index worden gepubliceerd door Artificial Analysis en worden hier met bronvermelding overgenomen.