LLM Inference Benchmark Explorer

GPT-OSS 120B op 1× DGX Spark — MXFP4, vLLM, TP1 inferentiebenchmark

Open deze configuratie in de LLM Inference Benchmark Explorer

ModelGPT-OSS 120B
Parameters120B
Intelligence Index11.6
Agentic Index3.7
Apparaat1× DGX Spark
KwantisatieMXFP4
Max C4
Chatcapaciteit16
Agentische capaciteit6
TP—
DP—
PP—
EnginevLLM
Speculatieve decodering—
CTTFT (ms)TPS (tok/s)Status
122055.65PASS
229437.05PASS
432125.20PASS
839516.88FAIL
1644411.67FAIL
325528.26FAIL

In de meting van OpenZeka bereikte GPT-OSS 120B (120B parameters), aangeboden in MXFP4-formaat met vLLM op 1× DGX Spark, met één verzoek een generatiesnelheid van 55.6 tok/s per verzoek en een time to first token (TTFT) van 220 ms.

Rekening houdend met de snelheidsdoelen en de beschikbare KV-cachecapaciteit, bedraagt de geschatte capaciteit 16 gebruikers voor chatgebruik en 6 voor agentisch gebruik. De realistische capaciteit ligt waarschijnlijk tussen deze twee waarden. In scenario's waarin programmeren, toolgebruik, lange workflows en multi-agentgebruik overheersen, benadert de capaciteit de agentische schatting; waar kortere interacties, standaardgesprekken en lichtere taken overheersen, benadert zij de chatschatting.

Opmerkingen: CUTLASS MoE, FlashInfer attn, GMU 0.7, KV fp8, Ray

De waarden van Intelligence Index en Agentic Index worden gepubliceerd door Artificial Analysis en worden hier met bronvermelding overgenomen.