LLM Inference Benchmark Explorer

GPT-OSS 120B op RTX PRO 6000 — MXFP4, vLLM, TP1 inferentiebenchmark

Open deze configuratie in de LLM Inference Benchmark Explorer

ModelGPT-OSS 120B
Parameters120B
Intelligence Index11.6
Agentic Index3.7
ApparaatRTX PRO 6000
KwantisatieMXFP4
Max C64+
Chatcapaciteit55
Agentische capaciteit13
TP—
DP—
PP—
EnginevLLM
Speculatieve decodering—
CTTFT (ms)TPS (tok/s)Status
152169.64PASS
259125.81PASS
46498.77PASS
88076.57PASS
1612255.27PASS
3216041.88PASS
6420631.76PASS

In de meting van OpenZeka bereikte GPT-OSS 120B (120B parameters), aangeboden in MXFP4-formaat met vLLM op RTX PRO 6000, met één verzoek een generatiesnelheid van 169.6 tok/s per verzoek en een time to first token (TTFT) van 52 ms.

Rekening houdend met de snelheidsdoelen en de beschikbare KV-cachecapaciteit, bedraagt de geschatte capaciteit 55 gebruikers voor chatgebruik en 13 voor agentisch gebruik. De realistische capaciteit ligt waarschijnlijk tussen deze twee waarden. In scenario's waarin programmeren, toolgebruik, lange workflows en multi-agentgebruik overheersen, benadert de capaciteit de agentische schatting; waar kortere interacties, standaardgesprekken en lichtere taken overheersen, benadert zij de chatschatting.

Opmerkingen: 4K context

De waarden van Intelligence Index en Agentic Index worden gepubliceerd door Artificial Analysis en worden hier met bronvermelding overgenomen.