LLM Çıkarım Benchmark Gezgini

RTX PRO 6000 üzerinde GPT-OSS 120B — MXFP4, vLLM, TP1 çıkarım benchmark'ı

Bu yapılandırmayı LLM Çıkarım Benchmark Gezgini'nde aç

ModelGPT-OSS 120B
Parametre120B
Zekâ Endeksi11.6
Agentic Endeksi3.7
CihazRTX PRO 6000
KuantizasyonMXFP4
Maks C64+
Chat Kapasitesi55
Agentic Kapasitesi13
TP—
DP—
PP—
Inference EnginevLLM
Spekülatif Kod Çözme—
CTTFT (ms)TPS (tok/s)Durum
152169.64PASS
259125.81PASS
46498.77PASS
88076.57PASS
1612255.27PASS
3216041.88PASS
6420631.76PASS

OpenZeka'nın ölçümünde, RTX PRO 6000 üzerinde vLLM ile MXFP4 formatında sunulan GPT-OSS 120B (120B parametre), tek istekte istek başına 169,6 tok/s üretim hızına ve 52 ms ilk token süresine (TTFT) ulaştı.

Hız hedefleri ve kullanılabilir KV önbelleği kapasitesi göz önünde bulundurulduğunda, tahmini kapasite chat kullanımı için 55, agentic kullanım için 13 kullanıcıdır. Gerçekçi kapasite muhtemelen bu iki değer arasında olacaktır. Kodlama, araç kullanımı, uzun iş akışları ve çoklu ajan kullanımının ağırlıklı olduğu senaryolarda kapasite agentic tahmine yaklaşırken; daha kısa etkileşimlerin, standart sohbetlerin ve daha hafif görevlerin ağırlıkta olduğu kullanımlarda chat tahminine yaklaşacaktır.

Notlar: 4K context

Zekâ Endeksi ve Agentic Endeksi değerleri Artificial Analysis tarafından yayımlanmıştır ve kaynak belirtilerek burada aktarılmıştır.