LLM Çıkarım Benchmark Gezgini

RTX PRO 6000 üzerinde Muse-Glimmer-30B — BF16, vLLM, TP1, spekülatif kod çözme k=15 çıkarım benchmark'ı

Bu yapılandırmayı LLM Çıkarım Benchmark Gezgini'nde aç

ModelMuse-Glimmer-30B
Parametre30B
Zekâ Endeksi17.5
Agentic Endeksi8.5
CihazRTX PRO 6000
KuantizasyonBF16
Maks C32
Chat Kapasitesi128
Agentic Kapasitesi47
TP—
DP—
PP—
Inference EnginevLLM
Spekülatif Kod ÇözmeEvet
CTTFT (ms)TPS (tok/s)Durum
1118165.38PASS
2163155.93PASS
4178138.39PASS
8215121.33PASS
1632883.91PASS
3258046.20PASS
64330123.13FAIL

OpenZeka'nın ölçümünde, RTX PRO 6000 üzerinde vLLM ile BF16 formatında ve spekülatif kod çözmeyle sunulan Muse-Glimmer-30B (30B parametre), tek istekte istek başına 165,4 tok/s üretim hızına ve 118 ms ilk token süresine (TTFT) ulaştı.

Hız hedefleri ve kullanılabilir KV önbelleği kapasitesi göz önünde bulundurulduğunda, tahmini kapasite chat kullanımı için 128, agentic kullanım için 47 kullanıcıdır. Gerçekçi kapasite muhtemelen bu iki değer arasında olacaktır. Kodlama, araç kullanımı, uzun iş akışları ve çoklu ajan kullanımının ağırlıklı olduğu senaryolarda kapasite agentic tahmine yaklaşırken; daha kısa etkileşimlerin, standart sohbetlerin ve daha hafif görevlerin ağırlıkta olduğu kullanımlarda chat tahminine yaklaşacaktır.

Notlar: DFlash, native MTP k=15

Zekâ Endeksi ve Agentic Endeksi değerleri Artificial Analysis tarafından yayımlanmıştır ve kaynak belirtilerek burada aktarılmıştır.