LLM Çıkarım Benchmark Gezgini

DGX B300 üzerinde MiMo-V2.6-Pro-MOPD — FP4, vLLM, TP4, spekülatif kod çözme k=7 çıkarım benchmark'ı

Bu yapılandırmayı LLM Çıkarım Benchmark Gezgini'nde aç

ModelMiMo-V2.6-Pro-MOPD
Parametre1.02T
Zekâ Endeksi46.3
Agentic Endeksi—
CihazDGX B300
KuantizasyonFP4
Maks C256+
Chat Kapasitesi954
Agentic Kapasitesi246
TP4
DP—
PP—
Inference EnginevLLM
Spekülatif Kod ÇözmeEvet
CTTFT (ms)TPS (tok/s)Durum
160316.50PASS
268257.75PASS
480214.21PASS
8100163.11PASS
16126131.72PASS
32172108.05PASS
6417286.08PASS
12830751.18PASS
25653527.91PASS

OpenZeka'nın ölçümünde, DGX B300 üzerinde vLLM ile FP4 formatında ve spekülatif kod çözmeyle sunulan MiMo-V2.6-Pro-MOPD (1,02T parametre, TP=4), tek istekte istek başına 316,5 tok/s üretim hızına ve 60 ms ilk token süresine (TTFT) ulaştı.

Hız hedefleri ve kullanılabilir KV önbelleği kapasitesi göz önünde bulundurulduğunda, tahmini kapasite chat kullanımı için 954, agentic kullanım için 246 kullanıcıdır. Gerçekçi kapasite muhtemelen bu iki değer arasında olacaktır. Kodlama, araç kullanımı, uzun iş akışları ve çoklu ajan kullanımının ağırlıklı olduğu senaryolarda kapasite agentic tahmine yaklaşırken; daha kısa etkileşimlerin, standart sohbetlerin ve daha hafif görevlerin ağırlıkta olduğu kullanımlarda chat tahminine yaklaşacaktır.

Notlar: DFlash speculative decoding k=7, 1M context. Model: XiaomiMiMo/MiMo-V2.6-Pro-MOPD

Zekâ Endeksi ve Agentic Endeksi değerleri Artificial Analysis tarafından yayımlanmıştır ve kaynak belirtilerek burada aktarılmıştır.