Thor üzerinde Gemma-4-31B-it — NVFP4, vLLM, TP1, spekülatif kod çözme k=3 çıkarım benchmark'ı
Bu yapılandırmayı LLM Çıkarım Benchmark Gezgini'nde aç
| Model | Gemma-4-31B-it |
|---|---|
| Parametre | 31B |
| Zekâ Endeksi | 14.7 |
| Agentic Endeksi | 4.2 |
| Cihaz | Thor |
| Kuantizasyon | NVFP4 |
| Maks C | 0 |
| Chat Kapasitesi | 0 |
| Agentic Kapasitesi | 0 |
| TP | — |
| DP | — |
| PP | — |
| Inference Engine | vLLM |
| Spekülatif Kod Çözme | Evet |
| C | TTFT (ms) | TPS (tok/s) | Durum |
|---|---|---|---|
| 1 | 336 | 16.16 | FAIL |
| 2 | 478 | 15.38 | FAIL |
| 4 | 491 | 14.59 | FAIL |
| 8 | 507 | 14.72 | FAIL |
OpenZeka'nın ölçümünde, Thor üzerinde vLLM ile NVFP4 formatında ve spekülatif kod çözmeyle sunulan Gemma-4-31B-it (31B parametre), tek istekte istek başına 16,2 tok/s üretim hızına ve 336 ms ilk token süresine (TTFT) ulaştı.
Varsayılan hız hedeflerinde (istek başına en az 20 tok/s, en fazla 1.000 ms TTFT) bu yapılandırma için bir kapasite tahmini çıkmıyor: ölçülen hiçbir yük seviyesi bu hedefleri karşılamadı.
Notlar: Speculative MTP k=3. Served as gemma-4-31b-it. Model: nvidia/gemma-4-31B-it-NVFP4. 256K context
Zekâ Endeksi ve Agentic Endeksi değerleri Artificial Analysis tarafından yayımlanmıştır ve kaynak belirtilerek burada aktarılmıştır.
OpenZeka'nın ölçümünde, Thor üzerinde vLLM ile NVFP4 formatında ve spekülatif kod çözmeyle sunulan Gemma-4-31B-it (31B parametre), tek istekte istek başına 16,2 tok/s üretim hızına ve 336 ms ilk token süresine (TTFT) ulaştı.
Varsayılan hız hedeflerinde (istek başına en az 20 tok/s, en fazla 1.000 ms TTFT) bu yapılandırma için bir kapasite tahmini çıkmıyor: ölçülen hiçbir yük seviyesi bu hedefleri karşılamadı.