Motore
Le configurazioni installate, le loro misure e se questa macchina le può far girare con questo modello. Cambiare configurazione ricarica il modello: fino a 5 minuti con il motore tensor parallel.
Configurazioni misurate
| Nome | Configurazione | Decode | Prefill | Stato |
|---|
Sessione singola, Qwen3.8-Flash-Next Q4_K_M
decode in token/s · prefill in secondi| Configurazione | 449 token | 4033 | 8129 | Prefill 4033 | Fonte |
|---|---|---|---|---|---|
| Catena, 4 GPU | 38,3 | 37,4 | 36,3 | 9,7 | goal 290–309 |
| Catena, 8 GPU | ~35 | — | — | 6,9 | goal 308–309 |
| Tensor parallel, 4 GPU | 79,0 | 75,2 | 69,1 | 6,2 | goal 311–314 |
| Tensor parallel, 8 GPU | 85,6 | 83,8 | 78,4 | 7,1 | goal 314 |
| Due istanze TP4, due utenti (totale) | 157,5 | 150,4 | 138,0 | 7,9 | goal 313 |
Macchina
SRVAIXEON · lettura ogni 3 secondi
CPU
Cosa può far girare questa macchina
lettura del modello…Profilo
Le risposte delle tue conversazioni, e dove va il tempo secondo i profili misurati nei goal.
Decode
token/s · ultimi 30 turniPrimo token
secondi · ultimi 30 turniPrefill di 4033 token, TP4
secondi per fase · goal 314Un token di decode, TP4
millisecondi · goal 311Ogni token richiede 96 somme fra le GPU. Fatte sul device costano di più (eventi 53 µs) o non sono affidabili su questo runtime: restano sulla CPU (goal 313).
Atlante degli expert
48 layer, 512 expert instradati e uno condiviso per layer. Ogni riga è un layer; il colore dice quale gruppo di GPU ospita l'expert nel tensor parallel a 8.
Prossimo passo: accendere gli expert scelti dal router durante la risposta. Il motore li conosce già sulla GPU; finché non li esporta, la mappa mostra solo dove vivono.
Decisioni
Domande a risposta chiusa: la probabilità di ogni risposta ammessa e l'entropia, senza generare testo.
Referti
Ogni numero di questa pagina viene da un referto nel repository, con ambiente, comando e limiti di validità.
| Goal | Risultato | Documento |
|---|