Hoe snel kan elk model lezen (prompt processing) en schrijven (generatie)? Gemeten met llama-bench op dezelfde hardware.
De snelheidstest meet prompt processing tokens per seconde (pp512 = hoe snel het model een 512-token prompt verwerkt) en generatie tokens per seconde (tg128 = hoe snel het model 128 nieuwe tokens genereert). Dit is een pure hardware+software-throughput test via llama-bench โ er komt geen intelligentie of correctheid aan te pas.
De test draait lokaal op de GX10 (NVIDIA GB10 Grace Blackwell, 128GB unified memory, ~273 GB/s bandbreedte). Alle modellen draaien volledig op GPU (-ngl 999) met de hoogste kwantisatie die past.
1978 t/s prompt processing โ bijna 4ร de bandbreedtelimiet van de hardware. Generatie: 58.1 t/s, slechts 35GB op schijf.
Qwen3-30B-A3B is nipt sneller in generatie (60 t/s, 1958 t/s prompt), maar de Nemotron-3.5 wint overall door de combinatie van bijna-perfecte scores รฉn topsnelheid.
Het meest fundamentele patroon in de hele benchmark-suite: MoE-modellen zijn 3-20ร sneller dan dense modellen op deze hardwareklasse. De GX10 heeft 273 GB/s bandbreedte โ ruim, maar niet oneindig. Een dense model moet รกlle parameters per token lezen; een MoE-model activeert slechts een fractie.
Dit is gรฉรฉn kritiek op dense architecturen โ het is een harde fysieke realiteit bij 273 GB/s. Op een H100 (3.3 TB/s) zou het verschil veel kleiner zijn.
Nemotron-3.5 en Qwen3-30B halen ~1978 t/s prompt processing โ dat is bijna 4ร de theoretische bandbreedtelimiet. Dit kรกn alleen als de prompt niet volledig uit het geheugen gelezen hoeft te worden (bijv. gedeelde embeddings, KV-caching, of batch-efficiรซntie in llama.cpp's --cont-batching). In de praktijk is deze anomalie consistent reproduceerbaar โ het is een echte prestatie, geen meetfout.
n.v.t. = model past niet in GPU-geheugen; โ = niet gemeten (afgevallen vรณรณr snelheidsmeting)
| Model | Gen t/s | Prompt t/s | Schijf | Params | Architectuur |
|---|
Gesorteerd op generatie-snelheid (hoogste eerst). De balkjes zijn relatief t.o.v. de snelste in die kolom.
llama-bench -m <model>.gguf -ngl 999
Dit draait de standaard pp512 + tg128 benchmark van llama.cpp: verwerk 512 tokens (prompt), genereer er 128 (generatie). De output is het gemiddelde van meerdere runs. Alle lagen op GPU (-ngl 999), geen CPU-offload.
Voor modellen die niet in 124.5GB GPU-geheugen passen (Kimi K2, DeepSeek-V3, GLM-4.6) is geen snelheid gemeten โ die vallen in de categorie "past niet".