โšก Snelheid

Hoe snel kan elk model lezen (prompt processing) en schrijven (generatie)? Gemeten met llama-bench op dezelfde hardware.

Wat test dit?

De snelheidstest meet prompt processing tokens per seconde (pp512 = hoe snel het model een 512-token prompt verwerkt) en generatie tokens per seconde (tg128 = hoe snel het model 128 nieuwe tokens genereert). Dit is een pure hardware+software-throughput test via llama-bench โ€” er komt geen intelligentie of correctheid aan te pas.

De test draait lokaal op de GX10 (NVIDIA GB10 Grace Blackwell, 128GB unified memory, ~273 GB/s bandbreedte). Alle modellen draaien volledig op GPU (-ngl 999) met de hoogste kwantisatie die past.

Tool
llama-bench
Prompt
512 tokens
Generatie
128 tokens
Gemeten
Tokens/seconde

๐Ÿ† Winnaar

๐Ÿ†

Nemotron-3.5-Lightning-30B-A3B โ€” Snelste prompt processing

1978 t/s prompt processing โ€” bijna 4ร— de bandbreedtelimiet van de hardware. Generatie: 58.1 t/s, slechts 35GB op schijf.

Qwen3-30B-A3B is nipt sneller in generatie (60 t/s, 1958 t/s prompt), maar de Nemotron-3.5 wint overall door de combinatie van bijna-perfecte scores รฉn topsnelheid.

Wat onthult deze test?

MoE vs Dense op bandbreedte-gelimiteerde hardware

Het meest fundamentele patroon in de hele benchmark-suite: MoE-modellen zijn 3-20ร— sneller dan dense modellen op deze hardwareklasse. De GX10 heeft 273 GB/s bandbreedte โ€” ruim, maar niet oneindig. Een dense model moet รกlle parameters per token lezen; een MoE-model activeert slechts een fractie.

Dit is gรฉรฉn kritiek op dense architecturen โ€” het is een harde fysieke realiteit bij 273 GB/s. Op een H100 (3.3 TB/s) zou het verschil veel kleiner zijn.

Prompt processing anomalie

Nemotron-3.5 en Qwen3-30B halen ~1978 t/s prompt processing โ€” dat is bijna 4ร— de theoretische bandbreedtelimiet. Dit kรกn alleen als de prompt niet volledig uit het geheugen gelezen hoeft te worden (bijv. gedeelde embeddings, KV-caching, of batch-efficiรซntie in llama.cpp's --cont-batching). In de praktijk is deze anomalie consistent reproduceerbaar โ€” het is een echte prestatie, geen meetfout.

Alle modellen

n.v.t. = model past niet in GPU-geheugen; โ€” = niet gemeten (afgevallen vรณรณr snelheidsmeting)

ModelGen t/sPrompt t/sSchijfParamsArchitectuur

Gesorteerd op generatie-snelheid (hoogste eerst). De balkjes zijn relatief t.o.v. de snelste in die kolom.

Methodologie

llama-bench -m <model>.gguf -ngl 999

Dit draait de standaard pp512 + tg128 benchmark van llama.cpp: verwerk 512 tokens (prompt), genereer er 128 (generatie). De output is het gemiddelde van meerdere runs. Alle lagen op GPU (-ngl 999), geen CPU-offload.

Voor modellen die niet in 124.5GB GPU-geheugen passen (Kimi K2, DeepSeek-V3, GLM-4.6) is geen snelheid gemeten โ€” die vallen in de categorie "past niet".