๐Ÿ” Betrouwbaarheid

Dezelfde notulen-taak 5ร— herhaald bij temperature=0.7. Produceert het model consistente resultaten, of breekt er iets?

Wat test dit?

Dezelfde notulen-structureringstaak (raadsvergaderingstranscript โ†’ gestructureerde notulen) wordt 5 keer herhaald met temperature=0.7. Dit test niet of het model de taak kรกn doen, maar of het de taak consistent kan doen zonder te degraderen.

Herhalingen
5ร—
Temperature
0.7
Max tokens
3000
Thinking
UIT aanbevolen

๐Ÿ† Winnaars

๐Ÿ†

8 modellen scoren 5/5

De meeste modellen zijn consistent over 5 runs. Er is geen prestatieverlies bij herhaling โ€” met รฉรฉn opvallende uitzondering.

MiniMax-M2 faalt catastrofaal: 0/5 runs correct. Het model komt in een herhalingslus terecht โ€” het genereert dezelfde output steeds opnieuw tot het tokenbudget op is. Dit is een reproduceerbare bug die bij temperature=0.7 direct zichtbaar wordt.

Wat onthult deze test?

Reproduceerbare degradatie-bugs

De MiniMax-M2 herhalingslus is geen theoretisch risico โ€” het is een reproduceerbare bug die bij 5/5 runs optreedt. Dit soort bugs zijn onzichtbaar in single-run benchmarks maar fataal in productie. Alleen herhaald testen met niet-nul temperature kan ze blootleggen.

Consistentie is de norm โ€” behalve wanneer niet

De meerderheid van de modellen is perfect consistent (5/5). Maar de uitzonderingen zijn leerzaam: een model dat 4/4 scoort op de harde taken kan alsnog 0/5 scoren op betrouwbaarheid. Single-pass benchmarks missen deze dimensie volledig.

Alle modellen

ModelScoreNotities

Methodologie

Dezelfde notulen-taak 5ร— achter elkaar, zelfde prompt, temperature=0.7. Elke run wordt gecheckt op aanwezigheid van alle 3 verplichte headers (Besluiten, Actiepunten, Openstaande vragen).

python3 scripts/bench_notulen_repeat.py <port> <model_name> 5