Dezelfde notulen-taak 5ร herhaald bij temperature=0.7. Produceert het model consistente resultaten, of breekt er iets?
Dezelfde notulen-structureringstaak (raadsvergaderingstranscript โ gestructureerde notulen) wordt 5 keer herhaald met temperature=0.7. Dit test niet of het model de taak kรกn doen, maar of het de taak consistent kan doen zonder te degraderen.
De meeste modellen zijn consistent over 5 runs. Er is geen prestatieverlies bij herhaling โ met รฉรฉn opvallende uitzondering.
MiniMax-M2 faalt catastrofaal: 0/5 runs correct. Het model komt in een herhalingslus terecht โ het genereert dezelfde output steeds opnieuw tot het tokenbudget op is. Dit is een reproduceerbare bug die bij temperature=0.7 direct zichtbaar wordt.
De MiniMax-M2 herhalingslus is geen theoretisch risico โ het is een reproduceerbare bug die bij 5/5 runs optreedt. Dit soort bugs zijn onzichtbaar in single-run benchmarks maar fataal in productie. Alleen herhaald testen met niet-nul temperature kan ze blootleggen.
De meerderheid van de modellen is perfect consistent (5/5). Maar de uitzonderingen zijn leerzaam: een model dat 4/4 scoort op de harde taken kan alsnog 0/5 scoren op betrouwbaarheid. Single-pass benchmarks missen deze dimensie volledig.
| Model | Score | Notities |
|---|
Dezelfde notulen-taak 5ร achter elkaar, zelfde prompt, temperature=0.7. Elke run wordt gecheckt op aanwezigheid van alle 3 verplichte headers (Besluiten, Actiepunten, Openstaande vragen).
python3 scripts/bench_notulen_repeat.py <port> <model_name> 5