Vier uitdagende taken die meerdere cognitieve vaardigheden tegelijk testen: redeneren, programmeren, structureren, en instructies volgen.
Vier taken die elk een combinatie van vaardigheden vereisen โ je kunt niet "รฉรฉn ding goed doen" en slagen. Dit is de meest discriminerende testcategorie: modellen die hier falen, vallen op meerdere dimensies door de mand.
GPT-OSS-120B, Gemma 4 31B, Qwen3-30B-A3B, Nemotron-3-Super, Nemotron-Nano, DeepSeek-V3, Qwen3.6-35B, en Kimi-K2. Alle acht voltooien alle vier de taken foutloos.
Uniek: Gemma 4 31B loste de rekenvraag correct op zonder thinking โ het enige model dat dit lukte. Alle andere 4/4-modellen vereisen thinking AAN voor de rekenvraag.
De harde taken onthullen de dualiteit van thinking-modus: voor rekenen is het essentieel, voor formaat-taken (notulen, JSON) is het contraproductief. Modellen die thinking forceren bij formaat-taken produceren vaak te lange, over-gestructureerde output die de JSON-validatie niet haalt.
De JSON-taak is verrassend moeilijk: veel modellen produceren geldige JSON maar schenden de constraints (te veel woorden, verkeerd aantal kernwoorden, ontbrekende velden). Dit test niet intelligentie maar instructie-volgend vermogen โ een cruciale eigenschap voor productie-gebruik.
| Model | Score | Details |
|---|
Elk model krijgt dezelfde 4 taken in dezelfde volgorde. Scoring: rekenen (correct eindantwoord), code (aanwezigheid LRUCache + OrderedDict), notulen (alle 3 headers), JSON (valide JSON + alle constraints).
python3 scripts/bench_hard.py <port> <model_name>
Gebruik --nothink voor formaat-taken โ rekenen vereist thinking AAN voor de meeste modellen.