14 vragen over scheikunde, geschiedenis, geografie, biologie, wiskunde, technologie, literatuur, astronomie, economie, muziek en natuurkunde โ plus 2 kennis+redeneer-combinaties.
12 pure kennisvragen uit 12 verschillende domeinen plus 2 "combo"-vragen die kennis combineren met redeneren. Dit test de breedte en accuraatheid van de in het model opgeslagen kennis.
Beide modellen hebben perfecte feitelijke kennis over 12 domeinen. De meeste andere modellen scoren 11-13/14 โ de combo-vragen zijn de grootste uitdaging.
Gemma 4: 12/14 zonder thinking. Met thinking AAN voor alleen de 2 combo-vragen stijgt de score naar 14/14 โ het denken helpt specifiek bij het combineren van twee feiten (bijv. leeftijd berekenen uit geboortejaar en datum).
De twee combo-vragen (Franse koning in 1789 + aantal regeerjaren; leeftijd Napoleon bij Waterloo) zijn de grootste filters. Modellen weten beide losse feiten vaak wel, maar het combineren ervan vereist een extra redeneerstap die zonder thinking vaak mislukt.
Modellen scoren het best op scheikunde, geschiedenis, en astronomie. Literatuur en muziek zijn de zwakste domeinen โ meerdere modellen missen de auteur van "De ontdekking van de hemel" en het aantal delen van Beethovens 9e.
| Model | Score | Details |
|---|
14 vragen in รฉรฉn sessie. Scoring via keyword-matching (case-insensitive). Combo-vragen accepteren alternatieve antwoorden (45/46 voor Napoleon).
python3 scripts/bench_knowledge.py <port> <model_name>
Gebruik --nothink voor de 12 pure kennisvragen. De 2 combo-vragen scoren het best met thinking AAN.