๐Ÿ”ง Tool-gebruik

Kan het model externe functies correct aanroepen? Vier scenario's testen enkelvoudig gebruik, ketens, vermijding, en conditionele multi-tool logica.

Wat test dit?

Vier scenario's die oplopen in complexiteit, met 3 mock-tools: get_weather, calculate, en search_klantendatabase. Het model moet tools correct selecteren, parametriseren, en in de juiste volgorde aanroepen.

Scenario's
4
Mock tools
3
Temperature
0.1
Thinking
UIT vereist

๐Ÿ† Winnaars

๐Ÿ†

4 modellen scoren 4/4

GPT-OSS-120B, Nemotron-3.5-Lightning, Qwen3.6-35B, en Gemma 4 31B voltooien alle vier scenario's correct.

Vereist: Server moet gestart zijn met --jinja flag voor correcte chat-template verwerking van tool-calls. Zonder jinja werkt tool-calling niet bij de meeste modellen.

Wat onthult deze test?

--jinja is geen optie, het is verplicht

Zonder de --jinja server-flag faalt tool-calling bij vrijwel alle modellen. Dit is een veelvoorkomende valkuil in productie: tool-calling werkt perfect in de documentatie, maar in de praktijk ontbreekt de flag en faalt alles zonder duidelijke foutmelding.

Alle modellen

ModelScoreDetails

Alleen modellen die de tools-test hebben ondergaan (vele vielen af omdat tool-calling met llama.cpp specifieke chat-template support vereist).

Methodologie

4 scenario's: enkelvoudige tool-call, geketende calls (weer โ†’ rekenen), irrelevante tool-vermijding (Parijs-vraag), en conditionele multi-tool logica (klant opzoeken โ†’ conditioneel weer). Scoring valideert tool-call traces op juiste functienaam, parameters, en volgorde.

python3 scripts/bench_tools.py <port> <model_name>

Server starten met: llama-server ... --jinja