Kan het model externe functies correct aanroepen? Vier scenario's testen enkelvoudig gebruik, ketens, vermijding, en conditionele multi-tool logica.
Vier scenario's die oplopen in complexiteit, met 3 mock-tools: get_weather, calculate, en search_klantendatabase. Het model moet tools correct selecteren, parametriseren, en in de juiste volgorde aanroepen.
GPT-OSS-120B, Nemotron-3.5-Lightning, Qwen3.6-35B, en Gemma 4 31B voltooien alle vier scenario's correct.
Vereist: Server moet gestart zijn met --jinja flag voor correcte chat-template verwerking van tool-calls. Zonder jinja werkt tool-calling niet bij de meeste modellen.
Zonder de --jinja server-flag faalt tool-calling bij vrijwel alle modellen. Dit is een veelvoorkomende valkuil in productie: tool-calling werkt perfect in de documentatie, maar in de praktijk ontbreekt de flag en faalt alles zonder duidelijke foutmelding.
| Model | Score | Details |
|---|
Alleen modellen die de tools-test hebben ondergaan (vele vielen af omdat tool-calling met llama.cpp specifieke chat-template support vereist).
4 scenario's: enkelvoudige tool-call, geketende calls (weer โ rekenen), irrelevante tool-vermijding (Parijs-vraag), en conditionele multi-tool logica (klant opzoeken โ conditioneel weer). Scoring valideert tool-call traces op juiste functienaam, parameters, en volgorde.
python3 scripts/bench_tools.py <port> <model_name>
Server starten met: llama-server ... --jinja