Ollama's API-antwoorden bevatten metingen die gebruikt kunnen worden om prestaties en modelgebruik te meten:
total_duration: Hoe lang het duurde om het antwoord te genererenload_duration: Hoe lang het duurde om het model te ladenprompt_eval_count: Hoeveel invoertokens zijn verwerktprompt_eval_duration: Hoe lang het duurde om de prompt te evaluereneval_count: Hoeveel uitvoertokens zijn verwerkteval_duration: Hoe lang het duurde om de uitvoertokens te genereren
Alle tijdmetingen worden in nanoseconden gemeten.
Voorbeeldantwoord
Voor endpoints die gebruiksmetingen retourneren, bevat het antwoordbody de gebruiksvelden. Bijvoorbeeld, een niet-streamende aanroep naar /api/generate kan het volgende antwoord retourneren:
json
{
"model": "gemma4",
"created_at": "2025-10-17T23:14:07.414671Z",
"response": "Hello! How can I help you today?",
"done": true,
"done_reason": "stop",
"total_duration": 174560334,
"load_duration": 101397084,
"prompt_eval_count": 11,
"prompt_eval_duration": 13074791,
"eval_count": 18,
"eval_duration": 52479709
}Voor endpoints die streamende antwoorden retourneren, zijn de gebruiksvelden opgenomen als onderdeel van de laatste chunk, waar done true is.