Skip to content

Ollama's API-antwoorden bevatten metingen die gebruikt kunnen worden om prestaties en modelgebruik te meten:

  • total_duration: Hoe lang het duurde om het antwoord te genereren
  • load_duration: Hoe lang het duurde om het model te laden
  • prompt_eval_count: Hoeveel invoertokens zijn verwerkt
  • prompt_eval_duration: Hoe lang het duurde om de prompt te evalueren
  • eval_count: Hoeveel uitvoertokens zijn verwerkt
  • eval_duration: Hoe lang het duurde om de uitvoertokens te genereren

Alle tijdmetingen worden in nanoseconden gemeten.

Voorbeeldantwoord

Voor endpoints die gebruiksmetingen retourneren, bevat het antwoordbody de gebruiksvelden. Bijvoorbeeld, een niet-streamende aanroep naar /api/generate kan het volgende antwoord retourneren:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

Voor endpoints die streamende antwoorden retourneren, zijn de gebruiksvelden opgenomen als onderdeel van de laatste chunk, waar done true is.