Skip to content

Les réponses de l'API Ollama incluent des métriques qui peuvent être utilisées pour mesurer les performances et l'utilisation du modèle :

  • total_duration : Durée nécessaire à la génération de la réponse
  • load_duration : Durée nécessaire au chargement du modèle
  • prompt_eval_count : Nombre de tokens d'entrée traités
  • prompt_eval_duration : Durée nécessaire à l'évaluation de l'invite
  • eval_count : Nombre de tokens de sortie traités
  • eval_duration : Durée nécessaire à la génération des tokens de sortie

Toutes les valeurs de durée sont exprimées en nanosecondes.

Exemple de réponse ​

Pour les points de terminaison qui renvoient des métriques d'utilisation, le corps de la réponse inclura les champs d'utilisation. Par exemple, un appel sans streaming vers /api/generate peut renvoyer la réponse suivante :

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

Pour les points de terminaison qui renvoient des réponses en streaming, les champs d'utilisation sont inclus dans le dernier bloc, lorsque done est défini sur true.