Skip to content

Les réponses de l'API Ollama incluent des métriques qui peuvent être utilisées pour mesurer les performances et l'utilisation du modèle :

  • total_duration : Durée nécessaire à la génération de la réponse
  • load_duration : Durée nécessaire au chargement du modèle
  • prompt_eval_count : Nombre de tokens d'entrée traités
  • prompt_eval_duration : Durée nécessaire à l'évaluation de l'invite
  • eval_count : Nombre de tokens de sortie traités
  • eval_duration : Durée nécessaire à la génération des tokens de sortie

Toutes les valeurs de durée sont exprimées en nanosecondes.

Exemple de réponse

Pour les points de terminaison qui renvoient des métriques d'utilisation, le corps de la réponse inclura les champs d'utilisation. Par exemple, un appel sans streaming vers /api/generate peut renvoyer la réponse suivante :

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

Pour les points de terminaison qui renvoient des réponses en streaming, les champs d'utilisation sont inclus dans le dernier bloc, lorsque done est défini sur true.