Les réponses de l'API Ollama incluent des métriques qui peuvent être utilisées pour mesurer les performances et l'utilisation du modèle :
total_duration: Durée nécessaire à la génération de la réponseload_duration: Durée nécessaire au chargement du modèleprompt_eval_count: Nombre de tokens d'entrée traitésprompt_eval_duration: Durée nécessaire à l'évaluation de l'inviteeval_count: Nombre de tokens de sortie traitéseval_duration: Durée nécessaire à la génération des tokens de sortie
Toutes les valeurs de durée sont exprimées en nanosecondes.
Exemple de réponse
Pour les points de terminaison qui renvoient des métriques d'utilisation, le corps de la réponse inclura les champs d'utilisation. Par exemple, un appel sans streaming vers /api/generate peut renvoyer la réponse suivante :
json
{
"model": "gemma4",
"created_at": "2025-10-17T23:14:07.414671Z",
"response": "Hello! How can I help you today?",
"done": true,
"done_reason": "stop",
"total_duration": 174560334,
"load_duration": 101397084,
"prompt_eval_count": 11,
"prompt_eval_duration": 13074791,
"eval_count": 18,
"eval_duration": 52479709
}Pour les points de terminaison qui renvoient des réponses en streaming, les champs d'utilisation sont inclus dans le dernier bloc, lorsque done est défini sur true.