Skip to content

As respostas da API do Ollama incluem métricas que podem ser usadas para medir o desempenho e o uso do modelo:

  • total_duration: Quanto tempo a resposta levou para ser gerada
  • load_duration: Quanto tempo o modelo levou para ser carregado
  • prompt_eval_count: Quantos tokens de entrada foram processados
  • prompt_eval_duration: Quanto tempo levou para avaliar o prompt
  • eval_count: Quantos tokens de saída foram processados
  • eval_duration: Quanto tempo levou para gerar os tokens de saída

Todos os valores de tempo são medidos em nanossegundos.

Exemplo de resposta

Para endpoints que retornam métricas de uso, o corpo da resposta incluirá os campos de uso. Por exemplo, uma chamada não streaming para /api/generate pode retornar a seguinte resposta:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

Para endpoints que retornam respostas streaming, os campos de uso são incluídos como parte do chunk final, onde done é true.