Skip to content

Las respuestas de la API de Ollama incluyen métricas que se pueden utilizar para medir el rendimiento y el uso del modelo:

  • total_duration: Cuánto tardó en generarse la respuesta
  • load_duration: Cuánto tardó en cargarse el modelo
  • prompt_eval_count: Cuántos tokens de entrada se procesaron
  • prompt_eval_duration: Cuánto tardó en evaluarse el prompt
  • eval_count: Cuántos tokens de salida se procesaron
  • eval_duration: Cuánto tardó en generarse los tokens de salida

Todos los valores de tiempo se miden en nanosegundos.

Ejemplo de respuesta ​

Para los endpoints que devuelven métricas de uso, el cuerpo de la respuesta incluirá los campos de uso. Por ejemplo, una llamada no en streaming a /api/generate puede devolver la siguiente respuesta:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

Para los endpoints que devuelven respuestas en streaming, los campos de uso se incluyen como parte del fragmento final, donde done es true.