Skip to content

Las respuestas de la API de Ollama incluyen métricas que se pueden utilizar para medir el rendimiento y el uso del modelo:

  • total_duration: Cuánto tardó en generarse la respuesta
  • load_duration: Cuánto tardó en cargarse el modelo
  • prompt_eval_count: Cuántos tokens de entrada se procesaron
  • prompt_eval_duration: Cuánto tardó en evaluarse el prompt
  • eval_count: Cuántos tokens de salida se procesaron
  • eval_duration: Cuánto tardó en generarse los tokens de salida

Todos los valores de tiempo se miden en nanosegundos.

Ejemplo de respuesta

Para los endpoints que devuelven métricas de uso, el cuerpo de la respuesta incluirá los campos de uso. Por ejemplo, una llamada no en streaming a /api/generate puede devolver la siguiente respuesta:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

Para los endpoints que devuelven respuestas en streaming, los campos de uso se incluyen como parte del fragmento final, donde done es true.