Las respuestas de la API de Ollama incluyen métricas que se pueden utilizar para medir el rendimiento y el uso del modelo:
total_duration: Cuánto tardó en generarse la respuestaload_duration: Cuánto tardó en cargarse el modeloprompt_eval_count: Cuántos tokens de entrada se procesaronprompt_eval_duration: Cuánto tardó en evaluarse el prompteval_count: Cuántos tokens de salida se procesaroneval_duration: Cuánto tardó en generarse los tokens de salida
Todos los valores de tiempo se miden en nanosegundos.
Ejemplo de respuesta
Para los endpoints que devuelven métricas de uso, el cuerpo de la respuesta incluirá los campos de uso. Por ejemplo, una llamada no en streaming a /api/generate puede devolver la siguiente respuesta:
json
{
"model": "gemma4",
"created_at": "2025-10-17T23:14:07.414671Z",
"response": "Hello! How can I help you today?",
"done": true,
"done_reason": "stop",
"total_duration": 174560334,
"load_duration": 101397084,
"prompt_eval_count": 11,
"prompt_eval_duration": 13074791,
"eval_count": 18,
"eval_duration": 52479709
}Para los endpoints que devuelven respuestas en streaming, los campos de uso se incluyen como parte del fragmento final, donde done es true.