Ollama 的 API 响应包含可用于衡量性能和模型使用情况的指标:
total_duration:生成响应所花费的时间load_duration:加载模型所花费的时间prompt_eval_count:处理了多少个输入 tokenprompt_eval_duration:评估提示词所花费的时间eval_count:生成了多少个输出 tokeneval_duration:生成输出 token 所花费的时间
所有时间值均以纳秒为单位。
响应示例
对于返回使用量指标的端点,响应体将包含 usage 字段。例如,对 /api/generate 的非流式调用可能返回以下响应:
json
{
"model": "gemma4",
"created_at": "2025-10-17T23:14:07.414671Z",
"response": "Hello! How can I help you today?",
"done": true,
"done_reason": "stop",
"total_duration": 174560334,
"load_duration": 101397084,
"prompt_eval_count": 11,
"prompt_eval_duration": 13074791,
"eval_count": 18,
"eval_duration": 52479709
}对于返回流式响应的端点,usage 字段会包含在最后一个数据块中,此时 done 为 true。