Skip to content

Ollama 的 API 回應包含可用於衡量效能與模型使用的指標:

  • total_duration: 產生回應所需的總時間
  • load_duration: 模型載入所需的時間
  • prompt_eval_count: 已處理的輸入 Token 數量
  • prompt_eval_duration: 評估 Prompt 所需的時間
  • eval_count: 已處理的輸出 Token 數量
  • eval_duration: 產生輸出 Tokens 所需的時間

所有時間值均以奈秒 (nanoseconds) 為單位。

範例回應

對於回傳使用指標的端點,回應主體將包含 usage 欄位。例如,對 /api/generate 的非串流 (non-streaming) 調用可能會返回以下回應:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

對於回傳串流回應 (streaming responses) 的端點,usage 欄位將包含在最後的區塊中,此時 donetrue