Skip to content

OllamaのAPIレスポンスには、パフォーマンスとモデルの使用状況を測定するために使用できるメトリクスが含まれています:

  • total_duration: レスポンスの生成にかかった時間
  • load_duration: モデルのロードにかかった時間
  • prompt_eval_count: 処理された入力トークンの数
  • prompt_eval_duration: プロンプトの評価にかかった時間
  • eval_count: 処理された出力トークンの数
  • eval_duration: 出力トークンの生成にかかった時間

すべての時間値はナノ秒単位で測定されます。

例のレスポンス

使用量メトリクスを返すエンドポイントの場合、レスポンスボディに使用量フィールドが含まれます。例えば、/api/generateへの非ストリーミング呼び出しでは、次のようなレスポンスが返されることがあります:

json
{
  "model": "gemma4",
  "created_at": "2025-10-17T23:14:07.414671Z",
  "response": "Hello! How can I help you today?",
  "done": true,
  "done_reason": "stop",
  "total_duration": 174560334,
  "load_duration": 101397084,
  "prompt_eval_count": 11,
  "prompt_eval_duration": 13074791,
  "eval_count": 18,
  "eval_duration": 52479709
}

ストリーミングレスポンスを返すエンドポイントの場合、使用量フィールドはdonetrueである最終チャンクの一部として含まれます。