OllamaのAPIレスポンスには、パフォーマンスとモデルの使用状況を測定するために使用できるメトリクスが含まれています:
total_duration: レスポンスの生成にかかった時間load_duration: モデルのロードにかかった時間prompt_eval_count: 処理された入力トークンの数prompt_eval_duration: プロンプトの評価にかかった時間eval_count: 処理された出力トークンの数eval_duration: 出力トークンの生成にかかった時間
すべての時間値はナノ秒単位で測定されます。
例のレスポンス
使用量メトリクスを返すエンドポイントの場合、レスポンスボディに使用量フィールドが含まれます。例えば、/api/generateへの非ストリーミング呼び出しでは、次のようなレスポンスが返されることがあります:
json
{
"model": "gemma4",
"created_at": "2025-10-17T23:14:07.414671Z",
"response": "Hello! How can I help you today?",
"done": true,
"done_reason": "stop",
"total_duration": 174560334,
"load_duration": 101397084,
"prompt_eval_count": 11,
"prompt_eval_duration": 13074791,
"eval_count": 18,
"eval_duration": 52479709
}ストリーミングレスポンスを返すエンドポイントの場合、使用量フィールドはdoneがtrueである最終チャンクの一部として含まれます。