Phản hồi từ API của Ollama bao gồm các chỉ số có thể được sử dụng để đo lường hiệu suất và mức sử dụng mô hình:
total_duration: Thời gian cần thiết để tạo ra phản hồiload_duration: Thời gian cần thiết để tải mô hìnhprompt_eval_count: Số lượng token đầu vào đã được xử lýprompt_eval_duration: Thời gian cần thiết để đánh giá prompteval_count: Số lượng token đầu ra đã được xử lýeval_duration: Thời gian cần thiết để tạo ra các token đầu ra
Tất cả các giá trị thời gian đều được đo bằng nano giây.
Ví dụ phản hồi
Đối với các endpoint trả về chỉ số sử dụng, nội dung phản hồi sẽ bao gồm các trường chỉ số sử dụng. Ví dụ, một lệnh gọi không streaming đến /api/generate có thể trả về phản hồi sau:
json
{
"model": "gemma4",
"created_at": "2025-10-17T23:14:07.414671Z",
"response": "Hello! How can I help you today?",
"done": true,
"done_reason": "stop",
"total_duration": 174560334,
"load_duration": 101397084,
"prompt_eval_count": 11,
"prompt_eval_duration": 13074791,
"eval_count": 18,
"eval_duration": 52479709
}Đối với các endpoint trả về phản hồi streaming, các trường chỉ số sử dụng được đưa vào phần cuối của chunk, nơi done có giá trị là true.