Mô hình đám mây
Các mô hình đám mây của Ollama là một loại mô hình mới trong Ollama có thể chạy mà không cần GPU mạnh. Thay vào đó, các mô hình đám mây sẽ được tự động chuyển sang dịch vụ đám mây của Ollama, đồng thời cung cấp các khả năng tương tự như các mô hình chạy cục bộ, giúp bạn có thể tiếp tục sử dụng các công cụ cục bộ của mình khi chạy các mô hình lớn hơn không thể chạy được trên máy tính cá nhân.
Các mô hình được hỗ trợ
Để xem danh sách các mô hình được hỗ trợ, hãy truy cập thư viện mô hình của Ollama.
Chạy các mô hình đám mây
Các mô hình đám mây của Ollama yêu cầu bạn có tài khoản trên ollama.com. Để đăng nhập hoặc tạo tài khoản, hãy chạy lệnh:
ollama signinCLI
Để chạy một mô hình đám mây, hãy mở terminal và chạy lệnh:
ollama run gpt-oss:120b-cloudPython
Trước tiên, hãy tải một mô hình đám mây để có thể truy cập được:
ollama pull gpt-oss:120b-cloudTiếp theo, hãy cài đặt thư viện Python của Ollama:
pip install ollamaTiếp theo, hãy tạo và chạy một đoạn mã Python đơn giản:
python
from ollama import Client
client = Client()
messages = [
{
'role': 'user',
'content': 'Why is the sky blue?',
},
]
for part in client.chat('gpt-oss:120b-cloud', messages=messages, stream=True):
print(part['message']['content'], end='', flush=True)JavaScript
Trước tiên, hãy tải một mô hình đám mây để có thể truy cập được:
ollama pull gpt-oss:120b-cloudTiếp theo, hãy cài đặt thư viện JavaScript của Ollama:
npm i ollamaSau đó, sử dụng thư viện này để chạy mô hình đám mây:
typescript
const ollama = new Ollama();
const response = await ollama.chat({
model: "gpt-oss:120b-cloud",
messages: [{ role: "user", content: "Explain quantum computing" }],
stream: true,
});
for await (const part of response) {
process.stdout.write(part.message.content);
}cURL
Trước tiên, hãy tải một mô hình đám mây để có thể truy cập được:
ollama pull gpt-oss:120b-cloudChạy lệnh cURL sau để thực hiện yêu cầu thông qua API của Ollama:
curl http://localhost:11434/api/chat -d '{
"model": "gpt-oss:120b-cloud",
"messages": [{
"role": "user",
"content": "Why is the sky blue?"
}],
"stream": false
}'Truy cập API đám mây
Các mô hình đám mây cũng có thể được truy cập trực tiếp thông qua API của ollama.com. Ở chế độ này, ollama.com đóng vai trò là máy chủ Ollama từ xa.
Xác thực
Để truy cập trực tiếp API của ollama.com, trước tiên hãy tạo một khóa API.
Sau đó, đặt biến môi trường OLLAMA_API_KEY thành khóa API của bạn.
export OLLAMA_API_KEY=your_api_keyLiệt kê các mô hình
Đối với các mô hình có sẵn trực tiếp thông qua API của Ollama, bạn có thể liệt kê chúng bằng lệnh:
curl https://ollama.com/api/tagsTạo phản hồi
Python
Trước tiên, hãy cài đặt thư viện Python của Ollama
pip install ollamaSau đó, gửi yêu cầu
python
from ollama import Client
client = Client(
host="https://ollama.com",
headers={'Authorization': 'Bearer ' + os.environ.get('OLLAMA_API_KEY')}
)
messages = [
{
'role': 'user',
'content': 'Why is the sky blue?',
},
]
for part in client.chat('gpt-oss:120b', messages=messages, stream=True):
print(part['message']['content'], end='', flush=True)JavaScript
Trước tiên, hãy cài đặt thư viện JavaScript của Ollama:
npm i ollamaTiếp theo, gửi yêu cầu đến mô hình:
typescript
const ollama = new Ollama({
host: "https://ollama.com",
headers: {
Authorization: "Bearer " + process.env.OLLAMA_API_KEY,
},
});
const response = await ollama.chat({
model: "gpt-oss:120b",
messages: [{ role: "user", content: "Explain quantum computing" }],
stream: true,
});
for await (const part of response) {
process.stdout.write(part.message.content);
}cURL
Tạo phản hồi thông qua API chat của Ollama:
curl https://ollama.com/api/chat \
-H "Authorization: Bearer $OLLAMA_API_KEY" \
-d '{
"model": "gpt-oss:120b",
"messages": [{
"role": "user",
"content": "Why is the sky blue?"
}],
"stream": false
}'Chỉ chạy cục bộ
Ollama có thể chạy ở chế độ chỉ cục bộ bằng cách tắt các tính năng đám mây của Ollama.
Ngừng hỗ trợ
Ollama sẽ thỉnh thoảng ngừng hỗ trợ và loại bỏ các mô hình đám mây cũ khi các mô hình nguồn mở mới và tốt hơn được phát hành. Các công cụ và ứng dụng phụ thuộc vào các mô hình Đám mây của Ollama có thể cần được cập nhật để tiếp tục hoạt động. Người dùng bị ảnh hưởng sẽ được thông báo trước khi mô hình bị ngừng hỗ trợ và loại bỏ. Các thông báo ngừng hỗ trợ sẽ được gửi qua email và đăng trên trang web của Ollama.
Việc ngừng hỗ trợ các mô hình Đám mây của Ollama không ảnh hưởng đến các mô hình chạy cục bộ.
Các mô hình sắp ngừng hỗ trợ
| Ngày ngừng hỗ trợ | Mô hình | Mô hình thay thế được đề xuất |
|---|---|---|
| July 15, 2026 | deepseek-v3.1:671b | deepseek-v4-flash |
| July 15, 2026 | deepseek-v3.2 | deepseek-v4-flash |
| July 15, 2026 | devstral-2:123b | mistral-large-3:675b |
| July 15, 2026 | devstral-small-2:24b | |
| July 15, 2026 | ministral-3:14b | |
| July 15, 2026 | ministral-3:3b | |
| July 15, 2026 | ministral-3:8b | |
| July 15, 2026 | gemini-3-flash-preview | minimax-m3 |
| July 15, 2026 | gemma3:12b | gemma4:31b |
| July 15, 2026 | gemma3:27b | gemma4:31b |
| July 15, 2026 | gemma3:4b | gemma4:31b |
| July 15, 2026 | glm-4.7 | glm-5.2 |
| July 15, 2026 | glm-5 | glm-5.2 |
| July 15, 2026 | minimax-m2.1 | minimax-m3 |
| July 15, 2026 | qwen3-coder-next | qwen3.5:397b |
| July 15, 2026 | qwen3-coder:480b | qwen3.5:397b |
Các mô hình đã ngừng hỗ trợ
Ngày 30 tháng 6 năm 2026
| Mô hình | Mô hình thay thế được đề xuất |
| --- | --- |
| `rnj-1:8b` | |
Ngày 16 tháng 6 năm 2026
| Mô hình | Mô hình thay thế được đề xuất |
| --- | --- |
| `kimi-k2-thinking` | `kimi-k2.6` |
| `kimi-k2:1t` | `kimi-k2.6` |
| `minimax-m2` | `minimax-m3` |
| `glm-4.6` | `glm-5.1` |
| `qwen3-next:80b` | `qwen3.5` |
| `qwen3-vl:235b` | `qwen3.5` |
| `qwen3-vl:235b-instruct` | `qwen3.5` |
| `cogito-2.1:671b` | `deepseek-v4-flash` |