Modelos de Nuvem
Os modelos de nuvem do Ollama são um novo tipo de modelo na plataforma que pode ser executado sem uma GPU potente. Em vez disso, os modelos de nuvem são automaticamente descarregados para o serviço de nuvem do Ollama, mantendo as mesmas capacidades dos modelos locais, o que possibilita continuar usando suas ferramentas locais enquanto executa modelos maiores que não caberiam em um computador pessoal.
Modelos suportados
Para ver uma lista de modelos suportados, consulte a biblioteca de modelos do Ollama.
Executando modelos de nuvem
Os modelos de nuvem do Ollama exigem uma conta no ollama.com. Para fazer login ou criar uma conta, execute:
ollama signinCLI
Para executar um modelo de nuvem, abra o terminal e execute:
ollama run gpt-oss:120b-cloudPython
Primeiro, baixe um modelo de nuvem para que ele possa ser acessado:
ollama pull gpt-oss:120b-cloudEm seguida, instale a biblioteca Python do Ollama:
pip install ollamaEm seguida, crie e execute um script Python simples:
python
from ollama import Client
client = Client()
messages = [
{
'role': 'user',
'content': 'Why is the sky blue?',
},
]
for part in client.chat('gpt-oss:120b-cloud', messages=messages, stream=True):
print(part['message']['content'], end='', flush=True)JavaScript
Primeiro, baixe um modelo de nuvem para que ele possa ser acessado:
ollama pull gpt-oss:120b-cloudEm seguida, instale a biblioteca JavaScript do Ollama:
npm i ollamaEm seguida, use a biblioteca para executar um modelo de nuvem:
typescript
const ollama = new Ollama();
const response = await ollama.chat({
model: "gpt-oss:120b-cloud",
messages: [{ role: "user", content: "Explain quantum computing" }],
stream: true,
});
for await (const part of response) {
process.stdout.write(part.message.content);
}cURL
Primeiro, baixe um modelo de nuvem para que ele possa ser acessado:
ollama pull gpt-oss:120b-cloudExecute o seguinte comando cURL para executar a operação por meio da API do Ollama:
curl http://localhost:11434/api/chat -d '{
"model": "gpt-oss:120b-cloud",
"messages": [{
"role": "user",
"content": "Why is the sky blue?"
}],
"stream": false
}'Acesso à API de Nuvem
Os modelos de nuvem também podem ser acessados diretamente pela API do ollama.com. Nesse modo, o ollama.com funciona como um host Ollama remoto.
Autenticação
Para acesso direto à API do ollama.com, primeiro crie uma chave de API.
Em seguida, defina a variável de ambiente OLLAMA_API_KEY com sua chave de API.
export OLLAMA_API_KEY=your_api_keyListando modelos
Para listar os modelos disponíveis diretamente pela API do Ollama, execute:
curl https://ollama.com/api/tagsGerando uma resposta
Python
Primeiro, instale a biblioteca Python do Ollama
pip install ollamaEm seguida, faça uma requisição
python
from ollama import Client
client = Client(
host="https://ollama.com",
headers={'Authorization': 'Bearer ' + os.environ.get('OLLAMA_API_KEY')}
)
messages = [
{
'role': 'user',
'content': 'Why is the sky blue?',
},
]
for part in client.chat('gpt-oss:120b', messages=messages, stream=True):
print(part['message']['content'], end='', flush=True)JavaScript
Primeiro, instale a biblioteca JavaScript do Ollama:
npm i ollamaEm seguida, faça uma requisição ao modelo:
typescript
const ollama = new Ollama({
host: "https://ollama.com",
headers: {
Authorization: "Bearer " + process.env.OLLAMA_API_KEY,
},
});
const response = await ollama.chat({
model: "gpt-oss:120b",
messages: [{ role: "user", content: "Explain quantum computing" }],
stream: true,
});
for await (const part of response) {
process.stdout.write(part.message.content);
}cURL
Gere uma resposta por meio da API de chat do Ollama:
curl https://ollama.com/api/chat \
-H "Authorization: Bearer $OLLAMA_API_KEY" \
-d '{
"model": "gpt-oss:120b",
"messages": [{
"role": "user",
"content": "Why is the sky blue?"
}],
"stream": false
}'Apenas local
O Ollama pode ser executado no modo apenas local ao desativar os recursos de nuvem do Ollama.
Descontinuações
O Ollama ocasionalmente descontinua e aposenta modelos de nuvem mais antigos à medida que modelos de código aberto mais novos e melhores são lançados. Ferramentas e aplicativos que dependem de modelos de nuvem do Ollama podem precisar ser atualizados para continuar funcionando. Os usuários afetados serão notificados com antecedência sobre a descontinuação e aposentadoria de modelos. As descontinuações serão comunicadas por e-mail e no site do Ollama.
A aposentadoria de modelos de nuvem do Ollama não afeta os modelos locais.
Descontinuações futuras
| Data de descontinuação | Modelo | Alternativa recomendada |
|---|---|---|
| 15 de julho de 2026 | deepseek-v3.1:671b | deepseek-v4-flash |
| 15 de julho de 2026 | deepseek-v3.2 | deepseek-v4-flash |
| 15 de julho de 2026 | devstral-2:123b | mistral-large-3:675b |
| 15 de julho de 2026 | devstral-small-2:24b | |
| 15 de julho de 2026 | ministral-3:14b | |
| 15 de julho de 2026 | ministral-3:3b | |
| 15 de julho de 2026 | ministral-3:8b | |
| 15 de julho de 2026 | gemini-3-flash-preview | minimax-m3 |
| 15 de julho de 2026 | gemma3:12b | gemma4:31b |
| 15 de julho de 2026 | gemma3:27b | gemma4:31b |
| 15 de julho de 2026 | gemma3:4b | gemma4:31b |
| 15 de julho de 2026 | glm-4.7 | glm-5.2 |
| 15 de julho de 2026 | glm-5 | glm-5.2 |
| 15 de julho de 2026 | minimax-m2.1 | minimax-m3 |
| 15 de julho de 2026 | qwen3-coder-next | qwen3.5:397b |
| 15 de julho de 2026 | qwen3-coder:480b | qwen3.5:397b |
Descontinuações passadas
30 de junho de 2026
| Modelo | Alternativa recomendada |
| --- | --- | --- |
| `rnj-1:8b` | |
16 de junho de 2026
| Modelo | Alternativa recomendada |
| --- | --- | --- |
| `kimi-k2-thinking` | `kimi-k2.6` |
| `kimi-k2:1t` | `kimi-k2.6` |
| `minimax-m2` | `minimax-m3` |
| `glm-4.6` | `glm-5.1` |
| `qwen3-next:80b` | `qwen3.5` |
| `qwen3-vl:235b` | `qwen3.5` |
| `qwen3-vl:235b-instruct` | `qwen3.5` |
| `cogito-2.1:671b` | `deepseek-v4-flash` |