Skip to content

Modelos de Nuvem

Os modelos de nuvem do Ollama são um novo tipo de modelo na plataforma que pode ser executado sem uma GPU potente. Em vez disso, os modelos de nuvem são automaticamente descarregados para o serviço de nuvem do Ollama, mantendo as mesmas capacidades dos modelos locais, o que possibilita continuar usando suas ferramentas locais enquanto executa modelos maiores que não caberiam em um computador pessoal.

Modelos suportados

Para ver uma lista de modelos suportados, consulte a biblioteca de modelos do Ollama.

Executando modelos de nuvem

Os modelos de nuvem do Ollama exigem uma conta no ollama.com. Para fazer login ou criar uma conta, execute:

ollama signin

CLI

Para executar um modelo de nuvem, abra o terminal e execute:

ollama run gpt-oss:120b-cloud

Python

Primeiro, baixe um modelo de nuvem para que ele possa ser acessado:

ollama pull gpt-oss:120b-cloud

Em seguida, instale a biblioteca Python do Ollama:

pip install ollama

Em seguida, crie e execute um script Python simples:

python
from ollama import Client

client = Client()

messages = [
  {
    'role': 'user',
    'content': 'Why is the sky blue?',
  },
]

for part in client.chat('gpt-oss:120b-cloud', messages=messages, stream=True):
  print(part['message']['content'], end='', flush=True)

JavaScript

Primeiro, baixe um modelo de nuvem para que ele possa ser acessado:

ollama pull gpt-oss:120b-cloud

Em seguida, instale a biblioteca JavaScript do Ollama:

npm i ollama

Em seguida, use a biblioteca para executar um modelo de nuvem:

typescript


const ollama = new Ollama();

const response = await ollama.chat({
  model: "gpt-oss:120b-cloud",
  messages: [{ role: "user", content: "Explain quantum computing" }],
  stream: true,
});

for await (const part of response) {
  process.stdout.write(part.message.content);
}

cURL

Primeiro, baixe um modelo de nuvem para que ele possa ser acessado:

ollama pull gpt-oss:120b-cloud

Execute o seguinte comando cURL para executar a operação por meio da API do Ollama:

curl http://localhost:11434/api/chat -d '{
  "model": "gpt-oss:120b-cloud",
  "messages": [{
    "role": "user",
    "content": "Why is the sky blue?"
  }],
  "stream": false
}'

Acesso à API de Nuvem

Os modelos de nuvem também podem ser acessados diretamente pela API do ollama.com. Nesse modo, o ollama.com funciona como um host Ollama remoto.

Autenticação

Para acesso direto à API do ollama.com, primeiro crie uma chave de API.

Em seguida, defina a variável de ambiente OLLAMA_API_KEY com sua chave de API.

export OLLAMA_API_KEY=your_api_key

Listando modelos

Para listar os modelos disponíveis diretamente pela API do Ollama, execute:

curl https://ollama.com/api/tags

Gerando uma resposta

Python

Primeiro, instale a biblioteca Python do Ollama

pip install ollama

Em seguida, faça uma requisição

python

from ollama import Client

client = Client(
    host="https://ollama.com",
    headers={'Authorization': 'Bearer ' + os.environ.get('OLLAMA_API_KEY')}
)

messages = [
  {
    'role': 'user',
    'content': 'Why is the sky blue?',
  },
]

for part in client.chat('gpt-oss:120b', messages=messages, stream=True):
  print(part['message']['content'], end='', flush=True)

JavaScript

Primeiro, instale a biblioteca JavaScript do Ollama:

npm i ollama

Em seguida, faça uma requisição ao modelo:

typescript


const ollama = new Ollama({
  host: "https://ollama.com",
  headers: {
    Authorization: "Bearer " + process.env.OLLAMA_API_KEY,
  },
});

const response = await ollama.chat({
  model: "gpt-oss:120b",
  messages: [{ role: "user", content: "Explain quantum computing" }],
  stream: true,
});

for await (const part of response) {
  process.stdout.write(part.message.content);
}

cURL

Gere uma resposta por meio da API de chat do Ollama:

curl https://ollama.com/api/chat \
  -H "Authorization: Bearer $OLLAMA_API_KEY" \
  -d '{
    "model": "gpt-oss:120b",
    "messages": [{
      "role": "user",
      "content": "Why is the sky blue?"
    }],
    "stream": false
  }'

Apenas local

O Ollama pode ser executado no modo apenas local ao desativar os recursos de nuvem do Ollama.

Descontinuações

O Ollama ocasionalmente descontinua e aposenta modelos de nuvem mais antigos à medida que modelos de código aberto mais novos e melhores são lançados. Ferramentas e aplicativos que dependem de modelos de nuvem do Ollama podem precisar ser atualizados para continuar funcionando. Os usuários afetados serão notificados com antecedência sobre a descontinuação e aposentadoria de modelos. As descontinuações serão comunicadas por e-mail e no site do Ollama.

A aposentadoria de modelos de nuvem do Ollama não afeta os modelos locais.

Descontinuações futuras

Data de descontinuaçãoModeloAlternativa recomendada
15 de julho de 2026deepseek-v3.1:671bdeepseek-v4-flash
15 de julho de 2026deepseek-v3.2deepseek-v4-flash
15 de julho de 2026devstral-2:123bmistral-large-3:675b
15 de julho de 2026devstral-small-2:24b
15 de julho de 2026ministral-3:14b
15 de julho de 2026ministral-3:3b
15 de julho de 2026ministral-3:8b
15 de julho de 2026gemini-3-flash-previewminimax-m3
15 de julho de 2026gemma3:12bgemma4:31b
15 de julho de 2026gemma3:27bgemma4:31b
15 de julho de 2026gemma3:4bgemma4:31b
15 de julho de 2026glm-4.7glm-5.2
15 de julho de 2026glm-5glm-5.2
15 de julho de 2026minimax-m2.1minimax-m3
15 de julho de 2026qwen3-coder-nextqwen3.5:397b
15 de julho de 2026qwen3-coder:480bqwen3.5:397b

Descontinuações passadas

30 de junho de 2026
| Modelo | Alternativa recomendada |
| --- | --- | --- |
| `rnj-1:8b` | |
16 de junho de 2026
| Modelo | Alternativa recomendada |
| --- | --- | --- |
| `kimi-k2-thinking` | `kimi-k2.6` |
| `kimi-k2:1t` | `kimi-k2.6` |
| `minimax-m2`  | `minimax-m3` |
| `glm-4.6` | `glm-5.1` |
| `qwen3-next:80b` | `qwen3.5` |
| `qwen3-vl:235b` | `qwen3.5` |
| `qwen3-vl:235b-instruct` | `qwen3.5` |
| `cogito-2.1:671b` | `deepseek-v4-flash` |