Skip to content

Modèles Cloud

Les modèles cloud d'Ollama sont un nouveau type de modèle dans Ollama qui peuvent s'exécuter sans GPU puissant. À la place, les modèles cloud sont automatiquement déchargés vers le service cloud d'Ollama, tout en offrant les mêmes capacités que les modèles locaux, ce qui permet de continuer à utiliser vos outils locaux lors de l'exécution de modèles plus volumineux qui ne tiendraient pas sur un ordinateur personnel.

Modèles pris en charge

Pour obtenir la liste des modèles pris en charge, consultez la bibliothèque de modèles d'Ollama.

Exécution des modèles Cloud

Les modèles cloud d'Ollama nécessitent un compte sur ollama.com. Pour vous connecter ou créer un compte, exécutez :

ollama signin

CLI

Pour exécuter un modèle cloud, ouvrez le terminal et exécutez :

ollama run gpt-oss:120b-cloud

Python

Tout d'abord, récupérez un modèle cloud pour pouvoir y accéder :

ollama pull gpt-oss:120b-cloud

Ensuite, installez la bibliothèque Python d'Ollama :

pip install ollama

Ensuite, créez et exécutez un script Python simple :

python
from ollama import Client

client = Client()

messages = [
  {
    'role': 'user',
    'content': 'Why is the sky blue?',
  },
]

for part in client.chat('gpt-oss:120b-cloud', messages=messages, stream=True):
  print(part['message']['content'], end='', flush=True)

JavaScript

Tout d'abord, récupérez un modèle cloud pour pouvoir y accéder :

ollama pull gpt-oss:120b-cloud

Ensuite, installez la bibliothèque JavaScript d'Ollama :

npm i ollama

Utilisez ensuite la bibliothèque pour exécuter un modèle cloud :

typescript


const ollama = new Ollama();

const response = await ollama.chat({
  model: "gpt-oss:120b-cloud",
  messages: [{ role: "user", content: "Explain quantum computing" }],
  stream: true,
});

for await (const part of response) {
  process.stdout.write(part.message.content);
}

cURL

Tout d'abord, récupérez un modèle cloud pour pouvoir y accéder :

ollama pull gpt-oss:120b-cloud

Exécutez la commande cURL suivante pour lancer la commande via l'API d'Ollama :

curl http://localhost:11434/api/chat -d '{
  "model": "gpt-oss:120b-cloud",
  "messages": [{
    "role": "user",
    "content": "Why is the sky blue?"
  }],
  "stream": false
}'

Accès à l'API Cloud

Les modèles cloud peuvent également être accédés directement via l'API d'ollama.com. Dans ce mode, ollama.com agit comme un hôte Ollama distant.

Authentification

Pour un accès direct à l'API d'ollama.com, créez d'abord une clé API.

Définissez ensuite la variable d'environnement OLLAMA_API_KEY avec votre clé API.

export OLLAMA_API_KEY=your_api_key

Liste des modèles

Pour les modèles disponibles directement via l'API d'Ollama, vous pouvez lister les modèles via :

curl https://ollama.com/api/tags

Génération d'une réponse

Python

Tout d'abord, installez la bibliothèque Python d'Ollama

pip install ollama

Effectuez ensuite une requête

python

from ollama import Client

client = Client(
    host="https://ollama.com",
    headers={'Authorization': 'Bearer ' + os.environ.get('OLLAMA_API_KEY')}
)

messages = [
  {
    'role': 'user',
    'content': 'Why is the sky blue?',
  },
]

for part in client.chat('gpt-oss:120b', messages=messages, stream=True):
  print(part['message']['content'], end='', flush=True)

JavaScript

Tout d'abord, installez la bibliothèque JavaScript d'Ollama :

npm i ollama

Effectuez ensuite une requête au modèle :

typescript


const ollama = new Ollama({
  host: "https://ollama.com",
  headers: {
    Authorization: "Bearer " + process.env.OLLAMA_API_KEY,
  },
});

const response = await ollama.chat({
  model: "gpt-oss:120b",
  messages: [{ role: "user", content: "Explain quantum computing" }],
  stream: true,
});

for await (const part of response) {
  process.stdout.write(part.message.content);
}

cURL

Générez une réponse via l'API de chat d'Ollama :

curl https://ollama.com/api/chat \
  -H "Authorization: Bearer $OLLAMA_API_KEY" \
  -d '{
    "model": "gpt-oss:120b",
    "messages": [{
      "role": "user",
      "content": "Why is the sky blue?"
    }],
    "stream": false
  }'

Mode local uniquement

Ollama peut fonctionner en mode local uniquement en désactivant les fonctionnalités cloud d'Ollama.

Retraits

Ollama mettra occasionnellement fin à la prise en charge et retirera les anciens modèles cloud au fur et à mesure que de nouveaux modèles open source plus performants sont publiés. Les outils et applications reposant sur les modèles Ollama Cloud devront peut-être être mis à jour pour continuer de fonctionner. Les utilisateurs concernés seront informés à l'avance de l'abandon et du retrait des modèles. Les annonces d'abandon seront communiquées par e-mail et sur le site web d'Ollama.

Le retrait des modèles Ollama Cloud n'affecte pas les modèles locaux.

Retraits à venir

Date de retraitModèleAlternative recommandée
15 juillet 2026deepseek-v3.1:671bdeepseek-v4-flash
15 juillet 2026deepseek-v3.2deepseek-v4-flash
15 juillet 2026devstral-2:123bmistral-large-3:675b
15 juillet 2026devstral-small-2:24b
15 juillet 2026ministral-3:14b
15 juillet 2026ministral-3:3b
15 juillet 2026ministral-3:8b
15 juillet 2026gemini-3-flash-previewminimax-m3
15 juillet 2026gemma3:12bgemma4:31b
15 juillet 2026gemma3:27bgemma4:31b
15 juillet 2026gemma3:4bgemma4:31b
15 juillet 2026glm-4.7glm-5.2
15 juillet 2026glm-5glm-5.2
15 juillet 2026minimax-m2.1minimax-m3
15 juillet 2026qwen3-coder-nextqwen3.5:397b
15 juillet 2026qwen3-coder:480bqwen3.5:397b

Retraits passés

30 juin 2026
| Modèle | Alternative recommandée |
| --- | --- |
| `rnj-1:8b` | |
16 juin 2026
| Modèle | Alternative recommandée |
| --- | --- |
| `kimi-k2-thinking` | `kimi-k2.6` |
| `kimi-k2:1t` | `kimi-k2.6` |
| `minimax-m2`  | `minimax-m3` |
| `glm-4.6` | `glm-5.1` |
| `qwen3-next:80b` | `qwen3.5` |
| `qwen3-vl:235b` | `qwen3.5` |
| `qwen3-vl:235b-instruct` | `qwen3.5` |
| `cogito-2.1:671b` | `deepseek-v4-flash` |