Skip to content

Modèles Cloud ​

Les modèles cloud d'Ollama sont un nouveau type de modèle dans Ollama qui peuvent s'exécuter sans GPU puissant. À la place, les modèles cloud sont automatiquement déchargés vers le service cloud d'Ollama, tout en offrant les mêmes capacités que les modèles locaux, ce qui permet de continuer à utiliser vos outils locaux lors de l'exécution de modèles plus volumineux qui ne tiendraient pas sur un ordinateur personnel.

Modèles pris en charge ​

Pour obtenir la liste des modèles pris en charge, consultez la bibliothèque de modèles d'Ollama.

Exécution des modèles Cloud ​

Les modèles cloud d'Ollama nécessitent un compte sur ollama.com. Pour vous connecter ou créer un compte, exécutez :

ollama signin

CLI ​

Pour exécuter un modèle cloud, ouvrez le terminal et exécutez :

ollama run gpt-oss:120b-cloud

Python ​

Tout d'abord, récupérez un modèle cloud pour pouvoir y accéder :

ollama pull gpt-oss:120b-cloud

Ensuite, installez la bibliothèque Python d'Ollama :

pip install ollama

Ensuite, créez et exécutez un script Python simple :

python
from ollama import Client

client = Client()

messages = [
  {
    'role': 'user',
    'content': 'Why is the sky blue?',
  },
]

for part in client.chat('gpt-oss:120b-cloud', messages=messages, stream=True):
  print(part['message']['content'], end='', flush=True)

JavaScript ​

Tout d'abord, récupérez un modèle cloud pour pouvoir y accéder :

ollama pull gpt-oss:120b-cloud

Ensuite, installez la bibliothèque JavaScript d'Ollama :

npm i ollama

Utilisez ensuite la bibliothèque pour exécuter un modèle cloud :

typescript


const ollama = new Ollama();

const response = await ollama.chat({
  model: "gpt-oss:120b-cloud",
  messages: [{ role: "user", content: "Explain quantum computing" }],
  stream: true,
});

for await (const part of response) {
  process.stdout.write(part.message.content);
}

cURL ​

Tout d'abord, récupérez un modèle cloud pour pouvoir y accéder :

ollama pull gpt-oss:120b-cloud

Exécutez la commande cURL suivante pour lancer la commande via l'API d'Ollama :

curl http://localhost:11434/api/chat -d '{
  "model": "gpt-oss:120b-cloud",
  "messages": [{
    "role": "user",
    "content": "Why is the sky blue?"
  }],
  "stream": false
}'

Accès à l'API Cloud ​

Les modèles cloud peuvent également être accédés directement via l'API d'ollama.com. Dans ce mode, ollama.com agit comme un hôte Ollama distant.

Authentification ​

Pour un accès direct à l'API d'ollama.com, créez d'abord une clé API.

Définissez ensuite la variable d'environnement OLLAMA_API_KEY avec votre clé API.

export OLLAMA_API_KEY=your_api_key

Liste des modèles ​

Pour les modèles disponibles directement via l'API d'Ollama, vous pouvez lister les modèles via :

curl https://ollama.com/api/tags

Génération d'une réponse ​

Python ​

Tout d'abord, installez la bibliothèque Python d'Ollama

pip install ollama

Effectuez ensuite une requête

python

from ollama import Client

client = Client(
    host="https://ollama.com",
    headers={'Authorization': 'Bearer ' + os.environ.get('OLLAMA_API_KEY')}
)

messages = [
  {
    'role': 'user',
    'content': 'Why is the sky blue?',
  },
]

for part in client.chat('gpt-oss:120b', messages=messages, stream=True):
  print(part['message']['content'], end='', flush=True)

JavaScript ​

Tout d'abord, installez la bibliothèque JavaScript d'Ollama :

npm i ollama

Effectuez ensuite une requête au modèle :

typescript


const ollama = new Ollama({
  host: "https://ollama.com",
  headers: {
    Authorization: "Bearer " + process.env.OLLAMA_API_KEY,
  },
});

const response = await ollama.chat({
  model: "gpt-oss:120b",
  messages: [{ role: "user", content: "Explain quantum computing" }],
  stream: true,
});

for await (const part of response) {
  process.stdout.write(part.message.content);
}

cURL ​

Générez une réponse via l'API de chat d'Ollama :

curl https://ollama.com/api/chat \
  -H "Authorization: Bearer $OLLAMA_API_KEY" \
  -d '{
    "model": "gpt-oss:120b",
    "messages": [{
      "role": "user",
      "content": "Why is the sky blue?"
    }],
    "stream": false
  }'

Mode local uniquement ​

Ollama peut fonctionner en mode local uniquement en désactivant les fonctionnalités cloud d'Ollama.

Retraits ​

Ollama mettra occasionnellement fin à la prise en charge et retirera les anciens modèles cloud au fur et à mesure que de nouveaux modèles open source plus performants sont publiés. Les outils et applications reposant sur les modèles Ollama Cloud devront peut-être être mis à jour pour continuer de fonctionner. Les utilisateurs concernés seront informés à l'avance de l'abandon et du retrait des modèles. Les annonces d'abandon seront communiquées par e-mail et sur le site web d'Ollama.

Le retrait des modèles Ollama Cloud n'affecte pas les modèles locaux.

Retraits à venir ​

Date de retraitModèleAlternative recommandée
15 juillet 2026deepseek-v3.1:671bdeepseek-v4-flash
15 juillet 2026deepseek-v3.2deepseek-v4-flash
15 juillet 2026devstral-2:123bmistral-large-3:675b
15 juillet 2026devstral-small-2:24b
15 juillet 2026ministral-3:14b
15 juillet 2026ministral-3:3b
15 juillet 2026ministral-3:8b
15 juillet 2026gemini-3-flash-previewminimax-m3
15 juillet 2026gemma3:12bgemma4:31b
15 juillet 2026gemma3:27bgemma4:31b
15 juillet 2026gemma3:4bgemma4:31b
15 juillet 2026glm-4.7glm-5.2
15 juillet 2026glm-5glm-5.2
15 juillet 2026minimax-m2.1minimax-m3
15 juillet 2026qwen3-coder-nextqwen3.5:397b
15 juillet 2026qwen3-coder:480bqwen3.5:397b

Retraits passés ​

30 juin 2026
| Modèle | Alternative recommandée |
| --- | --- |
| `rnj-1:8b` | |
16 juin 2026
| Modèle | Alternative recommandée |
| --- | --- |
| `kimi-k2-thinking` | `kimi-k2.6` |
| `kimi-k2:1t` | `kimi-k2.6` |
| `minimax-m2`  | `minimax-m3` |
| `glm-4.6` | `glm-5.1` |
| `qwen3-next:80b` | `qwen3.5` |
| `qwen3-vl:235b` | `qwen3.5` |
| `qwen3-vl:235b-instruct` | `qwen3.5` |
| `cogito-2.1:671b` | `deepseek-v4-flash` |