Skip to content

क्लाउड मॉडल

Ollama के क्लाउड मॉडल Ollama में एक नया प्रकार के मॉडल हैं जो बिना शक्तिशाली GPU के चल सकते हैं। बजाय इसके, क्लाउड मॉडल स्वचालित रूप से Ollama के क्लाउड सर्विस पर ऑफलोड हो जाते हैं जबकि स्थानीय मॉडलों के समान क्षमताएं प्रदान करते हैं, जिससे व्यक्तिगत कंप्यूटर पर फिट न होने वाले बड़े मॉडल चलाते हुए भी आप अपने स्थानीय टूल्स का उपयोग जारी रख सकते हैं।

समर्थित मॉडल

समर्थित मॉडलों की सूची के लिए, Ollama के मॉडल लाइब्रेरी को देखें।

क्लाउड मॉडल चलाना

Ollama के क्लाउड मॉडलों के लिए ollama.com पर एक खाता आवश्यक है। साइन इन करने या खाता बनाने के लिए, निम्नलिखित चलाएं:

ollama signin

CLI

क्लाउड मॉडल चलाने के लिए, टर्मिनल खोलें और निम्नलिखित चलाएं:

ollama run gpt-oss:120b-cloud

Python

सबसे पहले, एक क्लाउड मॉडल को पुल करें ताकि इसे एक्सेस किया जा सके:

ollama pull gpt-oss:120b-cloud

अगले चरण में, Ollama का Python लाइब्रेरी इंस्टॉल करें:

pip install ollama

अगले चरण में, एक सरल Python स्क्रिप्ट बनाएं और चलाएं:

python
from ollama import Client

client = Client()

messages = [
  {
    'role': 'user',
    'content': 'Why is the sky blue?',
  },
]

for part in client.chat('gpt-oss:120b-cloud', messages=messages, stream=True):
  print(part['message']['content'], end='', flush=True)

JavaScript

सबसे पहले, एक क्लाउड मॉडल को पुल करें ताकि इसे एक्सेस किया जा सके:

ollama pull gpt-oss:120b-cloud

अगले चरण में, Ollama का JavaScript लाइब्रेरी इंस्टॉल करें:

npm i ollama

फिर क्लाउड मॉडल चलाने के लिए इस लाइब्रेरी का उपयोग करें:

typescript


const ollama = new Ollama();

const response = await ollama.chat({
  model: "gpt-oss:120b-cloud",
  messages: [{ role: "user", content: "Explain quantum computing" }],
  stream: true,
});

for await (const part of response) {
  process.stdout.write(part.message.content);
}

cURL

सबसे पहले, एक क्लाउड मॉडल को पुल करें ताकि इसे एक्सेस किया जा सके:

ollama pull gpt-oss:120b-cloud

Ollama के API के माध्यम से कमांड चलाने के लिए निम्नलिखित cURL कमांड चलाएं:

curl http://localhost:11434/api/chat -d '{
  "model": "gpt-oss:120b-cloud",
  "messages": [{
    "role": "user",
    "content": "Why is the sky blue?"
  }],
  "stream": false
}'

क्लाउड API एक्सेस

क्लाउड मॉडलों को सीधे ollama.com के API से भी एक्सेस किया जा सकता है। इस मोड में, ollama.com एक रिमोट Ollama होस्ट के रूप में कार्य करता है।

प्रमाणीकरण

ollama.com के API का सीधा उपयोग करने के लिए, सबसे पहले एक API कुंजी बनाएं।

फिर, अपनी API कुंजी के लिए OLLAMA_API_KEY पर्यावरण चर सेट करें।

export OLLAMA_API_KEY=your_api_key

मॉडलों की सूची

Ollama के API से सीधे उपलब्ध मॉडलों की सूची निम्नलिखित तरीके से देखी जा सकती है:

curl https://ollama.com/api/tags

प्रतिक्रिया उत्पन्न करना

Python

सबसे पहले, Ollama का Python लाइब्रेरी इंस्टॉल करें

pip install ollama

फिर अनुरोध करें

python

from ollama import Client

client = Client(
    host="https://ollama.com",
    headers={'Authorization': 'Bearer ' + os.environ.get('OLLAMA_API_KEY')}
)

messages = [
  {
    'role': 'user',
    'content': 'Why is the sky blue?',
  },
]

for part in client.chat('gpt-oss:120b', messages=messages, stream=True):
  print(part['message']['content'], end='', flush=True)

JavaScript

सबसे पहले, Ollama का JavaScript लाइब्रेरी इंस्टॉल करें:

npm i ollama

अगले चरण में, मॉडल से अनुरोध करें:

typescript


const ollama = new Ollama({
  host: "https://ollama.com",
  headers: {
    Authorization: "Bearer " + process.env.OLLAMA_API_KEY,
  },
});

const response = await ollama.chat({
  model: "gpt-oss:120b",
  messages: [{ role: "user", content: "Explain quantum computing" }],
  stream: true,
});

for await (const part of response) {
  process.stdout.write(part.message.content);
}

cURL

Ollama के चैट API के माध्यम से प्रतिक्रिया उत्पन्न करें:

curl https://ollama.com/api/chat \
  -H "Authorization: Bearer $OLLAMA_API_KEY" \
  -d '{
    "model": "gpt-oss:120b",
    "messages": [{
      "role": "user",
      "content": "Why is the sky blue?"
    }],
    "stream": false
  }'

केवल स्थानीय

Ollama को Ollama के क्लाउड सुविधाओं को अक्षम करके केवल स्थानीय मोड में चलाया जा सकता है।

रिटायरमेंट

नए और बेहतर ओपन-सोर्स मॉडल रिलीज होने पर Ollama समय-समय पर पुराने क्लाउड मॉडलों को डिप्रेकेट और रिटायर करता रहता है। Ollama क्लाउड मॉडलों पर निर्भर टूल्स और एप्लीकेशन्स को कार्य करते रहने के लिए अपडेट करने की आवश्यकता हो सकती है। मॉडल डिप्रीकेशन और रिटायरमेंट से पहले प्रभावित उपयोगकर्ताओं को पूर्व सूचना दी जाएगी। डिप्रीकेशन की जानकारी ईमेल और Ollama वेबसाइट के माध्यम से दी जाएगी।

Ollama क्लाउड मॉडल का रिटायरमेंट स्थानीय मॉडलों को प्रभावित नहीं करता है।

आगामी रिटायरमेंट

रिटायरमेंट तिथिमॉडलअनुशंसित विकल्प
15 जुलाई, 2026deepseek-v3.1:671bdeepseek-v4-flash
15 जुलाई, 2026deepseek-v3.2deepseek-v4-flash
15 जुलाई, 2026devstral-2:123bmistral-large-3:675b
15 जुलाई, 2026devstral-small-2:24b
15 जुलाई, 2026ministral-3:14b
15 जुलाई, 2026ministral-3:3b
15 जुलाई, 2026ministral-3:8b
15 जुलाई, 2026gemini-3-flash-previewminimax-m3
15 जुलाई, 2026gemma3:12bgemma4:31b
15 जुलाई, 2026gemma3:27bgemma4:31b
15 जुलाई, 2026gemma3:4bgemma4:31b
15 जुलाई, 2026glm-4.7glm-5.2
15 जुलाई, 2026glm-5glm-5.2
15 जुलाई, 2026minimax-m2.1minimax-m3
15 जुलाई, 2026qwen3-coder-nextqwen3.5:397b
15 जुलाई, 2026qwen3-coder:480bqwen3.5:397b

पूर्व रिटायरमेंट

30 जून, 2026
| मॉडल | अनुशंसित विकल्प |
| --- | --- |
| `rnj-1:8b` | |
16 जून, 2026
| मॉडल | अनुशंसित विकल्प |
| --- | --- |
| `kimi-k2-thinking` | `kimi-k2.6` |
| `kimi-k2:1t` | `kimi-k2.6` |
| `minimax-m2`  | `minimax-m3` |
| `glm-4.6` | `glm-5.1` |
| `qwen3-next:80b` | `qwen3.5` |
| `qwen3-vl:235b` | `qwen3.5` |
| `qwen3-vl:235b-instruct` | `qwen3.5` |
| `cogito-2.1:671b` | `deepseek-v4-flash` |