मैं Ollama को कैसे अपग्रेड कर सकता हूँ?
macOS और Windows पर Ollama स्वचालित रूप से अपडेट डाउनलोड कर लेता है। अपडेट लागू करने के लिए टास्कबार या मेनूबार आइटम पर क्लिक करें और फिर "Restart to update" पर क्लिक करें। अपडेट को मैन्युअली नवीनतम संस्करण डाउनलोड करके भी इंस्टॉल किया जा सकता है।
Linux पर, इंस्टॉल स्क्रिप्ट को फिर से चलाएं:
shell
curl -fsSL https://ollama.com/install.sh | shमैं लॉग कैसे देख सकता हूँ?
लॉग का उपयोग करने के बारे में अधिक जानने के लिए समस्या निवारण दस्तावेजों की समीक्षा करें।
क्या मेरा GPU Ollama के साथ संगत है?
कृपया GPU दस्तावेज का संदर्भ लें।
मैं कॉन्टेक्स्ट विंडो का आकार कैसे निर्दिष्ट कर सकता हूँ?
डिफ़ॉल्ट रूप से, Ollama 4096 टोकन के कॉन्टेक्स्ट विंडो आकार का उपयोग करता है।
इसे OLLAMA_CONTEXT_LENGTH पर्यावरण चर से ओवरराइड किया जा सकता है। उदाहरण के लिए, डिफ़ॉल्ट कॉन्टेक्स्ट विंडो को 8K पर सेट करने के लिए, निम्नलिखित का उपयोग करें:
shell
OLLAMA_CONTEXT_LENGTH=8192 ollama serveollama run का उपयोग करते समय इसे बदलने के लिए, /set parameter का उपयोग करें:
shell
/set parameter num_ctx 4096API का उपयोग करते समय, num_ctx पैरामीटर निर्दिष्ट करें:
shell
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Why is the sky blue?",
"options": {
"num_ctx": 4096
}
}'मैं यह कैसे जान सकता हूँ कि मेरा मॉडल GPU पर लोड हो गया है?
वर्तमान में मेमोरी में लोड किए गए मॉडल देखने के लिए ollama ps कमांड का उपयोग करें।
shell
ollama psINFO
आउटपुट:
NAME ID SIZE PROCESSOR UNTIL
llama3:70b bcfb190ca3a7 42 GB 100% GPU 4 minutes from nowProcessor कॉलम दिखाएगा कि मॉडल को किस मेमोरी में लोड किया गया है:
100% GPUका अर्थ है कि मॉडल को पूरी तरह से GPU में लोड किया गया है100% CPUका अर्थ है कि मॉडल को पूरी तरह से सिस्टम मेमोरी में लोड किया गया है48%/52% CPU/GPUका अर्थ है कि मॉडल को आंशिक रूप से GPU और सिस्टम मेमोरी दोनों में लोड किया गया है
मैं Ollama सर्वर कैसे कॉन्फ़िगर करूँ?
Ollama सर्वर को पर्यावरण चरों के साथ कॉन्फ़िगर किया जा सकता है।
Mac पर पर्यावरण चर सेट करना
यदि Ollama को macOS एप्लिकेशन के रूप में चलाया जा रहा है, तो पर्यावरण चरों को launchctl का उपयोग करके सेट किया जाना चाहिए:
प्रत्येक पर्यावरण चर के लिए,
launchctl setenvकॉल करें।bashlaunchctl setenv OLLAMA_HOST "0.0.0.0:11434"Ollama एप्लिकेशन को रीस्टार्ट करें।
Linux पर पर्यावरण चर सेट करना
यदि Ollama को systemd सर्विस के रूप में चलाया जा रहा है, तो पर्यावरण चरों को systemctl का उपयोग करके सेट किया जाना चाहिए:
systemctl edit ollama.serviceकॉल करके systemd सर्विस को संपादित करें। यह एक एडिटर खोल देगा।प्रत्येक पर्यावरण चर के लिए,
[Service]सेक्शन के तहतEnvironmentलाइन जोड़ें:ini[Service] Environment="OLLAMA_HOST=0.0.0.0:11434"सेव करें और बाहर निकलें।
systemdको रीलोड करें और Ollama को रीस्टार्ट करें:shellsystemctl daemon-reload systemctl restart ollama
Windows पर पर्यावरण चर सेट करना
Windows पर, Ollama आपके उपयोगकर्ता और सिस्टम पर्यावरण चरों को इंहेरिट करता है।
- सबसे पहले टास्क बार में इसे क्लिक करके Ollama को बंद करें।
- सेटिंग्स (Windows 11) या कंट्रोल पैनल (Windows 10) एप्लिकेशन शुरू करें और पर्यावरण चर खोजें।
- अपने खाते के लिए पर्यावरण चर संपादित करें पर क्लिक करें।
- अपने उपयोगकर्ता खाते के लिए
OLLAMA_HOST,OLLAMA_MODELSआदि के लिए नया चर बनाएं या संपादित करें। - सेव करने के लिए OK/Apply पर क्लिक करें।
- Windows स्टार्ट मेनू से Ollama एप्लिकेशन शुरू करें।
मैं Ollama को प्रॉक्सी के पीछे कैसे उपयोग करूँ?
Ollama मॉडल को इंटरनेट से पुल करता है और मॉडल तक पहुंचने के लिए प्रॉक्सी सर्वर की आवश्यकता हो सकती है। आउटबाउंड अनुरोधों को प्रॉक्सी के माध्यम से रीडायरेक्ट करने के लिए HTTPS_PROXY का उपयोग करें। सुनिश्चित करें कि प्रॉक्सी प्रमाणपत्र को सिस्टम प्रमाणपत्र के रूप में इंस्टॉल किया गया है। अपने प्लेटफ़ॉर्म पर पर्यावरण चरों का उपयोग करने के बारे में जानने के लिए ऊपर दिए गए सेक्शन का संदर्भ लें।
Note
HTTP_PROXY सेट करने से बचें। Ollama मॉडल पुल करने के लिए केवल HTTPS का उपयोग करता है, HTTP का उपयोग नहीं करता है। HTTP_PROXY सेट करने से सर्वर से क्लाइंट कनेक्शन बाधित हो सकते हैं।
Docker में Ollama को प्रॉक्सी के पीछे कैसे उपयोग करूँ?
Ollama Docker कंटेनर इमेज को कंटेनर शुरू करते समय -e HTTPS_PROXY=https://proxy.example.com पास करके प्रॉक्सी का उपयोग करने के लिए कॉन्फ़िगर किया जा सकता है।
वैकल्पिक रूप से, Docker डimon को प्रॉक्सी का उपयोग करने के लिए कॉन्फ़िगर किया जा सकता है। Docker डेस्कटॉप के लिए macOS, Windows और Linux पर निर्देश उपलब्ध हैं, साथ ही systemd के साथ Docker डimon के लिए भी।
HTTPS का उपयोग करते समय सुनिश्चित करें कि प्रमाणपत्र को सिस्टम प्रमाणपत्र के रूप में इंस्टॉल किया गया है। स्व-हस्ताक्षरित प्रमाणपत्र का उपयोग करते समय इसके लिए नया Docker इमेज की आवश्यकता हो सकती है।
dockerfile
FROM ollama/ollama
COPY my-ca.pem /usr/local/share/ca-certificates/my-ca.crt
RUN update-ca-certificatesइस इमेज को बिल्ड और रन करें:
shell
docker build -t ollama-with-ca .
docker run -d -e HTTPS_PROXY=https://my.proxy.example.com -p 11434:11434 ollama-with-caक्या Ollama मेरे प्रॉम्प्ट और उत्तरों को ollama.com पर वापस भेजता है?
Ollama स्थानीय रूप से चलता है। जब आप स्थानीय रूप से चलाते हैं तो हम आपके प्रॉम्प्ट या डेटा को नहीं देखते हैं। क्लाउड-होस्टेड मॉडल का उपयोग करते समय, हम सेवा प्रदान करने के लिए आपके प्रॉम्प्ट और प्रतिक्रियाओं को प्रोसेस करते हैं लेकिन उस सामग्री को संग्रहीत या लॉग नहीं करते हैं और कभी उस पर ट्रेन नहीं करते हैं। हम सेवा प्रदान करने के लिए बुनियादी खाता जानकारी और सीमित उपयोग मेटाडेटा इकट्ठा करते हैं जिसमें प्रॉम्प्ट या प्रतिक्रिया सामग्री शामिल नहीं है। हम आपका डेटा नहीं बेचते हैं। आप किसी भी समय अपना खाता हटा सकते हैं।
मैं Ollama के क्लाउड फीचर्स को कैसे डिसेबल करूँ?
Ollama के क्लाउड फीचर्स को डिसेबल करके इसे केवल स्थानीय मोड में चलाया जा सकता है। Ollama के क्लाउड फीचर्स को बंद करने से आपको Ollama के क्लाउड मॉडल और वेब सर्च का उपयोग करने की क्षमता खो जाएगी।
~/.ollama/server.json में disable_ollama_cloud सेट करें:
json
{
"disable_ollama_cloud": true
}आप पर्यावरण चर भी सेट कर सकते हैं:
shell
OLLAMA_NO_CLOUD=1कॉन्फ़िगरेशन बदलने के बाद Ollama को रीस्टार्ट करें। डिसेबल होने के बाद, Ollama के लॉग में Ollama cloud disabled: true दिखाई देगा।
मैं अपने नेटवर्क पर Ollama को कैसे एक्सपोज करूँ?
Ollama डिफ़ॉल्ट रूप से 127.0.0.1 पोर्ट 11434 पर बाइंड होता है। OLLAMA_HOST पर्यावरण चर के साथ बाइंड पता बदलें।
अपने प्लेटफ़ॉर्म पर पर्यावरण चर सेट करने के बारे में जानने के लिए ऊपर दिए गए सेक्शन का संदर्भ लें।
मैं Ollama को प्रॉक्सी सर्वर के साथ कैसे उपयोग करूँ?
Ollama एक HTTP सर्वर चलाता है और इसे Nginx जैसे प्रॉक्सी सर्वर का उपयोग करके एक्सपोज किया जा सकता है। ऐसा करने के लिए, प्रॉक्सी को अनुरोध फॉरवर्ड करने के लिए कॉन्फ़िगर करें और वैकल्पिक रूप से आवश्यक हेडर सेट करें (यदि Ollama को नेटवर्क पर एक्सपोज नहीं कर रहे हैं)। उदाहरण के लिए, Nginx के साथ:
nginx
server {
listen 80;
server_name example.com; # अपने डोमेन या IP से बदलें
location / {
proxy_pass http://localhost:11434;
proxy_set_header Host localhost:11434;
}
}मैं Ollama को ngrok के साथ कैसे उपयोग करूँ?
Ollama तनलिंग ऐप्स की एक श्रृंखला का उपयोग करके एक्सेस किया जा सकता है। उदाहरण के लिए Ngrok के साथ:
shell
ngrok http 11434 --host-header="localhost:11434"मैं Ollama को Cloudflare Tunnel के साथ कैसे उपयोग करूँ?
Ollama को Cloudflare Tunnel के साथ उपयोग करने के लिए, --url और --http-host-header फ्लैग का उपयोग करें:
shell
cloudflared tunnel --url http://localhost:11434 --http-host-header="localhost:11434"मैं Ollama तक अतिरिक्त वेब ऑरिजिन को एक्सेस करने के लिए कैसे अनुमति दूँ?
Ollama डिफ़ॉल्ट रूप से 127.0.0.1 और 0.0.0.0 से क्रॉस-ऑरिजिन अनुरोधों की अनुमति देता है। अतिरिक्त ऑरिजिन को OLLAMA_ORIGINS के साथ कॉन्फ़िगर किया जा सकता है।
ब्राउज़र एक्सटेंशन के लिए, आपको एक्सटेंशन के ऑरिजिन पैटर्न को स्पष्ट रूप से अनुमति देनी होगी। यदि आप सभी ब्राउज़र एक्सटेंशन को एक्सेस की अनुमति देना चाहते हैं, तो OLLAMA_ORIGINS को chrome-extension://*, moz-extension://* और safari-web-extension://* शामिल करने के लिए सेट करें, या आवश्यकतानुसार विशिष्ट एक्सटेंशन के लिए:
# सभी Chrome, Firefox और Safari एक्सटेंशन को अनुमति दें
OLLAMA_ORIGINS=chrome-extension://*,moz-extension://*,safari-web-extension://* ollama serveअपने प्लेटफ़ॉर्म पर पर्यावरण चर सेट करने के बारे में जानने के लिए ऊपर दिए गए सेक्शन का संदर्भ लें।
मॉडल कहां संग्रहीत होते हैं?
- macOS:
~/.ollama/models - Linux:
/usr/share/ollama/.ollama/models - Windows:
C:\Users\%username%\.ollama\models
उन्हें किसी अलग स्थान पर सेट कैसे करूँ?
यदि किसी अलग डायरेक्ट्री का उपयोग करने की आवश्यकता हो, तो चुनी हुई डायरेक्ट्री के लिए पर्यावरण चर OLLAMA_MODELS सेट करें।
Note
स्टैंडर्ड इंस्टॉलर का उपयोग करते समय Linux पर, निर्दिष्ट डायरेक्ट्री तक ollama उपयोगकर्ता को पढ़ने और लिखने की एक्सेस की आवश्यकता होती है। डायरेक्ट्री को ollama उपयोगकर्ता को असाइन करने के लिए sudo chown -R ollama:ollama <directory> चलाएं।
अपने प्लेटफ़ॉर्म पर पर्यावरण चर सेट करने के बारे में जानने के लिए ऊपर दिए गए सेक्शन का संदर्भ लें।
मैं Visual Studio Code में Ollama का उपयोग कैसे कर सकता हूँ?
VS Code और अन्य एडिटरों के लिए Ollama का उपयोग करने वाले प्लगइन्स का एक बड़ा संग्रह पहले से ही उपलब्ध है। मुख्य रिपोजिटरी रीडमी के निचे हिस्से में एक्सटेंशन और प्लगइन्स की सूची देखें।
मैं Docker में Ollama को GPU एक्सेलेरेशन के साथ कैसे उपयोग करूँ?
Ollama Docker कंटेनर को Linux या Windows (WSL2 के साथ) में GPU एक्सेलेरेशन के साथ कॉन्फ़िगर किया जा सकता है। इसके लिए nvidia-container-toolkit की आवश्यकता होती है। अधिक जानकारी के लिए ollama/ollama देखें।
GPU पासथ्रू और एम्युलेशन की कमी के कारण macOS में Docker डेस्कटॉप के लिए GPU एक्सेलेरेशन उपलब्ध नहीं है।
Windows 10 पर WSL2 में नेटवर्किंग क्यों धीमी है?
यह Ollama इंस्टॉल करने और मॉडल डाउनलोड करने दोनों को प्रभावित कर सकता है।
Control Panel > Networking and Internet > View network status and tasks खोलें और बाएं पैनल में Change adapter settings पर क्लिक करें। vEthernet (WSL) एडाप्टर ढूंढें, राइट क्लिक करें और Properties चुनें। Configure पर क्लिक करें और Advanced टैब खोलें। प्रॉपर्टीज की सूची में तब तक सर्च करें जब तक आप Large Send Offload Version 2 (IPv4) और Large Send Offload Version 2 (IPv6) नहीं ढूंढ लेते। इन दोनों प्रॉपर्टीज को अक्षम करें।
मैं तेज़ प्रतिक्रिया समय प्राप्त करने के लिए Ollama में मॉडल को पूर्व लोड कैसे कर सकता हूँ?
यदि आप API का उपयोग कर रहे हैं तो आप Ollama सर्वर को एक खाली अनुरोध भेजकर मॉडल को पूर्व लोड कर सकते हैं। यह /api/generate और /api/chat API एंडपॉइंट दोनों के साथ काम करता है।
जेनरेट एंडपॉइंट का उपयोग करके mistral मॉडल को पूर्व लोड करने के लिए, निम्नलिखित का उपयोग करें:
shell
curl http://localhost:11434/api/generate -d '{"model": "mistral"}'चैट कंप्लीशन एंडपॉइंट का उपयोग करने के लिए, निम्नलिखित का उपयोग करें:
shell
curl http://localhost:11434/api/chat -d '{"model": "mistral"}'CLI का उपयोग करके मॉडल को पूर्व लोड करने के लिए, निम्नलिखित कमांड का उपयोग करें:
shell
ollama run llama3.2 ""मैं मॉडल को मेमोरी में लोड रखने या इसे तुरंत अनलोड कैसे करूँ?
डिफ़ॉल्ट रूप से मॉडल को अनलोड करने से पहले 5 मिनट के लिए मेमोरी में रखा जाता है। यह यदि आप LLM को कई अनुरोध भेज रहे हैं तो तेज़ प्रतिक्रिया समय प्रदान करता है। यदि आप मेमोरी से मॉडल को तुरंत अनलोड करना चाहते हैं, तो ollama stop कमांड का उपयोग करें:
shell
ollama stop llama3.2यदि आप API का उपयोग कर रहे हैं, तो मॉडल के मेमोरी में रहने के समय को सेट करने के लिए /api/generate और /api/chat एंडपॉइंट के साथ keep_alive पैरामीटर का उपयोग करें। keep_alive पैरामीटर को निम्नलिखित में से किसी एक पर सेट किया जा सकता है:
- एक अवधि स्ट्रिंग (जैसे "10m" या "24h")
- सेकंड में एक संख्या (जैसे 3600)
- कोई भी नेगेटिव संख्या जो मॉडल को मेमोरी में लोड रखेगी (उदाहरण -1 या "-1m")
- '0' जो प्रतिक्रिया जेनरेट करने के तुरंत बाद मॉडल को अनलोड कर देगा
उदाहरण के लिए, मॉडल को पूर्व लोड करने और इसे मेमोरी में रखने के लिए निम्नलिखित का उपयोग करें:
shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": -1}'मॉडल को अनलोड करने और मेमोरी मुक्त करने के लिए निम्नलिखित का उपयोग करें:
shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": 0}'वैकल्पिक रूप से, आप Ollama सर्वर शुरू करते समय OLLAMA_KEEP_ALIVE पर्यावरण चर सेट करके सभी मॉडल के मेमोरी में लोड रहने के समय को बदल सकते हैं। OLLAMA_KEEP_ALIVE चर ऊपर बताए गए keep_alive पैरामीटर प्रकारों के समान प्रकारों का उपयोग करता है। पर्यावरण चर को सही से सेट करने के लिए Ollama सर्वर कॉन्फ़िगर करने के बारे में सेक्शन का संदर्भ लें।
/api/generate और /api/chat API एंडपॉइंट के साथ keep_alive API पैरामीटर OLLAMA_KEEP_ALIVE सेटिंग को ओवरराइड कर देगा।
मैं Ollama सर्वर द्वारा क्यू में लेने की अधिकतम अनुरोध संख्या को कैसे प्रबंधित करूँ?
यदि सर्वर को बहुत ज्यादा अनुरोध भेजे जाते हैं, तो यह 503 त्रुटि के साथ जवाब देगा जो इंगित करती है कि सर्वर ओवरलोड हो गया है। आप OLLAMA_MAX_QUEUE सेट करके कितने अनुरोध क्यू में ले जाए जा सकते हैं, इसे एडजस्ट कर सकते हैं।
Ollama समानांतर अनुरोधों को कैसे संभालता है?
Ollama समानांतर प्रोसेसिंग के दो स्तरों का समर्थन करता है। यदि आपका सिस्टम पर पर्याप्त उपलब्ध मेमोरी (CPU इंफेरेंस का उपयोग करते समय सिस्टम मेमोरी, या GPU इंफेरेंस के लिए VRAM) है तो एक ही समय में कई मॉडल लोड किए जा सकते हैं। किसी दिए गए मॉडल के लिए, यदि मॉडल लोड करते समय पर्याप्त उपलब्ध मेमोरी है, तो इसे समानांतर अनुरोध प्रोसेसिंग की अनुमति देने के लिए कॉन्फ़िगर किया जाता है।
यदि एक या अधिक मॉडल पहले से ही लोड होने के दौरान नए मॉडल अनुरोध को लोड करने के लिए पर्याप्त उपलब्ध मेमोरी नहीं है, तो सभी नए अनुरोध क्यू में ले जाए जाएंगे जब तक कि नया मॉडल लोड नहीं हो जाता। जैसे-जैसे पूर्व मॉडल आइडल हो जाते हैं, एक या अधिक मॉडल को नए मॉडल के लिए जगह बनाने के लिए अनलोड कर दिया जाएगा। क्यू में लिए गए अनुरोधों को क्रम में प्रोसेस किया जाएगा। GPU इंफेरेंस का उपयोग करते समय समानांतर मॉडल लोड की अनुमति देने के लिए नए मॉडल को पूरी तरह से VRAM में फिट होना चाहिए।
किसी दिए गए मॉडल के लिए समानांतर अनुरोध प्रोसेसिंग का परिणाम समानांतर अनुरोधों की संख्या के अनुसार कॉन्टेक्स्ट आकार बढ़ना है। उदाहरण के लिए, 4 समानांतर अनुरोधों के साथ 2K कॉन्टेक्स्ट का परिणाम 8K कॉन्टेक्स्ट और अतिरिक्त मेमोरी एलोकेशन होगा।
निम्नलिखित सर्वर सेटिंग्स का उपयोग Ollama द्वारा अधिकांश प्लेटफ़ॉर्म पर समानांतर अनुरोधों को कैसे संभालता है, इसे एडजस्ट करने के लिए किया जा सकता है:
OLLAMA_MAX_LOADED_MODELS- उपलब्ध मेमोरी में फिट होने की शर्त पर समानांतर रूप से लोड किए जा सकने वाले मॉडलों की अधिकतम संख्या। डिफ़ॉल्ट मान GPU की संख्या का 3 गुना या CPU इंफेरेंस के लिए 3 है।OLLAMA_NUM_PARALLEL- प्रत्येक मॉडल द्वारा एक ही समय में प्रोसेस किए जाने वाले समानांतर अनुरोधों की अधिकतम संख्या, डिफ़ॉल्ट 1। आवश्यक RAMOLLAMA_NUM_PARALLEL*OLLAMA_CONTEXT_LENGTHके अनुसार स्केल होगी।OLLAMA_MAX_QUEUE- व्यस्त होने पर Ollama द्वारा अतिरिक्त अनुरोधों को रिजेक्ट करने से पहले क्यू में लिए जाने वाले अनुरोधों की अधिकतम संख्या। डिफ़ॉल्ट 512 है।
नोट: उपलब्ध VRAM रिपोर्टिंग में ROCm v5.7 की सीमाओं के कारण Windows के साथ Radeon GPU वाले सिस्टम में वर्तमान में डिफ़ॉल्ट रूप से अधिकतम 1 मॉडल होता है। ROCm v6.2 उपलब्ध होने के बाद, Windows Radeon ऊपर दिए गए डिफ़ॉल्ट का पालन करेगा। आप Windows पर Radeon पर समानांतर मॉडल लोड सक्षम कर सकते हैं, लेकिन सुनिश्चित करें कि आप अपने GPU की VRAM से ज्यादा मॉडल लोड नहीं करते हैं।
Ollama कई GPUs पर मॉडल को कैसे लोड करता है?
नया मॉडल लोड करते समय, Ollama मॉडल के लिए आवश्यक VRAM को वर्तमान में उपलब्ध VRAM के साथ मूल्यांकन करता है। यदि मॉडल पूरी तरह से किसी एक GPU पर फिट हो जाता है, तो Ollama मॉडल को उस GPU पर लोड करेगा। यह आमतौर पर सबसे अच्छा परफॉर्मेंस प्रदान करता है क्योंकि यह इंफेरेंस के दौरान PCI बस में डेटा ट्रांसफर की मात्रा को कम करता है। यदि मॉडल पूरी तरह से एक GPU पर फिट नहीं होता है, तो इसे सभी उपलब्ध GPUs पर फैला दिया जाएगा।
मैं फ्लैश अटेंशन को कैसे सक्षम कर सकता हूँ?
फ्लैश अटेंशन अधिकांश आधुनिक मॉडलों की एक सुविधा है जो संदर्भ आकार बढ़ने पर मेमोरी उपयोग को काफी कम कर सकती है। जब चुनी गई बैकएंड और डिवाइस इसे समर्थन करते हैं तो ओलामा फ्लैश अटेंशन को स्वचालित रूप से उपयोग करता है। इसे ज़ोर से सक्षम करने के लिए, ओलामा सर्वर शुरू करते समय OLLAMA_FLASH_ATTENTION=1 सेट करें। इसे अक्षम करने के लिए, OLLAMA_FLASH_ATTENTION=0 सेट करें।
मैं K/V कैश के लिए क्वांटाइजेशन प्रकार कैसे सेट कर सकता हूँ?
जब फ्लैश अटेंशन सक्षम हो तो K/V संदर्भ कैश को क्वांटाइज़ करके मेमोरी उपयोग को काफी कम किया जा सकता है।
ओलामा के साथ क्वांटाइज़्ड K/V कैश उपयोग करने के लिए आप निम्नलिखित पर्यावरण चर सेट कर सकते हैं:
OLLAMA_KV_CACHE_TYPE- K/V कैश के लिए क्वांटाइजेशन प्रकार। डिफ़ॉल्टf16है।
नोट
वर्तमान में यह एक वैश्विक विकल्प है - यानी निर्दिष्ट क्वांटाइजेशन प्रकार के साथ सभी मॉडल चलेंगे।
वर्तमान में उपलब्ध K/V कैश क्वांटाइजेशन प्रकार ये हैं:
f16- उच्च परिशुद्धता और मेमोरी उपयोग (डिफ़ॉल्ट)।q8_0- 8-बिट क्वांटाइजेशन, परिशुद्धता में बहुत कम कमी के साथf16से लगभग आधी मेमोरी उपयोग करता है, यह आमतौर पर मॉडल की गुणवत्ता पर कोई ध्यान देने योग्य प्रभाव नहीं डालता (यदि f16 उपयोग नहीं कर रहे हैं तो अनुशंसित)।q4_0- 4-बिट क्वांटाइजेशन, परिशुद्धता में छोटी-मध्यम कमी के साथf16से लगभग एक-चौथाई मेमोरी उपयोग करता है, जो उच्च संदर्भ आकार पर अधिक ध्यान देने योग्य हो सकता है।
कैश क्वांटाइजेशन से मॉडल की प्रतिक्रिया गुणवत्ता पर कितना प्रभाव पड़ता है, यह मॉडल और कार्य पर निर्भर करता है। जिन मॉडलों में GQA गणना अधिक होती है (उदाहरण के लिए Qwen2), क्वांटाइजेशन से उनकी परिशुद्धता पर कम GQA वाले मॉडलों की तुलना में अधिक प्रभाव पड़ सकता है।
मेमोरी उपयोग और गुणवत्ता के बीच सबसे अच्छा संतुलन खोजने के लिए आपको विभिन्न क्वांटाइजेशन प्रकारों के साथ प्रयोग करने की आवश्यकता हो सकती है।
मैं अपनी ओलामा पब्लिक कुंजी कहां से ढूंढ सकता हूँ?
आपकी ओलामा पब्लिक कुंजी कुंजी जोड़ी का सार्वजनिक हिस्सा है जो आपके स्थानीय ओलामा इंस्टेंस को ollama.com से बात करने की अनुमति देता है।
आपको इसे निम्नलिखित कार्यों के लिए आवश्यकता होगी:
- ओलामा पर मॉडल पुश करने के लिए
- ओलामा से अपने मशीन पर निजी मॉडल पुल करने के लिए
- ओलामा क्लाउड में होस्ट किए गए मॉडल चलाने के लिए
की कुंजी कैसे जोड़ें
- मैक और विंडोज ऐप में सेटिंग पेज के माध्यम से साइन-इन करें
- CLI के माध्यम से साइन-इन करें
shell
ollama signin- ओलामा कीज पेज पर की को मैन्युअल रूप से कॉपी और पेस्ट करें: https://ollama.com/settings/keys
ओलामा पब्लिक कुंजी कहां स्थित होती है
| ओएस | id_ed25519.pub का पाथ |
|---|---|
| मैकओएस | ~/.ollama/id_ed25519.pub |
| लिनक्स | /usr/share/ollama/.ollama/id_ed25519.pub |
| विंडोज | C:\Users\<username>\.ollama\id_ed25519.pub |
नोट
<username> को अपने वास्तविक विंडोज उपयोगकर्ता नाम से बदलें।
मैं अपने कंप्यूटर में लॉगिन करते समय ओलामा के स्वचालित शुरू होने को कैसे रोक सकता हूँ?
विंडोज और मैकओएस के लिए ओलामा इंस्टॉलेशन के दौरान लॉगिन आइटम के रूप में रजिस्टर होता है। यदि आप ओलामा को स्वचालित रूप से शुरू नहीं होना चाहते हैं तो आप इसे अक्षम कर सकते हैं। ऐप्लिकेशन को अनइंस्टॉल करने के अलावा, ओलामा अपग्रेड के दौरान भी इस सेटिंग का पालन करता है।
विंडोज
Task ManagerमेंStartup appsटैब पर जाएं,ollamaखोजें फिरDisableपर क्लिक करें
मैकओएस
Settingsखोलें और "Login Items" खोजें,Allow in the Backgroundके तहतOllamaएंट्री ढूंढें, फिर अक्षम करने के लिए स्लाइडर पर क्लिक करें।