Skip to content

Ollama'yi nasıl yükseltebilirim?

macOS ve Windows'ta Ollama, güncellemeleri otomatik olarak indirir. Görev çubuğu veya menü çubuğu öğesine tıklayın ve ardından güncellemeyi uygulamak için "Güncellemek için yeniden başlat" seçeneğine tıklayın. Güncellemeler ayrıca en son sürümü elle indirerek de yüklenebilir.

Linux'ta, kurulum betiğini tekrar çalıştırın:

shell
curl -fsSL https://ollama.com/install.sh | sh

Günlükleri nasıl görüntüleyebilirim?

Günlükleri kullanma hakkında daha fazla bilgi için Sorun Giderme dokümanlarına göz atın.

GPU'm Ollama ile uyumlu mu?

Daha fazla bilgi için lütfen GPU dokümanlarına başvurun.

Bağlam penceresi boyutunu nasıl belirleyebilirim?

Varsayılan olarak Ollama 4096 token'lik bir bağlam penceresi boyutu kullanır.

Bu değer OLLAMA_CONTEXT_LENGTH ortam değişkeni ile geçersiz kılınabilir. Örneğin, varsayılan bağlam penceresini 8K olarak ayarlamak için şunu kullanın:

shell
OLLAMA_CONTEXT_LENGTH=8192 ollama serve

ollama run kullanırken bunu değiştirmek için /set parameter komutunu kullanın:

shell
/set parameter num_ctx 4096

API kullanırken num_ctx parametresini belirtin:

shell
curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2",
  "prompt": "Why is the sky blue?",
  "options": {
    "num_ctx": 4096
  }
}'

Modelimin GPU'ya yüklendiğini nasıl anlayabilirim?

Şu anda belleğe yüklenmiş modelleri görmek için ollama ps komutunu kullanın.

shell
ollama ps

INFO

Çıktı:

NAME        ID            SIZE    PROCESSOR   UNTIL
llama3:70b  bcfb190ca3a7  42 GB   100% GPU    4 minutes from now

İşlemci sütunu modelin hangi belleğe yüklendiğini gösterir:

  • 100% GPU modelin tamamen GPU'ya yüklendiği anlamına gelir
  • 100% CPU modelin tamamen sistem belleğine yüklendiği anlamına gelir
  • %48/%52 CPU/GPU modelin kısmen hem GPU'ya hem de sistem belleğine yüklendiği anlamına gelir

Ollama sunucusunu nasıl yapılandırırım?

Ollama sunucusu ortam değişkenleri ile yapılandırılabilir.

Mac'te ortam değişkenlerini ayarlama

Ollama bir macOS uygulaması olarak çalışıyorsa, ortam değişkenleri launchctl kullanılarak ayarlanmalıdır:

  1. Her ortam değişkeni için launchctl setenv komutunu çalıştırın.

    bash
    launchctl setenv OLLAMA_HOST "0.0.0.0:11434"
  2. Ollama uygulamasını yeniden başlatın.

Linux'ta ortam değişkenlerini ayarlama

Ollama bir systemd hizmeti olarak çalışıyorsa, ortam değişkenleri systemctl kullanılarak ayarlanmalıdır:

  1. systemctl edit ollama.service komutunu çalıştırarak systemd hizmetini düzenleyin. Bu bir düzenleyici açacaktır.

  2. Her ortam değişkeni için [Service] bölümü altına Environment satırı ekleyin:

    ini
    [Service]
    Environment="OLLAMA_HOST=0.0.0.0:11434"
  3. Kaydedin ve çıkın.

  4. systemd'yi yeniden yükleyin ve Ollama'yı yeniden başlatın:

    shell
    systemctl daemon-reload
    systemctl restart ollama

Windows'ta ortam değişkenlerini ayarlama

Windows'ta, Ollama kullanıcı ve sistem ortam değişkenlerinizi devralır.

  1. Öncelikle görev çubuğundan Ollama'ya tıklayarak kapatın.

  2. Ayarlar (Windows 11) veya Denetim Masası (Windows 10) uygulamasını açın ve _ortam değişkenleri_ni arayın.

  3. Hesabınız için ortam değişkenlerini düzenle'ye tıklayın.

  4. Kullanıcı hesabınız için OLLAMA_HOST, OLLAMA_MODELS vb. değişkenleri düzenleyin veya yeni bir değişken oluşturun.

  5. Kaydetmek için Tamam/Uygula'ya tıklayın.

  6. Ollama uygulamasını Windows Başlat menüsünden başlatın.

Ollama'yı bir proxy arkasında nasıl kullanırım?

Ollama modelleri İnternet'ten çeker ve modellere erişmek için bir proxy sunucusu gerektirebilir. Giden istekleri proxy üzerinden yönlendirmek için HTTPS_PROXY kullanın. Proxy sertifikasının sistem sertifikası olarak yüklü olduğundan emin olun. Platformunuzda ortam değişkenlerini kullanma hakkında yukarıdaki bölüme başvurun.

Not

HTTP_PROXY ayarlamaktan kaçının. Ollama model çekme işlemleri için HTTP yerine yalnızca HTTPS kullanır. HTTP_PROXY ayarlamak, istemci sunucu bağlantılarını kesintiye uğratabilir.

Docker'da Ollama'yı bir proxy arkasında nasıl kullanırım?

Ollama Docker konteyner görüntüsü, konteyner başlatılırken -e HTTPS_PROXY=https://proxy.example.com parametresi iletilerek proxy kullanacak şekilde yapılandırılabilir.

Alternatif olarak, Docker arka plan programı proxy kullanacak şekilde yapılandırılabilir. Docker Desktop için macOS, Windows ve Linux üzerinde, ayrıca systemd ile birlikte Docker arka plan programı için talimatlar mevcuttur.

HTTPS kullanırken sertifikanın sistem sertifikası olarak yüklü olduğundan emin olun. Kendinden imzalı bir sertifika kullanırken bu, yeni bir Docker görüntüsü gerektirebilir.

dockerfile
FROM ollama/ollama
COPY my-ca.pem /usr/local/share/ca-certificates/my-ca.crt
RUN update-ca-certificates

Bu görüntüyü oluşturun ve çalıştırın:

shell
docker build -t ollama-with-ca .
docker run -d -e HTTPS_PROXY=https://my.proxy.example.com -p 11434:11434 ollama-with-ca

Ollama, sorularımı ve cevaplarımı ollama.com'a geri gönderiyor mu?

Ollama yerel olarak çalışır. Yerel olarak çalıştırdığınızda sorularınızı veya verilerinizi görürüz. Bulutta barındırılan modelleri kullanırken, hizmeti sağlamak için sorularınızı ve yanıtlarınızı işleriz ancak bu içeriği saklamayız, günlüğe kaydetmeyiz ve asla bunun üzerinde eğitim vermeyiz. Hizmeti sağlamak için temel hesap bilgileri ve sınırlı kullanım meta verileri toplarız, bu bilgiler soru veya yanıt içeriğini içermez. Verilerinizi satmayız. Hesabınızı istediğiniz zaman silebilirsiniz.

Ollama'nın bulut özelliklerini nasıl devre dışı bırakırım?

Ollama'nın bulut özellikleri devre dışı bırakılarak yalnızca yerel modda çalıştırılabilir. Ollama'nın bulut özelliklerini kapatarak, Ollama'nın bulut modellerini ve web aramasını kullanma yeteneğini kaybedersiniz.

~/.ollama/server.json dosyasında disable_ollama_cloud değerini ayarlayın:

json
{
  "disable_ollama_cloud": true
}

Ayrıca şu ortam değişkenini ayarlayabilirsiniz:

shell
OLLAMA_NO_CLOUD=1

Yapılandırmayı değiştirdikten sonra Ollama'yı yeniden başlatın. Devre dışı bırakıldıktan sonra, Ollama günlükleri Ollama cloud disabled: true olarak görünecektir.

Ollama'yı ağımda nasıl dışarı açabilirim?

Ollama varsayılan olarak 127.0.0.1 adresinin 11434 numaralı portuna bağlanır. Bağlantı adresini OLLAMA_HOST ortam değişkeni ile değiştirin.

Platformunuzda ortam değişkenlerini ayarlama hakkında yukarıdaki bölüme başvurun.

Ollama'yı bir proxy sunucusu ile nasıl kullanırım?

Ollama bir HTTP sunucusu çalıştırır ve Nginx gibi bir proxy sunucusu kullanılarak dışarı açılabilir. Bunu yapmak için, proxy'yi istekleri iletmek üzere yapılandırın ve isteğe bağlı olarak gerekli üst bilgileri ayarlayın (Ollama ağa dışarı açılmıyorsa). Örneğin Nginx ile:

nginx
server {
    listen 80;
    server_name example.com;  # Alan adınız veya IP adresiniz ile değiştirin
    location / {
        proxy_pass http://localhost:11434;
        proxy_set_header Host localhost:11434;
    }
}

Ollama'yı ngrok ile nasıl kullanırım?

Ollama, çeşitli tünel uygulamaları kullanılarak erişilebilir. Örneğin Ngrok ile:

shell
ngrok http 11434 --host-header="localhost:11434"

Ollama'yı Cloudflare Tunnel ile nasıl kullanırım?

Ollama'yı Cloudflare Tunnel ile kullanmak için --url ve --http-host-header bayraklarını kullanın:

shell
cloudflared tunnel --url http://localhost:11434 --http-host-header="localhost:11434"

Ek web kaynaklarının Ollama'ya erişmesine nasıl izin veririm?

Ollama varsayılan olarak 127.0.0.1 ve 0.0.0.0 adreslerinden gelen farklı kaynak isteklerine izin verir. Ek kaynaklar OLLAMA_ORIGINS ile yapılandırılabilir.

Tarayıcı eklentileri için, eklentinin kaynak desenini açıkça izin vermeniz gerekir. Tüm tarayıcı eklentilerinin erişimine izin vermek istiyorsanız OLLAMA_ORIGINS değerine chrome-extension://*, moz-extension://* ve safari-web-extension://* değerlerini ekleyin veya ihtiyaca göre belirli eklentileri ekleyin:

# Tüm Chrome, Firefox ve Safari eklentilerine izin ver
OLLAMA_ORIGINS=chrome-extension://*,moz-extension://*,safari-web-extension://* ollama serve

Platformunuzda ortam değişkenlerini ayarlama hakkında yukarıdaki bölüme başvurun.

Modeller nerede saklanır?

  • macOS: ~/.ollama/models
  • Linux: /usr/share/ollama/.ollama/models
  • Windows: C:\Users\%username%\.ollama\models

Modelleri farklı bir konuma nasıl ayarlayabilirim?

Farklı bir dizin kullanılması gerekiyorsa, OLLAMA_MODELS ortam değişkenini seçilen dizine ayarlayın.

Not

Standart yükleyiciyi kullanan Linux'ta, ollama kullanıcısının belirtilen dizine okuma ve yazma erişimine ihtiyacı vardır. Dizini ollama kullanıcısına atamak için sudo chown -R ollama:ollama <directory> komutunu çalıştırın.

Platformunuzda ortam değişkenlerini ayarlama hakkında yukarıdaki bölüme başvurun.

Ollama'yı Visual Studio Code'ta nasıl kullanırım?

Ollama'dan yararlanan VS Code ve diğer düzenleyiciler için halihazırda çok sayıda eklenti mevcuttur. Ana depo README dosyasının alt kısmındaki eklenti ve eklentiler listesine bakın.

Docker'da Ollama'yı GPU hızlandırması ile nasıl kullanırım?

Ollama Docker konteyneri, Linux veya Windows (WSL2 ile) üzerinde GPU hızlandırması ile yapılandırılabilir. Bu işlem için nvidia-container-toolkit gereklidir. Daha fazla ayrıntı için ollama/ollama görüntüsüne bakın.

GPU geçiş ve emülasyon eksikliği nedeniyle macOS'taki Docker Desktop için GPU hızlandırması mevcut değildir.

Windows 10'daki WSL2'de ağ neden yavaş?

Bu durum hem Ollama yüklemesini hem de model indirmelerini etkileyebilir.

Denetim Masası > Ağ ve İnternet > Ağ durumunu ve görevleri görüntüle yolunu açın ve sol paneldeki Bağdaştırıcı ayarlarını değiştir seçeneğine tıklayın. vEthernet (WSL) bağdaştırıcısını bulun, sağ tıklayın ve Özellikler seçeneğini seçin. Yapılandır seçeneğine tıklayın ve Gelişmiş sekmesini açın. Özelliklerin her birini tarayarak Large Send Offload Version 2 (IPv4) ve Large Send Offload Version 2 (IPv6) seçeneklerini bulun. Bu iki özelliği de devre dışı bırakın.

Daha hızlı yanıt süreleri elde etmek için bir modeli Ollama'ya önceden nasıl yükleyebilirim?

API kullanıyorsanız, Ollama sunucusuna boş bir istek göndererek bir modeli önceden yükleyebilirsiniz. Bu işlem hem /api/generate hem de /api/chat API uç noktaları ile çalışır.

Generate uç noktasını kullanarak mistral modelini önceden yüklemek için şunu kullanın:

shell
curl http://localhost:11434/api/generate -d '{"model": "mistral"}'

Sohbet tamamlama uç noktasını kullanmak için şunu kullanın:

shell
curl http://localhost:11434/api/chat -d '{"model": "mistral"}'

CLI kullanarak bir modeli önceden yüklemek için şu komutu kullanın:

shell
ollama run llama3.2 ""

Bir modeli bellekte tutmak veya hemen kaldırmak için ne yapmalıyım?

Varsayılan olarak modeller, kaldırılmadan önce bellekte 5 dakika tutulur. Bu, LLM'ye çok sayıda istek gönderiyorsanız daha hızlı yanıt süreleri sağlar. Bir modeli belleğten hemen kaldırmak istiyorsanız ollama stop komutunu kullanın:

shell
ollama stop llama3.2

API kullanıyorsanız, modelin bellekte kalma süresini ayarlamak için /api/generate ve /api/chat uç noktaları ile keep_alive parametresini kullanın. keep_alive parametresi şu değerlere ayarlanabilir:

  • bir süre dizesi (örneğin "10m" veya "24h")
  • saniye cinsinden bir sayı (örneğin 3600)
  • modeli bellekte tutacak herhangi bir negatif sayı (örneğin -1 veya "-1m")
  • bir yanıt oluşturulduktan sonra modeli hemen kaldıracak '0'

Örneğin, bir modeli önceden yüklemek ve bellekte tutmak için şunu kullanın:

shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": -1}'

Modeli kaldırmak ve belleği boşaltmak için şunu kullanın:

shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": 0}'

Alternatif olarak, Ollama sunucusunu başlatırken OLLAMA_KEEP_ALIVE ortam değişkenini ayarlayarak tüm modellerin belleğe yüklenme süresini değiştirebilirsiniz. OLLAMA_KEEP_ALIVE değişkeni, yukarıda belirtilen keep_alive parametresi türleri ile aynı parametre türlerini kullanır. Ortam değişkenini doğru ayarlamak için Ollama sunucusunu nasıl yapılandırırım bölümüne başvurun.

/api/generate ve /api/chat API uç noktaları ile birlikte gelen keep_alive API parametresi, OLLAMA_KEEP_ALIVE ayarını geçersiz kılar.

Ollama sunucusunun kuyruğa alabileceği maksimum istek sayısını nasıl yönetirim?

Sunucuya çok sayıda istek gönderilirse, sunucunun aşırı yüklendiğini belirten 503 hatası ile yanıt verir. Kuyruğa alınabilecek istek sayısını OLLAMA_MAX_QUEUE ayarlayarak düzenleyebilirsiniz.

Ollama eşzamanlı istekleri nasıl işler?

Ollama iki seviyeli eşzamanlı işlemeyi destekler. Sisteminizde yeterli kullanılabilir bellek varsa (CPU çıkarımı kullanırken sistem belleği, veya GPU çıkarımı için VRAM), aynı anda birden fazla model yüklenebilir. Belirli bir model için, model yüklendiğinde yeterli kullanılabilir bellek varsa, paralel istek işlemeye izin verecek şekilde yapılandırılır.

Bir veya daha fazla model zaten yüklüyken yeni bir model yüklemek için yeterli kullanılabilir bellek yoksa, yeni model yükülenene kadar tüm yeni istekler kuyruğa alınır. Önceki modeller boşa düştüğünde, yeni model için yer açmak üzere bir veya daha fazlası kaldırılır. Kuyruğa alınan istekler sırayla işlenir. GPU çıkarımı kullanırken, eşzamanlı model yüklemelerine izin vermek için yeni modellerin tamamen VRAM'a sığması gerekir.

Belirli bir model için paralel istek işleme, bağlam boyutunu paralel istek sayısı kadar artırır. Örneğin, 4 paralel istek ile 2K bağlam, 8K bağlam ve ek bellek ayırma ile sonuçlanır.

Aşağıdaki sunucu ayarları, Ollama'nın çoğu platformda eşzamanlı istekleri nasıl işlemesini ayarlamak için kullanılabilir:

  • OLLAMA_MAX_LOADED_MODELS - Kullanılabilir belleğe sığdıkları takdirde eşzamanlı olarak yüklenebilecek maksimum model sayısı. Varsayılan değer, GPU sayısının 3 katı veya CPU çıkarımı için 3'tür.
  • OLLAMA_NUM_PARALLEL - Her modelin aynı anda işleyeceği maksimum paralel istek sayısı, varsayılan değer 1. Gerekli RAM, OLLAMA_NUM_PARALLEL * OLLAMA_CONTEXT_LENGTH ile ölçeklenir.
  • OLLAMA_MAX_QUEUE - Ollama'nın meşgulken ek istekleri reddetmeden önce kuyruğa alacağı maksimum istek sayısı. Varsayılan değer 512'dir.

Not: ROCm v5.7'deki kullanılabilir VRAM raporlama sınırlamaları nedeniyle, Radeon GPU'lı Windows sistemleri şu anda varsayılan olarak en fazla 1 model yükler. ROCm v6.2 mevcut olduğunda, Windows Radeon yukarıdaki varsayılan değerleri izleyecektir. Windows'taki Radeon üzerinde eşzamanlı model yüklemelerini etkinleştirebilirsiniz, ancak GPU'nuzun VRAM'ına sığacakndan daha fazla model yükmediğinizden emin olun.

Ollama birden fazla GPU'da modelleri nasıl yükler?

Yeni bir model yüklerken, Ollama model için gerekli VRAM'ı mevcut VRAM ile karşılaştırır. Model tek bir GPU'ya tamamen sığacaksa, Ollama modeli o GPU'ya yükler. Bu, çıkarım sırasında PCI veriyolu boyunca aktarılan veri miktarını azalttığı için genellikle en iyi performansı sağlar. Model tek bir GPU'ya tamamen sığmıyorsa, tüm kullanılabilir GPU'lar üzerine dağıtılır.

Flash Attention'u nasıl etkinleştirebilirim?

Flash Attention, bağlam boyutu arttıkça bellek kullanımını önemli ölçüde azaltan çoğu modern modelin bir özelliğidir. Ollama, seçili arka uç ve cihazlar desteklediğinde Flash Attention'ı otomatik olarak kullanır. Flash Attention'ı zorla etkinleştirmek için Ollama sunucusunu başlatırken OLLAMA_FLASH_ATTENTION=1 ortam değişkenini ayarlayın. Devre dışı bırakmak için OLLAMA_FLASH_ATTENTION=0 olarak ayarlayın.

K/V önbelleği için nicemleme türünü nasıl ayarlayabilirim?

Flash Attention etkinleştirildiğinde K/V bağlam önbelleği nicemlendirilerek bellek kullanımı önemli ölçüde azaltılabilir.

Ollama ile nicemli K/V önbelleği kullanmak için aşağıdaki ortam değişkenini ayarlayabilirsiniz:

  • OLLAMA_KV_CACHE_TYPE - K/V önbelleği için nicemleme türü. Varsayılan değer f16'dır.

Not

Bu şu anda global bir seçenektir - yani tüm modeller belirtilen nicemleme türüyle çalışacaktır.

Şu anda kullanılabilir olan K/V önbelleği nicemleme türleri şunlardır:

  • f16 - yüksek hassasiyet ve bellek kullanımı (varsayılan).
  • q8_0 - 8-bit nicemleme, f16'nın yaklaşık 1/2'si kadar bellek kullanır, hassasiyet kaybı çok küçüktür ve genellikle model kalitesinde fark edilebilir bir etkisi yoktur (f16 kullanılmıyorsa önerilir).
  • q4_0 - 4-bit nicemleme, f16'nın yaklaşık 1/4'ü kadar bellek kullanır, hassasiyet kaybı küçük-orta düzeydedir ve daha yüksek bağlam boyutlarında daha çok fark edilebilir.

Önbellek nicemlemesinin model yanıt kalitesine etkisi, modele ve göreve bağlı olarak değişir. Yüksek GQA sayısına sahip modeller (örneğin Qwen2), düşük GQA sayısına sahip modellere göre nicemlemeden hassasiyet üzerinde daha fazla etki görebilir.

Bellek kullanımı ile kalite arasındaki en iyi dengeyi bulmak için farklı nicemleme türleriyle deneme yapmanız gerekebilir.

Ollama Genel Anahtarımı nerede bulabilirim?

Ollama Genel Anahtarınız, yerel Ollama örneğinizin ollama.com ile iletişim kurmasını sağlayan anahtar çiftinin genel kısmıdır.

Bunu şu işlemler için kullanmanız gerekir:

  • Modelleri Ollama'ya göndermek için
  • Özel modelleri Ollama'dan makinenize çekmek için
  • Ollama Cloud'da barındırılan modelleri çalıştırmak için

Anahtarı Nasıl Ekleyebilirsiniz

  • Mac ve Windows Uygulaması'nda Ayarlar sayfası üzerinden oturum açın
  • CLI üzerinden oturum açın
shell
ollama signin

Ollama Genel Anahtarının Bulunduğu Konum

İşletim Sistemiid_ed25519.pub dosyasının yolu
macOS~/.ollama/id_ed25519.pub
Linux/usr/share/ollama/.ollama/id_ed25519.pub
WindowsC:\Users\<username>\.ollama\id_ed25519.pub

Not

<username> kısmını gerçek Windows kullanıcı adınızla değiştirin.

Bilgisayarıma oturum açarken Ollama'nın otomatik olarak başlamasını nasıl durdurabilirim?

Windows ve macOS için Ollama, kurulum sırasında oturum açma öğesi olarak kaydedilir. Ollama'nın otomatik olarak başlamasını istemiyorsanız bunu devre dışı bırakabilirsiniz. Uygulamayı kaldırmadığınız sürece Ollama, yükseltmeler sırasında bu ayarı korur.

Windows

  • Görev Yöneticisi'nde Başlangıç uygulamaları sekmesine gidin, ollama'yı arayın ve Devre dışı bırak'a tıklayın

MacOS

  • Ayarlar'ı açın ve "Oturum Açma Öğeleri"ni aratın, Arka Planda İzin Ver altında Ollama girişini bulun ve devre dışı bırakmak için kaydırıcıya tıklayın.