Skip to content

Hoe kan ik Ollama upgraden?

Ollama op macOS en Windows downloadt updates automatisch. Klik op het item in de taakbalk of menubalk en klik daarna op "Opnieuw opstarten om bij te werken" om de update toe te passen. Updates kunnen ook worden geïnstalleerd door de nieuwste versie handmatig te downloaden.

Op Linux voer je het installatiescript opnieuw uit:

shell
curl -fsSL https://ollama.com/install.sh | sh

Hoe kan ik de logs bekijken?

Raadpleeg de Probleemoplossing-documentatie voor meer informatie over het gebruik van logs.

Is mijn GPU compatibel met Ollama?

Raadpleeg de GPU-documentatie.

Hoe kan ik de contextvenstergrootte opgeven?

Standaard gebruikt Ollama een contextvenstergrootte van 4096 tokens.

Dit kan worden overschreven met de omgevingsvariabele OLLAMA_CONTEXT_LENGTH. Gebruik bijvoorbeeld het volgende om de standaard contextvenstergrootte naar 8K in te stellen:

shell
OLLAMA_CONTEXT_LENGTH=8192 ollama serve

Om dit te wijzigen bij gebruik van ollama run, gebruik je /set parameter:

shell
/set parameter num_ctx 4096

Bij gebruik van de API geef je de parameter num_ctx op:

shell
curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2",
  "prompt": "Why is the sky blue?",
  "options": {
    "num_ctx": 4096
  }
}'

Hoe kan ik zien of mijn model is geladen op de GPU?

Gebruik de opdracht ollama ps om te zien welke modellen momenteel in het geheugen zijn geladen.

shell
ollama ps

INFO

Uitvoer:

NAME        ID            SIZE    PROCESSOR   UNTIL
llama3:70b  bcfb190ca3a7  42 GB   100% GPU    4 minutes from now

De kolom Processor geeft aan in welk geheugen het model is geladen:

  • 100% GPU betekent dat het model volledig op de GPU is geladen
  • 100% CPU betekent dat het model volledig in het systeemgeheugen is geladen
  • 48%/52% CPU/GPU betekent dat het model gedeeltelijk op zowel de GPU als in het systeemgeheugen is geladen

Hoe configureer ik de Ollama-server?

De Ollama-server kan worden geconfigureerd met omgevingsvariabelen.

Omgevingsvariabelen instellen op Mac

Als Ollama wordt uitgevoerd als een macOS-toepassing, moeten omgevingsvariabelen worden ingesteld met launchctl:

  1. Roep voor elke omgevingsvariabele launchctl setenv aan.

    bash
    launchctl setenv OLLAMA_HOST "0.0.0.0:11434"
  2. Herstart de Ollama-toepassing.

Omgevingsvariabelen instellen op Linux

Als Ollama wordt uitgevoerd als een systemd-service, moeten omgevingsvariabelen worden ingesteld met systemctl:

  1. Bewerk de systemd-service door systemctl edit ollama.service aan te roepen. Dit opent een editor.

  2. Voeg voor elke omgevingsvariabele een regel Environment toe onder de sectie [Service]:

    ini
    [Service]
    Environment="OLLAMA_HOST=0.0.0.0:11434"
  3. Sla op en sluit af.

  4. Herlaad systemd en herstart Ollama:

    shell
    systemctl daemon-reload
    systemctl restart ollama

Omgevingsvariabelen instellen op Windows

Op Windows erft Ollama uw gebruikers- en systeemomgevingsvariabelen.

  1. Sluit Ollama eerst door erop te klikken in de taakbalk.

  2. Start de toepassing Instellingen (Windows 11) of Configuratiescherm (Windows 10) en zoek naar omgevingsvariabelen.

  3. Klik op Omgevingsvariabelen voor uw account bewerken.

  4. Bewerk of maak een nieuwe variabele voor uw gebruikersaccount voor OLLAMA_HOST, OLLAMA_MODELS, enz.

  5. Klik op OK/Toepassen om op te slaan.

  6. Start de Ollama-toepassing vanuit het Windows Start-menu.

Hoe gebruik ik Ollama achter een proxy?

Ollama haalt modellen op uit het internet en heeft mogelijk een proxyserver nodig om de modellen te benaderen. Gebruik HTTPS_PROXY om uitgaande aanvragen via de proxy te leiden. Zorg ervoor dat het proxycertificaat als systeemcertificaat is geïnstalleerd. Raadpleeg de bovenstaande sectie voor het gebruik van omgevingsvariabelen op uw platform.

Opmerking

Vermijd het instellen van HTTP_PROXY. Ollama gebruikt geen HTTP voor het ophalen van modellen, alleen HTTPS. Het instellen van HTTP_PROXY kan clientverbindingen met de server onderbreken.

Hoe gebruik ik Ollama achter een proxy in Docker?

De Ollama Docker-containerafbeelding kan worden geconfigureerd om een proxy te gebruiken door -e HTTPS_PROXY=https://proxy.example.com door te geven bij het starten van de container.

Als alternatief kan de Docker-daemon worden geconfigureerd om een proxy te gebruiken. Instructies zijn beschikbaar voor Docker Desktop op macOS, Windows en Linux, en voor Docker daemon met systemd.

Zorg ervoor dat het certificaat als systeemcertificaat is geïnstalleerd bij gebruik van HTTPS. Dit kan een nieuwe Docker-afbeelding vereisen bij gebruik van een zelfondertekend certificaat.

dockerfile
FROM ollama/ollama
COPY my-ca.pem /usr/local/share/ca-certificates/my-ca.crt
RUN update-ca-certificates

Bouw en voer deze afbeelding uit:

shell
docker build -t ollama-with-ca .
docker run -d -e HTTPS_PROXY=https://my.proxy.example.com -p 11434:11434 ollama-with-ca

Stuurt Ollama mijn prompts en antwoorden terug naar ollama.com?

Ollama wordt lokaal uitgevoerd. We zien uw prompts of gegevens niet wanneer u lokaal uitvoert. Bij gebruik van in de cloud gehoste modellen verwerken we uw prompts en antwoorden om de service te leveren, maar slaan we die inhoud niet op of loggen we deze en trainen we er nooit op. We verzamelen basisaccountgegevens en beperkte gebruiksmetadata om de service te leveren, die geen prompt- of antwoordinhoud bevatten. We verkopen uw gegevens niet. U kunt uw account op elk moment verwijderen.

Hoe schakel ik de cloudfuncties van Ollama uit?

Ollama kan in alleen-lokale modus draaien door de cloudfuncties van Ollama uit te schakelen. Door de cloudfuncties van Ollama uit te schakelen, verliest u de mogelijkheid om de cloudmodellen van Ollama en webzoekopdrachten te gebruiken.

Stel disable_ollama_cloud in in ~/.ollama/server.json:

json
{
  "disable_ollama_cloud": true
}

U kunt ook de omgevingsvariabele instellen:

shell
OLLAMA_NO_CLOUD=1

Herstart Ollama na het wijzigen van de configuratie. Eenmaal uitgeschakeld, tonen de logs van Ollama Ollama cloud disabled: true.

Hoe kan ik Ollama op mijn netwerk beschikbaar maken?

Ollama bindt standaard aan 127.0.0.1 poort 11434. Wijzig het bindadres met de omgevingsvariabele OLLAMA_HOST.

Raadpleeg de sectie hierboven voor het instellen van omgevingsvariabelen op uw platform.

Hoe kan ik Ollama met een proxyserver gebruiken?

Ollama draait een HTTP-server en kan beschikbaar worden gemaakt via een proxyserver zoals Nginx. Configureer daartoe de proxy om aanvragen door te sturen en stel eventueel vereiste headers in (als Ollama niet op het netwerk wordt blootgesteld). Bijvoorbeeld met Nginx:

nginx
server {
    listen 80;
    server_name example.com;  # Replace with your domain or IP
    location / {
        proxy_pass http://localhost:11434;
        proxy_set_header Host localhost:11434;
    }
}

Hoe kan ik Ollama met ngrok gebruiken?

Ollama kan worden benaderd met verschillende tunneling-apps. Bijvoorbeeld met Ngrok:

shell
ngrok http 11434 --host-header="localhost:11434"

Hoe kan ik Ollama met Cloudflare Tunnel gebruiken?

Om Ollama met Cloudflare Tunnel te gebruiken, gebruik je de vlaggen --url en --http-host-header:

shell
cloudflared tunnel --url http://localhost:11434 --http-host-header="localhost:11434"

Hoe kan ik extra weboorsprongen toegang geven tot Ollama?

Ollama staat standaard cross-origin aanvragen toe van 127.0.0.1 en 0.0.0.0. Extra oorsprongen kunnen worden geconfigureerd met OLLAMA_ORIGINS.

Voor browserextensies moet u het oorsprongpatroon van de extensie expliciet toestaan. Stel OLLAMA_ORIGINS in op chrome-extension://*, moz-extension://* en safari-web-extension://* als u alle browserextensies toegang wilt geven, of specifieke extensies indien nodig:

# Allow all Chrome, Firefox, and Safari extensions
OLLAMA_ORIGINS=chrome-extension://*,moz-extension://*,safari-web-extension://* ollama serve

Raadpleeg de sectie hierboven voor het instellen van omgevingsvariabelen op uw platform.

Waar worden modellen opgeslagen?

  • macOS: ~/.ollama/models
  • Linux: /usr/share/ollama/.ollama/models
  • Windows: C:\Users\%username%\.ollama\models

Hoe stel ik ze in op een andere locatie?

Als een andere map moet worden gebruikt, stel je de omgevingsvariabele OLLAMA_MODELS in op de gekozen map.

Opmerking

Op Linux met de standaardinstallatie heeft de gebruiker ollama lees- en schrijfrechten nodig voor de opgegeven map. Om de map aan de gebruiker ollama toe te wijzen, voer je sudo chown -R ollama:ollama <directory> uit.

Raadpleeg de sectie hierboven voor het instellen van omgevingsvariabelen op uw platform.

Hoe kan ik Ollama gebruiken in Visual Studio Code?

Er is al een grote collectie plug-ins beschikbaar voor VS Code en andere editors die gebruikmaken van Ollama. Zie de lijst met extensies & plug-ins onderaan de readme van de hoofdrepository.

Hoe gebruik ik Ollama met GPU-versnelling in Docker?

De Ollama Docker-container kan worden geconfigureerd met GPU-versnelling op Linux of Windows (met WSL2). Dit vereist de nvidia-container-toolkit. Zie ollama/ollama voor meer details.

GPU-versnelling is niet beschikbaar voor Docker Desktop op macOS vanwege het ontbreken van GPU-passthrough en emulatie.

Waarom is netwerken traag in WSL2 op Windows 10?

Dit kan zowel de installatie van Ollama als het downloaden van modellen beïnvloeden.

Open Configuratiescherm > Netwerken en internet > Netwerkstatus en -taken bekijken en klik op Adapterinstellingen wijzigen in het linkerpaneel. Zoek de adapter vEthernet (WSL), klik met de rechtermuisknop en selecteer Eigenschappen.

Klik op Configureren en open het tabblad Geavanceerd. Zoek door de eigenschappen tot u Large Send Offload Version 2 (IPv4) en Large Send Offload Version 2 (IPv6) vindt. Schakel beide eigenschappen uit.

Hoe kan ik een model vooraf in Ollama laden om snellere responstijden te krijgen?

Als u de API gebruikt, kunt u een model vooraf laden door een lege aanvraag naar de Ollama-server te sturen. Dit werkt met beide API-eindpunten /api/generate en /api/chat.

Om het mistral-model vooraf te laden via de generate-eindpunt, gebruikt u:

shell
curl http://localhost:11434/api/generate -d '{"model": "mistral"}'

Om de chatvoltooiingseindpunt te gebruiken, gebruikt u:

shell
curl http://localhost:11434/api/chat -d '{"model": "mistral"}'

Om een model vooraf te laden via de CLI, gebruikt u de opdracht:

shell
ollama run llama3.2 ""

Hoe houd ik een model in het geheugen geladen of verwijder ik het onmiddellijk daaruit?

Standaard worden modellen 5 minuten in het geheugen gehouden voordat ze worden verwijderd. Dit zorgt voor snellere responstijden als u veel aanvragen doet aan de LLM. Als u een model onmiddellijk uit het geheugen wilt verwijderen, gebruikt u de opdracht ollama stop:

shell
ollama stop llama3.2

Als u de API gebruikt, gebruikt u de parameter keep_alive met de eindpunten /api/generate en /api/chat om de tijd in te stellen dat een model in het geheugen blijft. De parameter keep_alive kan worden ingesteld op:

  • een duurtekenreeks (zoals "10m" of "24h")
  • een aantal seconden (zoals 3600)
  • een willekeurig negatief getal dat het model in het geheugen houdt (bijv. -1 of "-1m")
  • '0' die het model onmiddellijk na het genereren van een antwoord uit het geheugen verwijderd

Bijvoorbeeld, om een model vooraf te laden en het in het geheugen te houden, gebruikt u:

shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": -1}'

Om het model uit het geheugen te verwijderen en geheugen vrij te maken, gebruikt u:

shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": 0}'

Als alternatief kunt u de tijd wijzigen dat alle modellen in het geheugen geladen blijven door de omgevingsvariabele OLLAMA_KEEP_ALIVE in te stellen bij het starten van de Ollama-server. De variabele OLLAMA_KEEP_ALIVE gebruikt dezelfde parametertypen als de hierboven genoemde parametertypen van keep_alive. Raadpleeg de sectie die uitlegt hoe u de Ollama-server configureert om de omgevingsvariabele correct in te stellen.

De API-parameter keep_alive met de API-eindpunten /api/generate en /api/chat overschrijft de instelling OLLAMA_KEEP_ALIVE.

Hoe beheer ik het maximum aantal aanvragen dat de Ollama-server kan wachtrijen?

Als te veel aanvragen naar de server worden gestuurd, reageert deze met een 503-fout die aangeeft dat de server overbelast is. U kunt aanpassen hoeveel aanvragen in de wachtrij mogen door OLLAMA_MAX_QUEUE in te stellen.

Hoe verwerkt Ollama gelijktijdige aanvragen?

Ollama ondersteunt twee niveaus van gelijktijdige verwerking. Als uw systeem voldoende beschikbaar geheugen heeft (systeemgeheugen bij gebruik van CPU-inferentie, of VRAM voor GPU-inferentie), kunnen er meerdere modellen tegelijk worden geladen. Voor een bepaald model, als er voldoende beschikbaar geheugen is wanneer het model wordt geladen, is het geconfigureerd om parallelle aanvraagverwerking toe te staan.

Als er onvoldoende beschikbaar geheugen is om een nieuw modelaanvraag te laden terwijl er een of meer modellen al geladen zijn, worden alle nieuwe aanvragen in de wachtrij geplaatst totdat het nieuwe model kan worden geladen. Naarmate eerdere modellen inactief worden, worden er een of meer ongeladen om ruimte te maken voor het nieuwe model. Aangevraagde aanvragen worden in volgorde verwerkt. Bij gebruik van GPU-inferentie moeten nieuwe modellen volledig in de VRAM passen om gelijktijdige modellading toe te staan.

Parallelle aanvraagverwerking voor een bepaald model leidt tot een vergroting van de contextgrootte met het aantal parallelle aanvragen. Bijvoorbeeld, een 2K-context met 4 parallelle aanvragen resulteert in een 8K-context en extra geheugentoewijzing.

De volgende serverinstellingen kunnen worden gebruikt om aan te passen hoe Ollama gelijktijdige aanvragen op de meeste platforms verwerkt:

  • OLLAMA_MAX_LOADED_MODELS - Het maximum aantal modellen dat gelijktijdig kan worden geladen, mits ze passen in het beschikbare geheugen. De standaard is 3 * het aantal GPU's of 3 voor CPU-inferentie.
  • OLLAMA_NUM_PARALLEL - Het maximum aantal parallelle aanvragen dat elk model tegelijk verwerkt, standaard 1. Vereist RAM schaalt met OLLAMA_NUM_PARALLEL * OLLAMA_CONTEXT_LENGTH.
  • OLLAMA_MAX_QUEUE - Het maximum aantal aanvragen dat Ollama in de wachtrij plaatst wanneer het bezig is voordat het extra aanvragen afwijst. De standaard is 512

Opmerking: Windows met Radeon-GPU's heeft momenteel een standaardmaximum van 1 model vanwege beperkingen in ROCm v5.7 voor het rapporteren van beschikbare VRAM. Zodra ROCm v6.2 beschikbaar is, volgt Windows Radeon de bovenstaande standaarden. U kunt gelijktijdige modellading op Radeon op Windows inschakelen, maar zorg ervoor dat u niet meer modellen laadt dan er in de VRAM van uw GPU passen.

Hoe laadt Ollama modellen op meerdere GPU's?

Bij het laden van een nieuw model evalueert Ollama de vereiste VRAM voor het model ten opzichte van wat momenteel beschikbaar is. Als het model volledig past op een enkele GPU, laadt Ollama het model op die GPU. Dit levert meestal de beste prestaties op omdat het de hoeveelheid gegevens die tijdens de inferentie over de PCI-bus wordt overgedragen, vermindert. Als het model niet volledig op één GPU past, wordt het over alle beschikbare GPU's verdeeld.

Hoe kan ik Flash Attention inschakelen?

Flash Attention is een functie van de meeste moderne modellen die het geheugengebruik aanzienlijk kan verlagen naarmate de contextgrootte groeit. Ollama gebruikt Flash Attention automatisch wanneer de geselecteerde backend en apparaten dit ondersteunen. Om Flash Attention expliciet in te schakelen, stel je OLLAMA_FLASH_ATTENTION=1 in bij het opstarten van de Ollama-server. Om het uit te schakelen, stel je OLLAMA_FLASH_ATTENTION=0 in.

Hoe kan ik het kwantisatietype voor de K/V-cache instellen?

De K/V-contextcache kan worden gekwantiseerd om het geheugengebruik aanzienlijk te verlagen wanneer Flash Attention is ingeschakeld.

Om een gekwantiseerde K/V-cache te gebruiken met Ollama, kun je de volgende omgevingsvariabele instellen:

  • OLLAMA_KV_CACHE_TYPE - Het kwantisatietype voor de K/V-cache. Standaard is dit f16.

Opmerking

Op dit moment is dit een globale optie - wat betekent dat alle modellen worden uitgevoerd met het opgegeven kwantisatietype.

De momenteel beschikbare K/V-cache kwantisatietypes zijn:

  • f16 - hoge precisie en geheugengebruik (standaard).
  • q8_0 - 8-bits kwantisatie, gebruikt ongeveer de helft van het geheugen van f16 met een zeer klein precisieverlies, dit heeft meestal geen merkbare invloed op de kwaliteit van het model (aanbevolen indien je geen f16 gebruikt).
  • q4_0 - 4-bits kwantisatie, gebruikt ongeveer een kwart van het geheugen van f16 met een klein tot middelgroot precisieverlies dat bij hogere contextgroottes meer opvallend kan zijn.

Hoeveel invloed de cachekwantisatie heeft op de kwaliteit van de modelrespons, hangt af van het model en de taak. Modellen met een hoog aantal GQA's (bijv. Qwen2) kunnen een grotere afname van de precisie ondervinden door kwantisatie dan modellen met een laag aantal GQA's.

Je moet mogelijk experimenteren met verschillende kwantisatietypen om de beste balans tussen geheugengebruik en kwaliteit te vinden.

Waar vind ik mijn Ollama-publieke sleutel?

Je Ollama-publieke sleutel is het openbare deel van het sleutelpaar waarmee je lokale Ollama-instantie kan communiceren met ollama.com.

Je hebt deze nodig voor:

  • Modellen pushen naar Ollama
  • Privémodellen ophalen van Ollama naar je computer
  • Modellen uitvoeren die worden gehost in Ollama Cloud

Hoe voeg je de sleutel toe?

  • Aanmelden via de Instellingenpagina in de Mac en Windows-app
  • Aanmelden via CLI
shell
ollama signin

Waar de Ollama-publieke sleutel zich bevindt

OSPad naar id_ed25519.pub
macOS~/.ollama/id_ed25519.pub
Linux/usr/share/ollama/.ollama/id_ed25519.pub
WindowsC:\Users\<username>\.ollama\id_ed25519.pub

Opmerking

Vervang <username> door je eigen Windows-gebruikersnaam.

Hoe kan ik voorkomen dat Ollama opstart wanneer ik inlog op mijn computer?

Ollama voor Windows en macOS registreert zich als een aanmelditem tijdens de installatie. Je kunt dit uitschakelen als je liever niet hebt dat Ollama automatisch opstart. Ollama respecteert deze instelling bij upgrades, tenzij je de applicatie deïnstalleert.

Windows

  • Open Taakbeheer, ga naar het tabblad Opstarten, zoek naar ollama en klik vervolgens op Uitschakelen

MacOS

  • Open Instellingen, zoek naar "Aanmelditems", vind het Ollama-item onder Toestaan in de achtergrond, en klik vervolgens op de schuifregelaar om het uit te schakelen.