Skip to content

Comment puis-je mettre à jour Ollama ?

Ollama sur macOS et Windows télécharge automatiquement les mises à jour. Cliquez sur l'élément de la barre des tâches ou de la barre de menu, puis sur « Redémarrer pour mettre à jour » pour appliquer la mise à jour. Vous pouvez également installer les mises à jour en téléchargeant la dernière version manuellement.

Sur Linux, réexécutez le script d'installation :

shell
curl -fsSL https://ollama.com/install.sh | sh

Comment puis-je consulter les journaux ?

Consultez la documentation Résolution des problèmes pour en savoir plus sur l'utilisation des journaux.

Mon GPU est-il compatible avec Ollama ?

Veuillez consulter la documentation GPU.

Comment puis-je définir la taille de la fenêtre de contexte ?

Par défaut, Ollama utilise une fenêtre de contexte de 4096 tokens.

Cette valeur peut être modifiée avec la variable d'environnement OLLAMA_CONTEXT_LENGTH. Par exemple, pour définir la fenêtre de contexte par défaut sur 8K, utilisez :

shell
OLLAMA_CONTEXT_LENGTH=8192 ollama serve

Pour modifier cette valeur lors de l'utilisation de ollama run, utilisez /set parameter :

shell
/set parameter num_ctx 4096

Lors de l'utilisation de l'API, spécifiez le paramètre num_ctx :

shell
curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2",
  "prompt": "Why is the sky blue?",
  "options": {
    "num_ctx": 4096
  }
}'

Comment savoir si mon modèle a été chargé sur le GPU ?

Utilisez la commande ollama ps pour voir quels modèles sont actuellement chargés en mémoire.

shell
ollama ps

INFO

Sortie :

NAME        ID            SIZE    PROCESSOR   UNTIL
llama3:70b  bcfb190ca3a7  42 GB   100% GPU    4 minutes from now

La colonne Processeur indique dans quelle mémoire le modèle a été chargé :

  • 100% GPU signifie que le modèle a été entièrement chargé sur le GPU
  • 100% CPU signifie que le modèle a été entièrement chargé dans la mémoire système
  • 48%/52% CPU/GPU signifie que le modèle a été partiellement chargé à la fois sur le GPU et dans la mémoire système

Comment configurer le serveur Ollama ?

Le serveur Ollama peut être configuré à l'aide de variables d'environnement.

Définition des variables d'environnement sur macOS

Si Ollama est exécuté en tant qu'application macOS, les variables d'environnement doivent être définies à l'aide de launchctl :

  1. Pour chaque variable d'environnement, appelez launchctl setenv.

    bash
    launchctl setenv OLLAMA_HOST "0.0.0.0:11434"
  2. Redémarrez l'application Ollama.

Définition des variables d'environnement sur Linux

Si Ollama est exécuté en tant que service systemd, les variables d'environnement doivent être définies à l'aide de systemctl :

  1. Modifiez le service systemd en appelant systemctl edit ollama.service. Cela ouvrira un éditeur.

  2. Pour chaque variable d'environnement, ajoutez une ligne Environment sous la section [Service] :

    ini
    [Service]
    Environment="OLLAMA_HOST=0.0.0.0:11434"
  3. Enregistrez et quittez.

  4. Rechargez systemd et redémarrez Ollama :

    shell
    systemctl daemon-reload
    systemctl restart ollama

Définition des variables d'environnement sur Windows

Sur Windows, Ollama hérite des variables d'environnement utilisateur et système.

  1. Quittez d'abord Ollama en cliquant dessus dans la barre des tâches.

  2. Ouvrez l'application Paramètres (Windows 11) ou Panneau de configuration (Windows 10) et recherchez variables d'environnement.

  3. Cliquez sur Modifier les variables d'environnement pour votre compte.

  4. Modifiez ou créez une nouvelle variable pour votre compte utilisateur pour OLLAMA_HOST, OLLAMA_MODELS, etc.

  5. Cliquez sur OK/Appliquer pour enregistrer.

  6. Lancez l'application Ollama depuis le menu Démarrer de Windows.

Comment utiliser Ollama derrière un proxy ?

Ollama télécharge des modèles depuis Internet et peut avoir besoin d'un serveur proxy pour y accéder. Utilisez HTTPS_PROXY pour rediriger les requêtes sortantes via le proxy. Assurez-vous que le certificat du proxy est installé en tant que certificat système. Reportez-vous à la section ci-dessus pour savoir comment définir des variables d'environnement sur votre plateforme.

Note

Évitez de définir HTTP_PROXY. Ollama n'utilise pas HTTP pour le téléchargement des modèles, uniquement HTTPS. La définition de HTTP_PROXY peut interrompre les connexions client au serveur.

Comment utiliser Ollama derrière un proxy dans Docker ?

L'image du conteneur Docker Ollama peut être configurée pour utiliser un proxy en passant le paramètre -e HTTPS_PROXY=https://proxy.example.com lors du démarrage du conteneur.

Vous pouvez également configurer le démon Docker pour utiliser un proxy. Des instructions sont disponibles pour Docker Desktop sur macOS, Windows et Linux, ainsi que pour le démon Docker avec systemd.

Assurez-vous que le certificat est installé en tant que certificat système lors de l'utilisation de HTTPS. Cela peut nécessiter une nouvelle image Docker si vous utilisez un certificat auto-signé.

dockerfile
FROM ollama/ollama
COPY my-ca.pem /usr/local/share/ca-certificates/my-ca.crt
RUN update-ca-certificates

Construisez et exécutez cette image :

shell
docker build -t ollama-with-ca .
docker run -d -e HTTPS_PROXY=https://my.proxy.example.com -p 11434:11434 ollama-with-ca

Ollama envoie-t-il mes requêtes et mes réponses vers ollama.com ?

Ollama s'exécute localement. Nous n'avons pas accès à vos requêtes ni à vos données lorsque vous l'utilisez localement. Lorsque vous utilisez des modèles hébergés dans le cloud, nous traitons vos requêtes et vos réponses pour fournir le service, mais nous ne stockons ni ne journalisons ce contenu, et nous ne l'utilisons jamais pour l'entraînement. Nous collectons des informations de compte basiques et des métadonnées d'utilisation limitées pour fournir le service, sans inclure le contenu des requêtes ou des réponses. Nous ne vendons pas vos données. Vous pouvez supprimer votre compte à tout moment.

Comment désactiver les fonctionnalités cloud d'Ollama ?

Ollama peut s'exécuter en mode local uniquement en désactivant ses fonctionnalités cloud. Si vous désactivez les fonctionnalités cloud d'Ollama, vous perdrez la possibilité d'utiliser les modèles cloud d'Ollama et la recherche web.

Définissez disable_ollama_cloud dans le fichier ~/.ollama/server.json :

json
{
  "disable_ollama_cloud": true
}

Vous pouvez également définir la variable d'environnement :

shell
OLLAMA_NO_CLOUD=1

Redémarrez Ollama après avoir modifié la configuration. Une fois désactivé, les journaux d'Ollama afficheront Ollama cloud disabled: true.

Comment exposer Ollama sur mon réseau ?

Par défaut, Ollama est lié à l'adresse 127.0.0.1 sur le port 11434. Modifiez l'adresse de liaison à l'aide de la variable d'environnement OLLAMA_HOST.

Reportez-vous à la section ci-dessus pour savoir comment définir des variables d'environnement sur votre plateforme.

Comment utiliser Ollama avec un serveur proxy ?

Ollama exécute un serveur HTTP et peut être exposé à l'aide d'un serveur proxy tel que Nginx. Pour ce faire, configurez le proxy pour transférer les requêtes et, si nécessaire, définissez les en-têtes requis (si vous n'exposez pas Ollama sur le réseau). Par exemple, avec Nginx :

nginx
server {
    listen 80;
    server_name example.com;  # Replace with your domain or IP
    location / {
        proxy_pass http://localhost:11434;
        proxy_set_header Host localhost:11434;
    }
}

Comment utiliser Ollama avec ngrok ?

Ollama peut être accessible à l'aide de diverses applications de tunneling. Par exemple avec Ngrok :

shell
ngrok http 11434 --host-header="localhost:11434"

Comment utiliser Ollama avec Cloudflare Tunnel ?

Pour utiliser Ollama avec Cloudflare Tunnel, utilisez les indicateurs --url et --http-host-header :

shell
cloudflared tunnel --url http://localhost:11434 --http-host-header="localhost:11434"

Comment autoriser des origines web supplémentaires à accéder à Ollama ?

Par défaut, Ollama autorise les requêtes d'origine croisée depuis 127.0.0.1 et 0.0.0.0. Des origines supplémentaires peuvent être configurées à l'aide de OLLAMA_ORIGINS.

Pour les extensions de navigateur, vous devrez autoriser explicitement le modèle d'origine de l'extension. Définissez OLLAMA_ORIGINS pour inclure chrome-extension://*, moz-extension://* et safari-web-extension://* si vous souhaitez autoriser l'accès à toutes les extensions de navigateur, ou des extensions spécifiques selon vos besoins :

# Allow all Chrome, Firefox, and Safari extensions
OLLAMA_ORIGINS=chrome-extension://*,moz-extension://*,safari-web-extension://* ollama serve

Reportez-vous à la section ci-dessus pour savoir comment définir des variables d'environnement sur votre plateforme.

Où sont stockés les modèles ?

  • macOS : ~/.ollama/models
  • Linux : /usr/share/ollama/.ollama/models
  • Windows : C:\Users\%username%\.ollama\models

Comment définir un emplacement différent ?

Si vous devez utiliser un répertoire différent, définissez la variable d'environnement OLLAMA_MODELS avec le chemin du répertoire choisi.

Note

Sur Linux, lors de l'utilisation de l'installateur standard, l'utilisateur ollama a besoin d'un accès en lecture et en écriture au répertoire spécifié. Pour attribuer le répertoire à l'utilisateur ollama, exécutez sudo chown -R ollama:ollama <directory>.

Reportez-vous à la section ci-dessus pour savoir comment définir des variables d'environnement sur votre plateforme.

Comment utiliser Ollama dans Visual Studio Code ?

Une grande collection d'extensions est déjà disponible pour VS Code ainsi que pour d'autres éditeurs qui exploitent Ollama. Consultez la liste des extensions et plugins en bas du fichier readme du dépôt principal.

Comment utiliser l'accélération GPU avec Ollama dans Docker ?

Le conteneur Docker Ollama peut être configuré avec l'accélération GPU sous Linux ou Windows (avec WSL2). Cela nécessite le nvidia-container-toolkit. Consultez ollama/ollama pour plus de détails.

L'accélération GPU n'est pas disponible pour Docker Desktop sur macOS en raison de l'absence de passage à travers et d'émulation GPU.

Pourquoi le réseau est-il lent dans WSL2 sur Windows 10 ?

Cela peut affecter à la fois l'installation d'Ollama et le téléchargement des modèles.

Ouvrez Panneau de configuration > Réseau et Internet > Afficher l'état du réseau et les tâches réseau et cliquez sur Modifier les paramètres de la carte dans le panneau de gauche. Recherchez l'adaptateur vEthernet (WSL), faites un clic droit et sélectionnez Propriétés. Cliquez sur Configurer et ouvrez l'onglet Avancé. Parcourez les propriétés jusqu'à trouver Large Send Offload Version 2 (IPv4) et Large Send Offload Version 2 (IPv6). Désactivez ces deux propriétés.

Comment précharger un modèle dans Ollama pour obtenir des temps de réponse plus rapides ?

Si vous utilisez l'API, vous pouvez précharger un modèle en envoyant une requête vide au serveur Ollama. Cela fonctionne avec les points de terminaison d'API /api/generate et /api/chat.

Pour précharger le modèle mistral à l'aide du point de terminaison generate, utilisez :

shell
curl http://localhost:11434/api/generate -d '{"model": "mistral"}'

Pour utiliser le point de terminaison de complétion de chat, utilisez :

shell
curl http://localhost:11434/api/chat -d '{"model": "mistral"}'

Pour précharger un modèle à l'aide de l'interface en ligne de commande, utilisez la commande :

shell
ollama run llama3.2 ""

Comment garder un modèle chargé en mémoire ou le décharger immédiatement ?

Par défaut, les modèles sont conservés en mémoire pendant 5 minutes avant d'être déchargés. Cela permet d'obtenir des temps de réponse plus rapides si vous envoyez de nombreuses requêtes au LLM. Si vous souhaitez décharger immédiatement un modèle de la mémoire, utilisez la commande ollama stop :

shell
ollama stop llama3.2

Si vous utilisez l'API, utilisez le paramètre keep_alive avec les points de terminaison /api/generate et /api/chat pour définir la durée pendant laquelle un modèle reste en mémoire. Le paramètre keep_alive peut être défini sur :

  • une chaîne de durée (comme « 10m » ou « 24h »)
  • un nombre en secondes (comme 3600)
  • tout nombre négatif qui conservera le modèle chargé en mémoire (par exemple -1 ou « -1m »)
  • « 0 » qui déchargera le modèle immédiatement après la génération d'une réponse

Par exemple, pour précharger un modèle et le laisser en mémoire, utilisez :

shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": -1}'

Pour décharger le modèle et libérer de la mémoire, utilisez :

shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": 0}'

Vous pouvez également modifier la durée pendant laquelle tous les modèles sont chargés en mémoire en définissant la variable d'environnement OLLAMA_KEEP_ALIVE lors du démarrage du serveur Ollama. La variable OLLAMA_KEEP_ALIVE utilise les mêmes types de paramètres que le paramètre keep_alive mentionné ci-dessus. Reportez-vous à la section expliquant comment configurer le serveur Ollama pour définir correctement la variable d'environnement.

Le paramètre d'API keep_alive avec les points de terminaison /api/generate et /api/chat remplacera le paramètre OLLAMA_KEEP_ALIVE.

Comment gérer le nombre maximal de requêtes que le serveur Ollama peut mettre en file d'attente ?

Si trop de requêtes sont envoyées au serveur, il répondra par une erreur 503 indiquant que le serveur est surchargé. Vous pouvez ajuster le nombre de requêtes pouvant être mises en file d'attente en définissant OLLAMA_MAX_QUEUE.

Comment Ollama gère-t-il les requêtes simultanées ?

Ollama prend en charge deux niveaux de traitement simultané. Si votre système dispose de suffisamment de mémoire disponible (mémoire système lors de l'inférence sur CPU, ou VRAM pour l'inférence sur GPU), plusieurs modèles peuvent être chargés en même temps. Pour un modèle donné, si la mémoire disponible est suffisante lors du chargement du modèle, il est configuré pour autoriser le traitement parallèle des requêtes.

Si la mémoire disponible est insuffisante pour charger une requête de nouveau modèle alors qu'un ou plusieurs modèles sont déjà chargés, toutes les nouvelles requêtes seront mises en file d'attente jusqu'à ce que le nouveau modèle puisse être chargé. Lorsque les modèles précédents deviennent inactifs, un ou plusieurs d'entre eux seront déchargés pour faire de la place au nouveau modèle. Les requêtes en file d'attente seront traitées dans l'ordre. Lors de l'utilisation de l'inférence sur GPU, les nouveaux modèles doivent pouvoir tenir entièrement dans la VRAM pour autoriser des chargements de modèles simultanés.

Le traitement parallèle des requêtes pour un modèle donné a pour effet d'augmenter la taille du contexte du nombre de requêtes parallèles. Par exemple, un contexte de 2K avec 4 requêtes parallèles donnera un contexte de 8K et une allocation de mémoire supplémentaire.

Les paramètres de serveur suivants peuvent être utilisés pour ajuster la façon dont Ollama gère les requêtes simultanées sur la plupart des plateformes :

  • OLLAMA_MAX_LOADED_MODELS - Nombre maximal de modèles pouvant être chargés simultanément, à condition qu'ils tiennent dans la mémoire disponible. La valeur par défaut est 3 multiplié par le nombre de GPUs, ou 3 pour l'inférence sur CPU.
  • OLLAMA_NUM_PARALLEL - Nombre maximal de requêtes parallèles que chaque modèle traitera en même temps, la valeur par défaut est 1. La RAM requise évolue proportionnellement à OLLAMA_NUM_PARALLEL multiplié par OLLAMA_CONTEXT_LENGTH.
  • OLLAMA_MAX_QUEUE - Nombre maximal de requêtes que Ollama mettra en file d'attente lorsqu'il est occupé avant de rejeter les requêtes supplémentaires. La valeur par défaut est 512

Note : Sous Windows avec des GPU Radeon, la valeur par défaut est actuellement de 1 modèle maximum en raison des limitations de ROCm v5.7 pour le rapport de VRAM disponible. Une fois ROCm v6.2 disponible, les Radeon sous Windows suivront les valeurs par défaut ci-dessus. Vous pouvez activer les chargements de modèles simultanés sur Radeon sous Windows, mais assurez-vous de ne pas charger plus de modèles que ce que la VRAM de votre GPU peut accueillir.

Comment Ollama charge-t-il les modèles sur plusieurs GPUs ?

Lors du chargement d'un nouveau modèle, Ollama évalue la VRAM requise pour le modèle par rapport à la quantité disponible actuellement. Si le modèle peut tenir entièrement sur un seul GPU, Ollama le chargera sur ce GPU. Cela offre généralement les meilleures performances, car cela réduit la quantité de données transférées sur le bus PCI pendant l'inférence. Si le modèle ne tient pas entièrement sur un seul GPU, il sera réparti sur tous les GPUs disponibles.

Comment activer Flash Attention ?

Flash Attention est une fonctionnalité de la plupart des modèles modernes qui permet de réduire considérablement l'utilisation de la mémoire au fur et à mesure que la taille du contexte augmente. Ollama utilise Flash Attention automatiquement lorsque le backend et les périphériques sélectionnés le prennent en charge. Pour forcer l'activation de Flash Attention, définissez la variable d'environnement OLLAMA_FLASH_ATTENTION=1 au démarrage du serveur Ollama. Pour le désactiver, définissez OLLAMA_FLASH_ATTENTION=0.

Comment définir le type de quantification du cache K/V ?

Le cache de contexte K/V peut être quantifié pour réduire considérablement l'utilisation de la mémoire lorsque Flash Attention est activé.

Pour utiliser un cache K/V quantifié avec Ollama, vous pouvez définir la variable d'environnement suivante :

  • OLLAMA_KV_CACHE_TYPE : le type de quantification du cache K/V. La valeur par défaut est f16.

Note

Il s'agit actuellement d'une option globale, ce qui signifie que tous les modèles s'exécuteront avec le type de quantification spécifié.

Les types de quantification de cache K/V actuellement disponibles sont :

  • f16 : haute précision et utilisation de mémoire élevée (valeur par défaut).
  • q8_0 : quantification 8 bits, utilise environ la moitié de la mémoire de f16 avec une perte de précision très faible, qui n'a généralement aucun impact perceptible sur la qualité du modèle (recommandé si vous n'utilisez pas f16).
  • q4_0 : quantification 4 bits, utilise environ le quart de la mémoire de f16 avec une perte de précision faible à moyenne qui peut être plus perceptible pour des tailles de contexte élevées.

L'impact de la quantification du cache sur la qualité des réponses du modèle dépend du modèle et de la tâche. Les modèles qui ont un nombre de GQA élevé (par exemple Qwen2) peuvent subir un impact plus important sur la précision dû à la quantification que les modèles avec un faible nombre de GQA.

Vous devrez peut-être tester différents types de quantification pour trouver le meilleur équilibre entre utilisation de la mémoire et qualité des réponses.

Où trouver ma clé publique Ollama ?

Votre clé publique Ollama est la partie publique de la paire de clés qui permet à votre instance Ollama locale de communiquer avec ollama.com.

Vous en aurez besoin pour :

  • Pousser des modèles vers Ollama
  • Récupérer des modèles privés depuis Ollama sur votre machine
  • Exécuter des modèles hébergés sur Ollama Cloud

Comment ajouter la clé

  • Se connecter via la page Paramètres dans les applications Mac et Windows

  • Se connecter via l'interface en ligne de commande (CLI)

shell
ollama signin

Où se trouve la clé publique Ollama

OSChemin vers id_ed25519.pub
macOS~/.ollama/id_ed25519.pub
Linux/usr/share/ollama/.ollama/id_ed25519.pub
WindowsC:\Users\<username>\.ollama\id_ed25519.pub

Note

Remplacez <username> par votre nom d'utilisateur Windows réel.

Comment empêcher Ollama de se lancer automatiquement à la connexion à mon ordinateur ?

Ollama pour Windows et macOS s'enregistre en tant qu'élément de connexion lors de l'installation. Vous pouvez désactiver cette option si vous préférez qu'Ollama ne se lance pas automatiquement. Ollama respectera ce paramètre lors des mises à jour, sauf si vous désinstallez l'application.

Windows

  • Dans le Gestionnaire des tâches, allez dans l'onglet Applications de démarrage, recherchez ollama puis cliquez sur Désactiver

MacOS

  • Ouvrez Paramètres et recherchez « Éléments de connexion », trouvez l'entrée Ollama dans la section Autoriser en arrière-plan, puis cliquez sur le curseur pour le désactiver.