La longueur du contexte correspond au nombre maximal de tokens auxquels le modèle a accès en mémoire.
Note
Ollama utilise par défaut les longueurs de contexte suivantes en fonction de la VRAM : - < 24 GiB VRAM : contexte de 4k - 24 à 48 GiB VRAM : contexte de 32k - >= 48 GiB VRAM : contexte de 256k
Les tâches nécessitant un contexte important, comme la recherche web, les agents et les outils de codage, doivent être configurées avec une longueur d'au moins 64 000 tokens.
Définition de la longueur du contexte
Définir une longueur de contexte plus importante augmentera la quantité de mémoire nécessaire pour exécuter un modèle. Assurez-vous de disposer de suffisamment de VRAM pour augmenter la longueur du contexte.
Les modèles cloud sont configurés par défaut sur leur longueur de contexte maximale.
Application
Modifiez le curseur dans l'application Ollama, dans les paramètres, pour définir la longueur de contexte souhaitée. 
CLI
Si la modification de la longueur de contexte pour Ollama n'est pas possible, vous pouvez également la mettre à jour lors du démarrage du service Ollama.
OLLAMA_CONTEXT_LENGTH=64000 ollama serveVérification de la longueur de contexte allouée et du déchargement du modèle
Pour des performances optimales, utilisez la longueur de contexte maximale pour un modèle et évitez de décharger le modèle sur le CPU. Vérifiez la répartition sous PROCESSOR à l'aide de la commande ollama ps.
ollama psNAME ID SIZE PROCESSOR CONTEXT UNTIL
gemma4:latest c6eb396dbd59 9.6 GB 100% GPU 131072 2 minutes from now