Skip to content

La longueur du contexte correspond au nombre maximal de tokens auxquels le modèle a accès en mémoire.

Note

Ollama utilise par défaut les longueurs de contexte suivantes en fonction de la VRAM : - < 24 GiB VRAM : contexte de 4k - 24 à 48 GiB VRAM : contexte de 32k - >= 48 GiB VRAM : contexte de 256k

Les tâches nécessitant un contexte important, comme la recherche web, les agents et les outils de codage, doivent être configurées avec une longueur d'au moins 64 000 tokens.

Définition de la longueur du contexte

Définir une longueur de contexte plus importante augmentera la quantité de mémoire nécessaire pour exécuter un modèle. Assurez-vous de disposer de suffisamment de VRAM pour augmenter la longueur du contexte.

Les modèles cloud sont configurés par défaut sur leur longueur de contexte maximale.

Application

Modifiez le curseur dans l'application Ollama, dans les paramètres, pour définir la longueur de contexte souhaitée. Longueur du contexte dans l'application Ollama

CLI

Si la modification de la longueur de contexte pour Ollama n'est pas possible, vous pouvez également la mettre à jour lors du démarrage du service Ollama.

OLLAMA_CONTEXT_LENGTH=64000 ollama serve

Vérification de la longueur de contexte allouée et du déchargement du modèle

Pour des performances optimales, utilisez la longueur de contexte maximale pour un modèle et évitez de décharger le modèle sur le CPU. Vérifiez la répartition sous PROCESSOR à l'aide de la commande ollama ps.

ollama ps
NAME             ID              SIZE      PROCESSOR    CONTEXT    UNTIL
gemma4:latest    c6eb396dbd59    9.6 GB    100% GPU     131072     2 minutes from now