La longitud de contexto es el número máximo de tokens a los que el modelo tiene acceso en memoria.
Nota
Ollama usa por defecto las siguientes longitudes de contexto en función de la VRAM: - < 24 GiB de VRAM: contexto de 4k - 24-48 GiB de VRAM: contexto de 32k - >= 48 GiB de VRAM: contexto de 256k
Las tareas que requieren un contexto amplio, como la búsqueda web, los agentes y las herramientas de programación, deben configurarse con al menos 64000 tokens.
Configuración de la longitud de contexto
Establecer una longitud de contexto mayor aumentará la cantidad de memoria necesaria para ejecutar un modelo. Asegúrate de tener suficiente VRAM disponible para aumentar la longitud de contexto.
Los modelos en la nube se configuran por defecto con su longitud de contexto máxima.
Aplicación
Cambia el control deslizante de la configuración de la aplicación de Ollama a la longitud de contexto que desees. 
CLI
Si no es posible editar la longitud de contexto de Ollama, también se puede actualizar al iniciar el servicio de Ollama.
OLLAMA_CONTEXT_LENGTH=64000 ollama serveVerificación de la longitud de contexto asignada y la descarga del modelo
Para obtener el mejor rendimiento, utiliza la longitud de contexto máxima para un modelo y evita descargar el modelo a la CPU. Verifica la división en el campo PROCESSOR usando el comando ollama ps.
ollama psNAME ID SIZE PROCESSOR CONTEXT UNTIL
gemma4:latest c6eb396dbd59 9.6 GB 100% GPU 131072 2 minutes from now