Skip to content

La longitud de contexto es el número máximo de tokens a los que el modelo tiene acceso en memoria.

Nota

Ollama usa por defecto las siguientes longitudes de contexto en función de la VRAM: - < 24 GiB de VRAM: contexto de 4k - 24-48 GiB de VRAM: contexto de 32k - >= 48 GiB de VRAM: contexto de 256k

Las tareas que requieren un contexto amplio, como la búsqueda web, los agentes y las herramientas de programación, deben configurarse con al menos 64000 tokens.

Configuración de la longitud de contexto

Establecer una longitud de contexto mayor aumentará la cantidad de memoria necesaria para ejecutar un modelo. Asegúrate de tener suficiente VRAM disponible para aumentar la longitud de contexto.

Los modelos en la nube se configuran por defecto con su longitud de contexto máxima.

Aplicación

Cambia el control deslizante de la configuración de la aplicación de Ollama a la longitud de contexto que desees. Longitud de contexto en la aplicación de Ollama

CLI

Si no es posible editar la longitud de contexto de Ollama, también se puede actualizar al iniciar el servicio de Ollama.

OLLAMA_CONTEXT_LENGTH=64000 ollama serve

Verificación de la longitud de contexto asignada y la descarga del modelo

Para obtener el mejor rendimiento, utiliza la longitud de contexto máxima para un modelo y evita descargar el modelo a la CPU. Verifica la división en el campo PROCESSOR usando el comando ollama ps.

ollama ps
NAME             ID              SIZE      PROCESSOR    CONTEXT    UNTIL
gemma4:latest    c6eb396dbd59    9.6 GB    100% GPU     131072     2 minutes from now