Длина контекста — это максимальное количество токенов, к которым модель имеет доступ в памяти.
Примечание
По умолчанию Ollama использует следующие значения длины контекста в зависимости от объёма VRAM: - < 24 ГиБ VRAM: контекст 4k - 24–48 ГиБ VRAM: контекст 32k - ≥ 48 ГиБ VRAM: контекст 256k
Для задач, требующих большого объёма контекста (например, веб-поиск, агенты, инструменты для разработки), рекомендуется устанавливать длину контекста не менее 64000 токенов.
Настройка длины контекста
Увеличение длины контекста приводит к росту объёма памяти, необходимого для запуска модели. Убедитесь, что у вас достаточно свободной VRAM для увеличения длины контекста.
Для облачных моделей по умолчанию устанавливается максимальная возможная длина контекста.
Приложение
Измените значение длины контекста с помощью ползунка в разделе настроек приложения Ollama. 
CLI
Если изменить длину контекста в настройках Ollama невозможно, её можно также задать при запуске сервиса Ollama.
OLLAMA_CONTEXT_LENGTH=64000 ollama serveПроверка выделенной длины контекста и выгрузки модели на CPU
Для достижения максимальной производительности используйте максимально возможную длину контекста для модели и избегайте выгрузки модели на CPU. Проверьте распределение в столбце PROCESSOR с помощью команды ollama ps.
ollama psNAME ID SIZE PROCESSOR CONTEXT UNTIL
gemma4:latest c6eb396dbd59 9.6 GB 100% GPU 131072 через 2 минуты