Długość kontekstu to maksymalna liczba tokenów, do których model ma dostęp w pamięci.
Uwaga
Ollama domyślnie ustawia następujące długości kontekstu w zależności od VRAM: - < 24 GiB VRAM: kontekst 4k - 24-48 GiB VRAM: kontekst 32k - >= 48 GiB VRAM: kontekst 256k
Zadania wymagające dużego kontekstu, takie jak wyszukiwanie w internecie, agenci i narzędzia do kodowania, powinny mieć ustawioną długość co najmniej 64000 tokenów.
Ustawianie długości kontekstu
Ustawienie większej długości kontekstu zwiększy ilość pamięci wymaganej do uruchomienia modelu. Upewnij się, że masz wystarczającą ilość VRAM, aby zwiększyć długość kontekstu.
Modele w chmurze domyślnie są ustawione na maksymalną długość kontekstu.
Aplikacja
Zmień suwak w aplikacji Ollama w ustawieniach na żądaną długość kontekstu. 
CLI
Jeśli edycja długości kontekstu dla Ollamy nie jest możliwa, długość kontekstu można również zaktualizować podczas uruchamiania serwisu Ollama.
OLLAMA_CONTEXT_LENGTH=64000 ollama serveSprawdzenie przydzielonej długości kontekstu i odciążania modelu
Aby uzyskać najlepszą wydajność, używaj maksymalnej długości kontekstu dla modelu i unikaj odciążania modelu na procesorze CPU. Sprawdź podział w kolumnie PROCESSOR za pomocą polecenia ollama ps.
ollama psNAME ID SIZE PROCESSOR CONTEXT UNTIL
gemma4:latest c6eb396dbd59 9.6 GB 100% GPU 131072 2 minuty od teraz