Skip to content

Długość kontekstu to maksymalna liczba tokenów, do których model ma dostęp w pamięci.

Uwaga

Ollama domyślnie ustawia następujące długości kontekstu w zależności od VRAM: - < 24 GiB VRAM: kontekst 4k - 24-48 GiB VRAM: kontekst 32k - >= 48 GiB VRAM: kontekst 256k

Zadania wymagające dużego kontekstu, takie jak wyszukiwanie w internecie, agenci i narzędzia do kodowania, powinny mieć ustawioną długość co najmniej 64000 tokenów.

Ustawianie długości kontekstu

Ustawienie większej długości kontekstu zwiększy ilość pamięci wymaganej do uruchomienia modelu. Upewnij się, że masz wystarczającą ilość VRAM, aby zwiększyć długość kontekstu.

Modele w chmurze domyślnie są ustawione na maksymalną długość kontekstu.

Aplikacja

Zmień suwak w aplikacji Ollama w ustawieniach na żądaną długość kontekstu. Długość kontekstu w aplikacji Ollama

CLI

Jeśli edycja długości kontekstu dla Ollamy nie jest możliwa, długość kontekstu można również zaktualizować podczas uruchamiania serwisu Ollama.

OLLAMA_CONTEXT_LENGTH=64000 ollama serve

Sprawdzenie przydzielonej długości kontekstu i odciążania modelu

Aby uzyskać najlepszą wydajność, używaj maksymalnej długości kontekstu dla modelu i unikaj odciążania modelu na procesorze CPU. Sprawdź podział w kolumnie PROCESSOR za pomocą polecenia ollama ps.

ollama ps
NAME             ID              SIZE      PROCESSOR    CONTEXT    UNTIL
gemma4:latest    c6eb396dbd59    9.6 GB    100% GPU     131072     2 minuty od teraz