Skip to content

Długość kontekstu to maksymalna liczba tokenów, do których model ma dostęp w pamięci.

Uwaga

Ollama domyślnie ustawia następujące długości kontekstu w zależności od VRAM: - < 24 GiB VRAM: kontekst 4k - 24-48 GiB VRAM: kontekst 32k - >= 48 GiB VRAM: kontekst 256k

Zadania wymagające dużego kontekstu, takie jak wyszukiwanie w internecie, agenci i narzędzia do kodowania, powinny mieć ustawioną długość co najmniej 64000 tokenów.

Ustawianie długości kontekstu ​

Ustawienie większej długości kontekstu zwiększy ilość pamięci wymaganej do uruchomienia modelu. Upewnij się, że masz wystarczającą ilość VRAM, aby zwiększyć długość kontekstu.

Modele w chmurze domyślnie są ustawione na maksymalną długość kontekstu.

Aplikacja ​

Zmień suwak w aplikacji Ollama w ustawieniach na żądaną długość kontekstu. Długość kontekstu w aplikacji Ollama

CLI ​

Jeśli edycja długości kontekstu dla Ollamy nie jest możliwa, długość kontekstu można również zaktualizować podczas uruchamiania serwisu Ollama.

OLLAMA_CONTEXT_LENGTH=64000 ollama serve

Sprawdzenie przydzielonej długości kontekstu i odciążania modelu ​

Aby uzyskać najlepszą wydajność, używaj maksymalnej długości kontekstu dla modelu i unikaj odciążania modelu na procesorze CPU. Sprawdź podział w kolumnie PROCESSOR za pomocą polecenia ollama ps.

ollama ps
NAME             ID              SIZE      PROCESSOR    CONTEXT    UNTIL
gemma4:latest    c6eb396dbd59    9.6 GB    100% GPU     131072     2 minuty od teraz