Jak zaktualizować Ollamę?
Ollama na systemach macOS i Windows automatycznie pobiera aktualizacje. Kliknij element paska zadań lub paska menu, a następnie kliknij „Uruchom ponownie, aby zaktualizować”, aby zastosować aktualizację. Aktualizacje można również zainstalować, pobierając najnowszą wersję ręcznie.
W systemie Linux uruchom ponownie skrypt instalacyjny:
shell
curl -fsSL https://ollama.com/install.sh | shJak mogę wyświetlić logi?
Przejrzyj dokumentację Rozwiązywanie problemów, aby uzyskać więcej informacji na temat pracy z logami.
Czy moja karta GPU jest kompatybilna z Ollama?
Zapoznaj się z dokumentacją GPU.
Jak mogę określić rozmiar okna kontekstu?
Domyślnie Ollama używa rozmiaru okna kontekstu wynoszącego 4096 tokenów.
Tę wartość można nadpisać za pomocą zmiennej środowiskowej OLLAMA_CONTEXT_LENGTH. Na przykład, aby ustawić domyślne okno kontekstu na 8K, użyj:
shell
OLLAMA_CONTEXT_LENGTH=8192 ollama serveAby zmienić tę wartość podczas używania ollama run, użyj /set parameter:
shell
/set parameter num_ctx 4096Podczas używania API określ parametr num_ctx:
shell
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Why is the sky blue?",
"options": {
"num_ctx": 4096
}
}'Jak sprawdzić, czy mój model został załadowany na GPU?
Użyj polecenia ollama ps, aby zobaczyć, które modele są obecnie załadowane w pamięci.
shell
ollama psINFO
Wynik:
NAME ID SIZE PROCESSOR UNTIL
llama3:70b bcfb190ca3a7 42 GB 100% GPU 4 minutes from nowKolumna Processor pokaże, w jaką pamięć został załadowany model:
100% GPUoznacza, że model został w całości załadowany na GPU100% CPUoznacza, że model został w całości załadowany w pamięci systemowej48%/52% CPU/GPUoznacza, że model został częściowo załadowany zarówno na GPU, jak i w pamięci systemowej
Jak skonfigurować serwer Ollama?
Serwer Ollama można skonfigurować za pomocą zmiennych środowiskowych.
Ustawianie zmiennych środowiskowych na macOS
Jeśli Ollama jest uruchomiony jako aplikacja macOS, zmienne środowiskowe należy ustawić za pomocą launchctl:
Dla każdej zmiennej środowiskowej wywołaj
launchctl setenv.bashlaunchctl setenv OLLAMA_HOST "0.0.0.0:11434"Uruchom ponownie aplikację Ollama.
Ustawianie zmiennych środowiskowych na Linuxie
Jeśli Ollama jest uruchomiony jako usługa systemd, zmienne środowiskowe należy ustawić za pomocą systemctl:
Edytuj usługę systemd, wywołując
systemctl edit ollama.service. Spowoduje to otwarcie edytora.Dla każdej zmiennej środowiskowej dodaj wiersz
Environmentw sekcji[Service]:ini[Service] Environment="OLLAMA_HOST=0.0.0.0:11434"Zapisz i wyjdź.
Przeładuj
systemdi uruchom ponownie Ollama:shellsystemctl daemon-reload systemctl restart ollama
Ustawianie zmiennych środowiskowych na Windows
Na systemie Windows Ollama dziedziczy zmienne środowiskowe użytkownika i systemowe.
Najpierw zamknij Ollama, klikając jego ikonę na pasku zadań.
Uruchom aplikację Ustawienia (Windows 11) lub Panel sterowania (Windows 10) i wyszukaj zmienne środowiskowe.
Kliknij Edytuj zmienne środowiskowe dla Twojego konta.
Edytuj lub utwórz nową zmienną dla Twojego konta użytkownika dla
OLLAMA_HOST,OLLAMA_MODELSitp.Kliknij OK/Zastosuj, aby zapisać.
Uruchom aplikację Ollama z menu Start systemu Windows.
Jak używać Ollama za proxy?
Ollama pobiera modele z Internetu i może wymagać serwera proxy, aby uzyskać do nich dostęp. Użyj HTTPS_PROXY, aby przekierować żądania wychodzące przez proxy. Upewnij się, że certyfikat proxy jest zainstalowany jako certyfikat systemowy. Zapoznaj się z sekcją powyżej, aby dowiedzieć się, jak ustawiać zmienne środowiskowe na Twojej platformie.
Uwaga
Unikaj ustawiania HTTP_PROXY. Ollama nie używa HTTP do pobierania modeli, tylko HTTPS. Ustawienie HTTP_PROXY może przerwać połączenia klienta z serwerem.
Jak używać Ollama za proxy w Dockerze?
Obraz kontenera Dockera Ollama można skonfigurować do używania proxy, przekazując parametr -e HTTPS_PROXY=https://proxy.example.com podczas uruchamiania kontenera.
Alternatywnie demon Dockera można skonfigurować do używania proxy. Instrukcje są dostępne dla Docker Desktop na systemach macOS, Windows i Linux, a także dla demona Dockera z systemd.
Upewnij się, że certyfikat jest zainstalowany jako certyfikat systemowy podczas używania HTTPS. Może to wymagać utworzenia nowego obrazu Dockera w przypadku użycia certyfikatu samodzielnie podpisanego.
dockerfile
FROM ollama/ollama
COPY my-ca.pem /usr/local/share/ca-certificates/my-ca.crt
RUN update-ca-certificatesZbuduj i uruchom ten obraz:
shell
docker build -t ollama-with-ca .
docker run -d -e HTTPS_PROXY=https://my.proxy.example.com -p 11434:11434 ollama-with-caCzy Ollama wysyła moje zapytania i odpowiedzi z powrotem na ollama.com?
Ollama działa lokalnie. Nie widzimy Twoich zapytań ani danych, gdy uruchamiasz go lokalnie. Podczas używania modeli hostowanych w chmurze przetwarzamy Twoje zapytania i odpowiedzi, aby świadczyć usługę, ale nie przechowujemy ani nie logujemy tej zawartości i nigdy nie trenujemy na niej modeli. Zbieramy podstawowe informacje o koncie i ograniczone metadane użycia, aby świadczyć usługę, które nie obejmują zawartości zapytań i odpowiedzi. Nie sprzedajemy Twoich danych. Możesz usunąć swoje konto w dowolnym momencie.
Jak wyłączyć funkcje chmurowe Ollama?
Ollama może działać w trybie wyłącznie lokalnym, wyłączając jego funkcje chmurowe. Po wyłączeniu funkcji chmurowych Ollama stracisz możliwość używania modeli chmurowych Ollama oraz wyszukiwania w internecie.
Ustaw disable_ollama_cloud w pliku ~/.ollama/server.json:
json
{
"disable_ollama_cloud": true
}Możesz również ustawić zmienną środowiskową:
shell
OLLAMA_NO_CLOUD=1Uruchom ponownie Ollama po zmianie konfiguracji. Po wyłączeniu w logach Ollama pojawi się wpis Ollama cloud disabled: true.
Jak udostępnić Ollama w mojej sieci?
Domyślnie Ollama wiąże się z adresem 127.0.0.1 na porcie 11434. Zmień adres wiązania za pomocą zmiennej środowiskowej OLLAMA_HOST.
Zapoznaj się z sekcją powyżej, aby dowiedzieć się, jak ustawiać zmienne środowiskowe na Twojej platformie.
Jak używać Ollama z serwerem proxy?
Ollama uruchamia serwer HTTP i można go udostępnić za pomocą serwera proxy, takiego jak Nginx. Aby to zrobić, skonfiguruj proxy do przekazywania żądań i opcjonalnie ustaw wymagane nagłówki (jeśli nie udostępniasz Ollama w sieci). Na przykład, dla Nginx:
nginx
server {
listen 80;
server_name example.com; # Zastąp swoją domeną lub adresem IP
location / {
proxy_pass http://localhost:11434;
proxy_set_header Host localhost:11434;
}
}Jak używać Ollama z ngrok?
Dostęp do Ollama można uzyskać za pomocą różnych aplikacji do tunelowania. Na przykład za pomocą Ngrok:
shell
ngrok http 11434 --host-header="localhost:11434"Jak używać Ollama z tunelem Cloudflare?
Aby używać Ollama z tunelem Cloudflare, użyj flag --url i --http-host-header:
shell
cloudflared tunnel --url http://localhost:11434 --http-host-header="localhost:11434"Jak zezwolić dodatkowym źródłom internetowym na dostęp do Ollama?
Domyślnie Ollama zezwala na żądania między źródłami (CORS) z adresów 127.0.0.1 i 0.0.0.0. Dodatkowe źródła można skonfigurować za pomocą OLLAMA_ORIGINS.
W przypadku rozszerzeń przeglądarki musisz jawnie zezwolić na wzorzec źródła rozszerzenia. Ustaw OLLAMA_ORIGINS, aby zawierał chrome-extension://*, moz-extension://* i safari-web-extension://*, jeśli chcesz zezwolić na dostęp wszystkich rozszerzeń przeglądarki, lub określone rozszerzenia według potrzeb:
# Zezwól na wszystkie rozszerzenia Chrome, Firefox i Safari
OLLAMA_ORIGINS=chrome-extension://*,moz-extension://*,safari-web-extension://* ollama serveZapoznaj się z sekcją powyżej, aby dowiedzieć się, jak ustawiać zmienne środowiskowe na Twojej platformie.
Gdzie są przechowywane modele?
- macOS:
~/.ollama/models - Linux:
/usr/share/ollama/.ollama/models - Windows:
C:\Users\%username%\.ollama\models
Jak ustawić inne miejsce ich przechowywania?
Jeśli potrzebujesz użyć innego katalogu, ustaw zmienną środowiskową OLLAMA_MODELS na wybraną ścieżkę.
Uwaga
Na Linuxie, przy użyciu standardowego instalatora, użytkownik ollama potrzebuje uprawnień do odczytu i zapisu w określonym katalogu. Aby przypisać katalog do użytkownika ollama, uruchom polecenie sudo chown -R ollama:ollama <directory>.
Zapoznaj się z sekcją powyżej, aby dowiedzieć się, jak ustawiać zmienne środowiskowe na Twojej platformie.
Jak używać Ollama w Visual Studio Code?
Już teraz dostępna jest duża kolekcja wtyczek dla VS Code oraz innych edytorów, które wykorzystują Ollama. Zobacz listę rozszerzeń i wtyczek na dole głównego pliku readme repozytorium.
Jak używać Ollama z akceleracją GPU w Dockerze?
Kontener Dockera Ollama można skonfigurować z akceleracją GPU na systemie Linux lub Windows (z WSL2). Wymaga to nvidia-container-toolkit. Więcej szczegółów znajdziesz w repozytorium ollama/ollama.
Akceleracja GPU nie jest dostępna dla Docker Desktop na macOS z powodu braku passthrough GPU i emulacji.
Dlaczego sieć działa wolno we WSL2 na Windows 10?
Może to wpływać zarówno na instalację Ollama, jak i na pobieranie modeli.
Otwórz Panel sterowania > Sieć i Internet > Wyświetl stan sieci i zadania i kliknij Zmień ustawienia karty sieciowej w lewym panelu. Znajdź kartę sieciową vEthernet (WSL), kliknij ją prawym przyciskiem myszy i wybierz Właściwości. Kliknij Konfiguruj i otwórz kartę Zaawansowane. Przeszukaj wszystkie właściwości, aż znajdziesz Large Send Offload Version 2 (IPv4) i Large Send Offload Version 2 (IPv6). Wyłącz obie te właściwości.
Jak wczytać model do Ollama wcześniej, aby uzyskać szybsze czasy odpowiedzi?
Jeśli używasz API, możesz wczytać model wcześniej, wysyłając do serwera Ollama puste żądanie. Działa to z obydwoma punktami końcowymi API: /api/generate i /api/chat.
Aby wczytać wcześniej model mistral za pomocą punktu końcowego generate, użyj:
shell
curl http://localhost:11434/api/generate -d '{"model": "mistral"}'Aby użyć punktu końcowego chat completions, użyj:
shell
curl http://localhost:11434/api/chat -d '{"model": "mistral"}'Aby wczytać model wcześniej za pomocą interfejsu wiersza poleceń, użyj polecenia:
shell
ollama run llama3.2 ""Jak utrzymać model załadowany w pamięci lub wymusić jego natychmiastowe zwolnienie?
Domyślnie modele są przechowywane w pamięci przez 5 minut przed zwolnieniem. Zapewnia to szybsze czasy odpowiedzi, jeśli wysyłasz wiele żądań do modelu LLM. Jeśli chcesz natychmiast zwolnić model z pamięci, użyj polecenia ollama stop:
shell
ollama stop llama3.2Jeśli używasz API, użyj parametru keep_alive z punktami końcowymi /api/generate i /api/chat, aby ustawić czas, przez który model pozostaje w pamięci. Parametr keep_alive może być ustawiony na:
- ciąg znaków określający czas (np. „10m” lub „24h”)
- liczbę sekund (np. 3600)
- dowolną liczbę ujemną, która spowoduje, że model pozostanie załadowany w pamięci (np. -1 lub „-1m”)
- „0”, która spowoduje natychmiastowe zwolnienie modelu po wygenerowaniu odpowiedzi
Na przykład, aby wczytać model wcześniej i pozostawić go w pamięci, użyj:
shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": -1}'Aby zwolnić model i odzyskać pamięć, użyj:
shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": 0}'Alternatywnie możesz zmienić czas, przez który wszystkie modele są przechowywane w pamięci, ustawiając zmienną środowiskową OLLAMA_KEEP_ALIVE podczas uruchamiania serwera Ollama. Zmienna OLLAMA_KEEP_ALIVE używa tych samych typów parametrów co parametr keep_alive wymieniony powyżej. Zapoznaj się z sekcją opisującą jak skonfigurować serwer Ollama, aby poprawnie ustawić zmienną środowiskową.
Parametr API keep_alive z punktami końcowymi /api/generate i /api/chat nadpisze ustawienie OLLAMA_KEEP_ALIVE.
Jak zarządzać maksymalną liczbą żądań, które serwer Ollama może umieścić w kolejce?
Jeśli do serwera zostanie wysłanych zbyt wiele żądań, zwróci on błąd 503, co oznacza, że serwer jest przeciążony. Możesz dostosować liczbę żądań, które mogą być umieszczane w kolejce, ustawiając OLLAMA_MAX_QUEUE.
Jak Ollama obsługuje współbieżne żądania?
Ollama obsługuje dwa poziomy przetwarzania współbieżnego. Jeśli Twój system ma wystarczająco dużo dostępnej pamięci (pamięci systemowej podczas używania wnioskowania na CPU, lub VRAM podczas wnioskowania na GPU), można wczytać wiele modeli jednocześnie. Dla danego modelu, jeśli podczas jego wczytywania jest wystarczająco dużo dostępnej pamięci, jest on skonfigurowany do zezwalania na równoległe przetwarzanie żądań.
Jeśli nie ma wystarczająco dużo dostępnej pamięci, aby wczytać nowy model, podczas gdy jeden lub więcej modeli jest już załadowanych, wszystkie nowe żądania zostaną umieszczone w kolejce, aż nowy model będzie można wczytać. Gdy wcześniejsze modele staną się nieaktywne, jeden lub więcej z nich zostanie zwolnionych, aby zrobić miejsce dla nowego modelu. Żądania w kolejce będą przetwarzane kolejno. Podczas używania wnioskowania na GPU nowe modele muszą w całości zmieścić się w VRAM, aby umożliwić współbieżne wczytywanie modeli.
Równoległe przetwarzanie żądań dla danego modelu powoduje zwiększenie rozmiaru kontekstu o liczbę równoległych żądań. Na przykład kontekst 2K z 4 równoległymi żądaniami da kontekst 8K i dodatkowe przydzielenie pamięci.
Następujące ustawienia serwera mogą być użyte do dostosowania sposobu, w jaki Ollama obsługuje współbieżne żądania na większości platform:
OLLAMA_MAX_LOADED_MODELS- Maksymalna liczba modeli, które można wczytać współbieżnie, o ile mieszczą się w dostępnej pamięci. Wartość domyślna to 3 razy liczba GPU lub 3 dla wnioskowania na CPU.OLLAMA_NUM_PARALLEL- Maksymalna liczba równoległych żądań, które każdy model będzie przetwarzał jednocześnie, wartość domyślna to 1. Wymagana ilość RAM skaluje się według wzoruOLLAMA_NUM_PARALLEL*OLLAMA_CONTEXT_LENGTH.OLLAMA_MAX_QUEUE- Maksymalna liczba żądań, które Ollama umieści w kolejce podczas zajętości, przed odrzuceniem dodatkowych żądań. Wartość domyślna to 512
Uwaga: System Windows z kartami GPU Radeon obecnie domyślnie obsługuje maksymalnie 1 model z powodu ograniczeń w raportowaniu dostępnego VRAM w ROCm v5.7. Gdy ROCm v6.2 będzie dostępny, Radeon na Windows będzie przestrzegać powyższych wartości domyślnych. Możesz włączyć współbieżne wczytywanie modeli na Radeon w systemie Windows, ale upewnij się, że nie wczytujesz więcej modeli, niż zmieści się w VRAM Twojej karty GPU.
Jak Ollama wczytuje modele na wielu kartach GPU?
Podczas wczytywania nowego modelu Ollama porównuje wymaganą ilość VRAM dla modelu z tym, co jest obecnie dostępne. Jeśli model w całości zmieści się na dowolnej pojedynczej karcie GPU, Ollama wczyta go na tę kartę. Zazwyczaj zapewnia to najlepszą wydajność, ponieważ zmniejsza ilość danych przesyłanych przez magistralę PCI podczas wnioskowania. Jeśli model nie zmieści się w całości na jednej karcie GPU, zostanie rozłożony na wszystkich dostępnych kartach GPU.
Jak włączyć Flash Attention?
Flash Attention to funkcja dostępna w większości nowoczesnych modeli, która może znacznie zmniejszyć zużycie pamięci wraz ze wzrostem rozmiaru kontekstu. Ollama używa Flash Attention automatycznie, gdy wybrany backend i urządzenia go obsługują. Aby wymusić włączenie Flash Attention, ustaw zmienną środowiskową OLLAMA_FLASH_ATTENTION=1 podczas uruchamiania serwera Ollama. Aby ją wyłączyć, ustaw OLLAMA_FLASH_ATTENTION=0.
Jak ustawić typ kwantyzacji pamięci podręcznej K/V?
Pamięć podręczna kontekstu K/V może zostać skwantyzowana, co znacznie zmniejsza zużycie pamięci, gdy Flash Attention jest włączone.
Aby użyć skwantyzowanej pamięci podręcznej K/V z Ollamą, możesz ustawić następującą zmienną środowiskową:
OLLAMA_KV_CACHE_TYPE– typ kwantyzacji pamięci podręcznej K/V. Wartość domyślna tof16.
Uwaga
Obecnie jest to opcja globalna – co oznacza, że wszystkie modele będą uruchamiane z określonym typem kwantyzacji.
Obecnie dostępne typy kwantyzacji pamięci podręcznej K/V to:
f16– wysoka precyzja i zużycie pamięci (wartość domyślna).q8_0– kwantyzacja 8-bitowa, zużywa około połowę pamięci wymaganej przezf16przy bardzo małej utracie precyzji, co zazwyczaj nie ma zauważalnego wpływu na jakość modelu (zalecana, jeśli nie używasz f16).q4_0– kwantyzacja 4-bitowa, zużywa około ćwiartkę pamięci wymaganej przezf16przy małej do średniej utracie precyzji, która może być bardziej zauważalna przy większych rozmiarach kontekstu.
Wpływ kwantyzacji pamięci podręcznej na jakość odpowiedzi modelu zależy od modelu i zadania. Modele o wysokiej wartości GQA (np. Qwen2) mogą doświadczać większego spadku precyzji po kwantyzacji niż modele o niskiej wartości GQA.
Być może będziesz musiał przetestować różne typy kwantyzacji, aby znaleźć najlepszy balans między zużyciem pamięci a jakością.
Gdzie znajdę mój klucz publiczny Ollama?
Twój klucz publiczny Ollama to publiczna część pary kluczy, która umożliwia Twojej lokalnej instancji Ollamy komunikację z serwisem ollama.com.
Będziesz go potrzebować, aby:
- Wgrywać modele do Ollamy
- Pobierać prywatne modele z Ollamy na swój komputer
- Uruchamiać modele hostowane w Ollama Cloud
Jak dodać klucz
Zaloguj się za pomocą strony Ustawień w aplikacjach na Mac i Windows
Zaloguj się za pomocą interfejsu wiersza poleceń (CLI)
shell
ollama signin- Ręcznie skopiuj i wklej klucz na stronie Klucze Ollama: https://ollama.com/settings/keys
Gdzie przechowywany jest klucz publiczny Ollama
| System operacyjny | Ścieżka do pliku id_ed25519.pub |
|---|---|
| macOS | ~/.ollama/id_ed25519.pub |
| Linux | /usr/share/ollama/.ollama/id_ed25519.pub |
| Windows | C:\Users\<username>\.ollama\id_ed25519.pub |
Uwaga
Zastąp <username> swoją rzeczywistą nazwą użytkownika Windows.
Jak wyłączyć automatyczne uruchamianie Ollamy podczas logowania do komputera?
Ollama dla systemów Windows i macOS rejestruje się jako element logowania podczas instalacji. Możesz to wyłączyć, jeśli wolisz, aby Ollama nie uruchamiała się automatycznie. Ollama zachowa to ustawienie podczas aktualizacji, chyba że odinstalujesz aplikację.
Windows
- W
Menedżerze zadańprzejdź do kartyAplikacje startowe, wyszukajollama, a następnie kliknijWyłącz
MacOS
- Otwórz
Ustawienia, wyszukaj „Elementy logowania”, znajdź wpisOllamaw sekcjiZezwól w tle, a następnie przesuń suwak, aby wyłączyć.