Як оновити Ollama?
Ollama на macOS та Windows автоматично завантажує оновлення. Натисніть на елемент панелі завдань або меню-бару, потім натисніть «Перезапустити для оновлення», щоб застосувати оновлення. Оновлення також можна встановити, завантаживши останню версію вручну.
На Linux повторно запустіть скрипт встановлення:
shell
curl -fsSL https://ollama.com/install.sh | shЯк переглянути логи?
Ознайомтеся з документацією Усунення несправностей, щоб дізнатися більше про роботу з логами.
Чи сумісна моя графічна карта (GPU) з Ollama?
Зверніться до документації з роботи з GPU.
Як вказати розмір контекстного вікна?
За замовчуванням Ollama використовує контекстне вікно розміром 4096 токенів.
Це значення можна змінити за допомогою змінної середовища OLLAMA_CONTEXT_LENGTH. Наприклад, щоб встановити розмір контекстного вікна за замовчуванням 8К, використовуйте:
shell
OLLAMA_CONTEXT_LENGTH=8192 ollama serveЩоб змінити це під час використання ollama run, використовуйте команду /set parameter:
shell
/set parameter num_ctx 4096Під час використання API вкажіть параметр num_ctx:
shell
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Why is the sky blue?",
"options": {
"num_ctx": 4096
}
}'Як дізнатися, чи моя модель завантажена на графічну карту (GPU)?
Використовуйте команду ollama ps, щоб переглянути, які моделі зараз завантажені в пам'ять.
shell
ollama psINFO
Вихідні дані:
NAME ID SIZE PROCESSOR UNTIL
llama3:70b bcfb190ca3a7 42 GB 100% GPU 4 minutes from nowСтопчик Processor (Процесор) показує, в яку пам'ять завантажена модель:
100% GPUозначає, що модель повністю завантажена на графічну карту (GPU)100% CPUозначає, що модель повністю завантажена в оперативну пам'ять системи48%/52% CPU/GPUозначає, що модель частково завантажена і на графічну карту (GPU), і в оперативну пам'ять системи
Як налаштувати сервер Ollama?
Сервер Ollama можна налаштувати за допомогою змінних середовища.
Налаштування змінних середовища на macOS
Якщо Ollama запущено як програму для macOS, змінні середовища слід налаштувати за допомогою launchctl:
Для кожної змінної середовища виконайте команду
launchctl setenv.bashlaunchctl setenv OLLAMA_HOST "0.0.0.0:11434"Перезапустіть програму Ollama.
Налаштування змінних середовища на Linux
Якщо Ollama запущено як службу systemd, змінні середовища слід налаштувати за допомогою systemctl:
Відредагуйте службу systemd, виконавши команду
systemctl edit ollama.service. Це відкриє редактор.Для кожної змінної середовища додайте рядок
Environmentу розділі[Service]:ini[Service] Environment="OLLAMA_HOST=0.0.0.0:11434"Збережіть зміни та закрийте редактор.
Перезавантажте
systemdі перезапустіть Ollama:shellsystemctl daemon-reload systemctl restart ollama
Налаштування змінних середовища на Windows
У Windows Ollama успадковує змінні середовища вашого користувача та системи.
Спочатку закрийте Ollama, натиснувши на його піктограму на панелі завдань.
Запустіть програму «Параметри» (Windows 11) або «Панель керування» (Windows 10) і знайдіть змінні середовища.
Натисніть Змінити змінні середовища для вашого облікового запису.
Відредагуйте або створіть нову змінну для вашого облікового запису для
OLLAMA_HOST,OLLAMA_MODELSтощо.Натисніть «Гаразд»/«Застосувати», щоб зберегти зміни.
Запустіть програму Ollama з меню «Пуск» Windows.
Як використовувати Ollama через проксі-сервер?
Ollama завантажує моделі з Інтернету, і для доступу до них може знадобитися проксі-сервер. Використовуйте змінну середовища HTTPS_PROXY, щоб перенаправляти вихідні запити через проксі. Переконайтеся, що сертифікат проксі-сервера встановлено як системний сертифікат. Зверніться до розділу вище, щоб дізнатися, як налаштувати змінні середовища на вашій платформі.
Примітка
Не встановлюйте змінну HTTP_PROXY. Ollama не використовує HTTP для завантаження моделей, лише HTTPS. Встановлення HTTP_PROXY може порушити роботу клієнтських підключень до сервера.
Як використовувати Ollama через проксі-сервер у Docker?
Образ контейнера Ollama для Docker можна налаштувати на використання проксі-сервера, передавши параметр -e HTTPS_PROXY=https://proxy.example.com під час запуску контейнера.
Крім того, можна налаштувати використання проксі-сервера для демона Docker. Інструкції доступні для Docker Desktop на macOS, Windows та Linux, а також для демона Docker з systemd.
Переконайтеся, що сертифікат встановлено як системний при використанні HTTPS. При використанні самопідписаного сертифіката може знадобитися створити новий образ Docker.
dockerfile
FROM ollama/ollama
COPY my-ca.pem /usr/local/share/ca-certificates/my-ca.crt
RUN update-ca-certificatesЗберіть і запустіть цей образ:
shell
docker build -t ollama-with-ca .
docker run -d -e HTTPS_PROXY=https://my.proxy.example.com -p 11434:11434 ollama-with-caЧи відправляє Ollama мої запити та відповіді на ollama.com?
Ollama працює локально. Ми не бачимо ваші запити чи дані, коли ви працюєте локально. Під час використання хмарних моделей ми обробляємо ваші запити та відповіді для надання послуги, але не зберігаємо та не журналюємо цей вміст і ніколи не використовуємо його для навчання моделей. Ми збираємо базову інформацію про обліковий запис та обмежені метадані про використання для надання послуги, які не включають вміст запитів та відповідей. Ми не продаємо ваші дані. Ви можете видалити свій обліковий запис у будь-який час.
Як вимкнути хмарні функції Ollama?
Ollama може працювати в режимі лише локальної роботи, якщо вимкнути його хмарні функції. Після вимкнення хмарних функцій ви втратите можливість використовувати хмарні моделі Ollama та вебпошук.
Встановіть параметр disable_ollama_cloud у файлі ~/.ollama/server.json:
json
{
"disable_ollama_cloud": true
}Також ви можете встановити змінну середовища:
shell
OLLAMA_NO_CLOUD=1Перезапустіть Ollama після зміни конфігурації. Після вимкнення в логах Ollama з'явиться запис Ollama cloud disabled: true.
Як зробити Ollama доступним у моїй мережі?
За замовчуванням Ollama прив'язується до адреси 127.0.0.1 порт 11434. Змініть адресу прив'язки за допомогою змінної середовища OLLAMA_HOST.
Зверніться до розділу вище, щоб дізнатися, як налаштувати змінні середовища на вашій платформі.
Як використовувати Ollama з проксі-сервером?
Ollama запускає HTTP-сервер, який можна зробити доступним за допомогою проксі-сервера, наприклад Nginx. Для цього налаштуйте проксі-сервер на перенаправлення запитів і, за потреби, встановіть необхідні заголовки (якщо ви не робите Ollama доступним у мережі). Наприклад, для Nginx:
nginx
server {
listen 80;
server_name example.com; # Replace with your domain or IP
location / {
proxy_pass http://localhost:11434;
proxy_set_header Host localhost:11434;
}
}Як використовувати Ollama з ngrok?
До Ollama можна отримати доступ за допомогою різних програм для тунелювання. Наприклад, за допомогою Ngrok:
shell
ngrok http 11434 --host-header="localhost:11434"Як використовувати Ollama з Cloudflare Tunnel?
Щоб використовувати Ollama з Cloudflare Tunnel, використовуйте прапорці --url та --http-host-header:
shell
cloudflared tunnel --url http://localhost:11434 --http-host-header="localhost:11434"Як дозволити додатковим веб-джерелам отримувати доступ до Ollama?
За замовчуванням Ollama дозволяє кросс-доменні запити з адрес 127.0.0.1 та 0.0.0.0. Додаткові джерела можна налаштувати за допомогою змінної середовища OLLAMA_ORIGINS.
Для розширень браузера потрібно явно дозволити шаблон джерела розширення. Встановіть для OLLAMA_ORIGINS значення, що включає chrome-extension://*, moz-extension://* та safari-web-extension://*, якщо ви хочете дозволити доступ усім розширенням браузера, або конкретні розширення за потреби:
# Allow all Chrome, Firefox, and Safari extensions
OLLAMA_ORIGINS=chrome-extension://*,moz-extension://*,safari-web-extension://* ollama serveЗверніться до розділу вище, щоб дізнатися, як налаштувати змінні середовища на вашій платформі.
Де зберігаються моделі?
- macOS:
~/.ollama/models - Linux:
/usr/share/ollama/.ollama/models - Windows:
C:\Users\%username%\.ollama\models
Як змінити місце зберігання моделей?
Якщо потрібно використовувати інший каталог, встановіть для змінної середовища OLLAMA_MODELS шлях до бажаного каталогу.
Примітка
У Linux при використанні стандартного інсталятора користувач ollama потребує прав на читання та запис у вказаному каталозі. Щоб надати каталог користувачеві ollama, виконайте команду sudo chown -R ollama:ollama <directory>.
Зверніться до розділу вище, щоб дізнатися, як налаштувати змінні середовища на вашій платформі.
Як використовувати Ollama у Visual Studio Code?
Вже доступна велика колекція плагінів для VS Code, а також для інших редакторів, що використовують Ollama. Перегляньте список розширень та плагінів в нижній частині основного файлу README репозиторію.
Як використовувати прискорення від графічної карти (GPU) для Ollama у Docker?
Контейнер Ollama для Docker можна налаштувати на використання прискорення від GPU на Linux або Windows (з WSL2). Для цього потрібен nvidia-container-toolkit. Додаткові деталі дивіться на сторінці образу ollama/ollama.
Прискорення від GPU не доступне для Docker Desktop на macOS через відсутність підтримки прямиого доступу до GPU та емуляції.
Чому мережеве з'єднання повільне в WSL2 на Windows 10?
Це може впливати як на встановлення Ollama, так і на завантаження моделей.
Відкрийте Панель керування > Мережа та Інтернет > Перегляд стану мережі та завдань і натисніть Змінити параметри адаптера на лівій панелі. Знайдіть адаптер vEthernet (WSL), клацніть правою кнопкою миші та виберіть Властивості. Натисніть Налаштувати і відкрийте вкладку Додатково. Переглядайте властивості по черзі, поки не знайдете Large Send Offload Version 2 (IPv4) та Large Send Offload Version 2 (IPv6). Вимкніть обидві ці властивості.
Як попередньо завантажити модель в Ollama, щоб отримувати швидші відповіді?
Якщо ви використовуєте API, ви можете попередньо завантажити модель, надіславши серверу Ollama порожній запит. Це працює для обох кінцевих точок API: /api/generate та /api/chat.
Щоб попередньо завантажити модель mistral за допомогою кінцевої точки generate, використовуйте:
shell
curl http://localhost:11434/api/generate -d '{"model": "mistral"}'Щоб використовувати кінцеву точку chat completions, виконайте:
shell
curl http://localhost:11434/api/chat -d '{"model": "mistral"}'Щоб попередньо завантажити модель за допомогою CLI, використовуйте команду:
shell
ollama run llama3.2 ""Як тримати модель завантаженою в пам'яті або вивантажити її негайно?
За замовчуванням моделі зберігаються в пам'яті 5 хвилин перед вивантаженням. Це дозволяє отримувати швидші відповіді, якщо ви надсилаєте багато запитів до LLM. Якщо ви хочете негайно вивантажити модель з пам'яті, використовуйте команду ollama stop:
shell
ollama stop llama3.2Якщо ви використовуєте API, використовуйте параметр keep_alive з кінцевими точками /api/generate та /api/chat, щоб встановити час, протягом якого модель зберігатиметься в пам'яті. Параметр keep_alive може мати такі значення:
- рядок із тривалістю (наприклад, «10m» або «24h»)
- число в секундах (наприклад, 3600)
- будь-яке від'ємне число, яке змусить модель залишатися завантаженою в пам'яті (наприклад, -1 або «-1m»)
- «0», яке вивантажує модель негайно після генерації відповіді
Наприклад, щоб попередньо завантажити модель і залишити її в пам'яті, виконайте:
shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": -1}'Щоб вивантажити модель і звільнити пам'ять, виконайте:
shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": 0}'Крім того, ви можете змінити час, протягом якого всі моделі зберігаються в пам'яті, встановивши змінну середовища OLLAMA_KEEP_ALIVE під час запуску сервера Ollama. Змінна OLLAMA_KEEP_ALIVE використовує ті самі типи параметрів, що й параметр keep_alive, згаданий вище. Зверніться до розділу з описом налаштування сервера Ollama, щоб правильно встановити змінну середовища.
Параметр API keep_alive для кінцевих точок /api/generate та /api/chat має вищий пріоритет, ніж налаштування OLLAMA_KEEP_ALIVE.
Як керувати максимальною кількістю запитів, які сервер Ollama може ставити в чергу?
Якщо на сервер надходить занадто багато запитів, він відповідає помилкою 503, що вказує на перевантаження сервера. Ви можете налаштувати максимальну кількість запитів у черзі, встановивши змінну середовища OLLAMA_MAX_QUEUE.
Як Ollama обробляє одночасні запити?
Ollama підтримує два рівні одночасної обробки. Якщо ваша система має достатньо вільної пам'яті (оперативної пам'яті при інференсі на CPU, або VRAM при інференсі на GPU), одночасно можна завантажити кілька моделей. Для конкретної моделі, якщо під час її завантаження є достатньо вільної пам'яті, вона налаштована на підтримку паралельної обробки запитів.
Якщо вільної пам'яті недостатньо для завантаження нової моделі, поки одна або декілька моделей вже завантажені, усі нові запити будуть поставлені в чергу, доки нову модель не можна буде завантажити. Коли попередні моделі переходять у режим простою, одна або декілька з них вивантажуються, щоб звільнити місце для нової моделі. Запити в черзі обробляються за порядком надходження. При інференсі на GPU нові моделі повинні повністю поміщатися в VRAM, щоб дозволити одночасне завантаження кількох моделей.
Паралельна обробка запитів для конкретної моделі призводить до збільшення розміру контексту на кількість паралельних запитів. Наприклад, контекст 2К при 4 паралельних запитах дасть контекст 8К і потребує додаткового виділення пам'яті.
Наступні налаштування сервера можна використовувати для корекції обробки одночасних запитів Ollama на більшості платформ:
OLLAMA_MAX_LOADED_MODELS— максимальна кількість моделей, які можна завантажити одночасно, за умови, що вони поміщаються у вільну пам'ять. За замовчуванням це 3 помножити на кількість GPU або 3 для інференсу на CPU.OLLAMA_NUM_PARALLEL— максимальна кількість паралельних запитів, які кожна модель обробляє одночасно, за замовчуванням 1. Необхідний обсяг RAM масштабується за формулоюOLLAMA_NUM_PARALLEL*OLLAMA_CONTEXT_LENGTH.OLLAMA_MAX_QUEUE— максимальна кількість запитів, які Ollama ставить в чергу під час навантаження перед відмовою в обробці додаткових запитів. За замовчуванням 512
Примітка: На Windows з графічними картами Radeon за замовчуванням зараз дозволено завантаження не більше 1 моделі через обмеження ROCm v5.7 у звітуванні про доступний обсяг VRAM. Після виходу ROCm v6.2 на Windows з Radeon будуть діюти стандартні налаштування, згадані вище. Ви можете увімкнути одночасне завантаження кількох моделей на Radeon у Windows, але переконайтеся, що не завантажуєте більше моделей, ніж поміщається в VRAM вашої графічної карти.
Як Ollama завантажує моделі на кілька графічних карт (GPU)?
Під час завантаження нової моделі Ollama порівнює необхідний для неї обсяг VRAM з поточним доступним обсягом. Якщо модель повністю поміщається на будь-яку окрему графічну карту, Ollama завантажує її саме на цю карту. Зазвичай це забезпечує найкращу продуктивність, оскільки зменшує обсяг даних, що передаються через шину PCI під час інференсу. Якщо модель не поміщається повністю на одну графічну карту, вона розподіляється між усіма доступними GPU.
Як увімкнути Flash Attention?
Flash Attention — це функція більшості сучасних моделей, яка дозволяє значно зменшити використання пам'яті при зростанні розміру контексту. Ollama використовує Flash Attention автоматично, якщо вибраний бекенд та пристрої підтримують його. Щоб примусово увімкнути Flash Attention, встановіть змінну середовища OLLAMA_FLASH_ATTENTION=1 при запуску сервера Ollama. Щоб вимкнути його, встановіть OLLAMA_FLASH_ATTENTION=0.
Як задати тип квантування для кешу K/V?
Кеш контексту K/V можна квантувати, щоб значно зменшити використання пам'яті, коли увімкнено Flash Attention.
Щоб використовувати квантований кеш K/V з Ollama, ви можете задати наступну змінну середовища:
OLLAMA_KV_CACHE_TYPE— тип квантування для кешу K/V. За замовчуванням використовуєтьсяf16.
Примітка
Наразі це глобальна опція — це означає, що всі моделі будуть запускатися з вказаним типом квантування.
Наразі доступні такі типи квантування кешу K/V:
f16— висока точність та використання пам'яті (за замовчуванням).q8_0— 8-бітове квантування, використовує приблизно вдвічі менше пам'яті, ніжf16, з дуже малою втратою точності; зазвичай це не має помітного впливу на якість моделі (рекомендується, якщо не використовується f16).q4_0— 4-бітове квантування, використовує приблизно вчетверте менше пам'яті, ніжf16, з невеликою-середньою втратою точності, яка може бути помітнішою при більших розмірах контексту.
Ступінь впливу квантування кешу на якість відповідей моделі залежить від самої моделі та завдання. Моделі з високим показником GQA (наприклад, Qwen2) можуть мати більший вплив квантування на точність, ніж моделі з низьким показником GQA.
Вам може знадобитися експериментувати з різними типами квантування, щоб знайти оптимальний баланс між використанням пам'яті та якістю.
Де можна знайти мій публічний ключ Ollama?
Ваш публічний ключ Ollama — це публічна частина пари ключів, яка дозволяє вашому локальному екземпляру Ollama спілкуватися з ollama.com.
Він вам знадобиться для:
- Надсилання моделей на Ollama
- Завантаження приватних моделей з Ollama на ваш комп'ютер
- Запуску моделей, розміщених у Ollama Cloud
Як додати ключ
Увійти через сторінку налаштувань у додатках для Mac та Windows
Увійти через CLI
shell
ollama signin- Вручну скопіювати та вставити ключ на сторінці Ключі Ollama: https://ollama.com/settings/keys
Де зберігається публічний ключ Ollama
| ОС | Шлях до id_ed25519.pub |
|---|---|
| macOS | ~/.ollama/id_ed25519.pub |
| Linux | /usr/share/ollama/.ollama/id_ed25519.pub |
| Windows | C:\Users\<username>\.ollama\id_ed25519.pub |
Примітка
Замініть <username> на ваше реальне ім'я користувача Windows.
Як заблокувати автоматичний запуск Ollama при вході в систему?
Ollama для Windows та macOS реєструється як елемент автозапуску під час установки. Ви можете вимкнути цю опцію, якщо не хочете, щоб Ollama запускався автоматично. Ollama зберігатиме цю налаштування при оновленнях, якщо ви не видалите додаток.
Windows
- У
Диспетчері завданьперейдіть на вкладкуАвтозапуск програм, знайдітьollama, потім натиснітьВимкнути
macOS
- Відкрийте
Налаштування, введіть в пошуковий рядок «Елементи автозапуску», знайдіть записOllamaу розділіДозволити в фоновому режимі, потім перемкніть перемикач, щоб вимкнути його.