Зміст
- Імпорт адаптера Safetensors
- Імпорт моделі з вагами Safetensors
- Імпорт моделі або адаптера на основі GGUF
- Спільний доступ до вашої моделі на ollama.com
Імпорт адаптера, навченого за методом донавчання, з вагів Safetensors
Спочатку створіть Modelfile із командою FROM, яка вказує на базову модель, яку ви використовували для донавчання, та командою ADAPTER, яка вказує на каталог із вашим адаптером Safetensors:
dockerfile
FROM <base model name>
ADAPTER /path/to/safetensors/adapter/directoryПереконайтеся, що ви використовуєте ту саму базову модель у команді FROM, що й при створенні адаптера, інакше ви отримаєте непередбачувані результати. Більшість фреймворків використовують різні методи квантування, тому найкраще використовувати неквантовані (тобто non-QLoRA) адаптери. Якщо ваш адаптер знаходиться в одному каталозі з Modelfile, використовуйте ADAPTER ., щоб вказати шлях до адаптера.
Тепер запустіть команду ollama create з каталогу, де було створено Modelfile:
shell
ollama create my-modelНарешті, перевірте роботу моделі:
shell
ollama run my-modelOllama підтримує імпорт адаптерів на основі кількох різних архітектур моделей, зокрема:
- Llama (включно з Llama 2, Llama 3, Llama 3.1 та Llama 3.2);
- Mistral (включно з Mistral 1, Mistral 2 та Mixtral); та
- Gemma (включно з Gemma 1 та Gemma 2)
Ви можете створити адаптер за допомогою фреймворку або інструменту для донавчання, який може експортувати адаптери у форматі Safetensors, наприклад:
- Hugging Face fine tuning framework
- Unsloth
- MLX
Імпорт моделі з вагів Safetensors
Спочатку створіть Modelfile із командою FROM, яка вказує на каталог із вагами Safetensors вашої моделі:
dockerfile
FROM /path/to/safetensors/directoryЯкщо ви створюєте Modelfile в одному каталозі з вагами, ви можете використовувати команду FROM ..
Тепер запустіть команду ollama create з каталогу, де ви створили Modelfile:
shell
ollama create my-modelНарешті, перевірте роботу моделі:
shell
ollama run my-modelOllama підтримує імпорт моделей для кількох різних архітектур, зокрема:
- Llama (включно з Llama 2, Llama 3, Llama 3.1 та Llama 3.2);
- Mistral (включно з Mistral 1, Mistral 2 та Mixtral);
- Gemma (включно з Gemma 1 та Gemma 2); та
- Phi3
Сюди входить імпорт як фундаментальних моделей, так і будь-яких моделей, навчених за методом донавчання, які були злиті з фундаментальною моделлю.
Імпорт моделі або адаптера на основі GGUF
Якщо у вас є модель або адаптер на основі GGUF, ви можете імпортувати його в Ollama. Отримати модель або адаптер GGUF можна таким чином:
- конвертації моделі Safetensors за допомогою
convert_hf_to_gguf.pyз Llama.cpp; - конвертації адаптера Safetensors за допомогою
convert_lora_to_gguf.pyз Llama.cpp; або - завантаженні моделі або адаптера з таких платформ, як HuggingFace
Щоб імпортувати модель GGUF, створіть Modelfile із вмістом:
dockerfile
FROM /path/to/file.ggufДля адаптера GGUF створіть Modelfile із вмістом:
dockerfile
FROM <model name>
ADAPTER /path/to/file.ggufПід час імпорту адаптера GGUF важливо використовувати ту саму базову модель, на якій було створено адаптер. Ви можете використовувати:
- модель з Ollama
- файл GGUF
- модель на основі Safetensors
Після створення Modelfile використовуйте команду ollama create, щоб зібрати модель.
shell
ollama create my-modelКвантування моделі
Квантування моделі дозволяє запускати моделі швидше і з меншим споживанням пам'яті, але з зниженою точністю. Це дозволяє запускати модель на обладнанні з обмеженими ресурсами.
Ollama може квантувати моделі на основі FP16 та FP32 до різних рівнів квантування за допомогою прапорця -q/--quantize у команді ollama create.
Спочатку створіть Modelfile із моделлю на основі FP16 або FP32, яку ви хочете квантувати.
dockerfile
FROM /path/to/my/gemma/f16/modelПотім використовуйте ollama create, щоб створити квантовану модель.
shell
$ ollama create --quantize q4_K_M mymodel
transferring model data
quantizing F16 model to Q4_K_M
creating new layer sha256:735e246cc1abfd06e9cdcf95504d6789a6cd1ad7577108a70d9902fef503c1bd
creating new layer sha256:0853f0ad24e5865173bbf9ffcc7b0f5d56b66fd690ab1009867e45e7d2c4db0f
writing manifest
successПідтримувані рівні квантування
q8_0
Квантування за методом K-means
q4_K_Sq4_K_M
Спільний доступ до вашої моделі на ollama.com
Ви можете поділитися будь-якою створеною вами моделлю, відправивши її на ollama.com, щоб інші користувачі могли з нею ознайомитися.
Спочатку відкрийте в браузері сторінку Реєстрації в Ollama. Якщо у вас вже є обліковий запис, ви можете пропустити цей крок.

Поле Username буде використано як частина імені вашої моделі (наприклад, jmorganca/mymodel), тому переконайтеся, що вам підходить обране вами ім'я користувача.
Після створення облікового запису та входу в систему перейдіть на сторінку Налаштувань ключів Ollama.
Дотримуйтесь вказівок на сторінці, щоб дізнатися, де знаходиться ваш публічний ключ Ollama.

Натисніть кнопку Add Ollama Public Key, потім скопіюйте та вставте вміст вашого публічного ключа Ollama в текстове поле.
Щоб відправити модель на ollama.com, спочатку переконайтеся, що вона має правильну назву з вашим ім'ям користувача. Можливо, вам доведеться використати команду ollama cp, щоб скопіювати модель та дати їй правильну назву. Коли назва моделі вас влаштовує, використовуйте команду ollama push, щоб відправити її на ollama.com.
shell
ollama cp mymodel myuser/mymodel
ollama push myuser/mymodelПісля відправлення моделі інші користувачі можуть завантажити її та запустити за допомогою команди:
shell
ollama run myuser/mymodel