Skip to content

Зміст

Імпорт адаптера, навченого за методом донавчання, з вагів Safetensors

Спочатку створіть Modelfile із командою FROM, яка вказує на базову модель, яку ви використовували для донавчання, та командою ADAPTER, яка вказує на каталог із вашим адаптером Safetensors:

dockerfile
FROM <base model name>
ADAPTER /path/to/safetensors/adapter/directory

Переконайтеся, що ви використовуєте ту саму базову модель у команді FROM, що й при створенні адаптера, інакше ви отримаєте непередбачувані результати. Більшість фреймворків використовують різні методи квантування, тому найкраще використовувати неквантовані (тобто non-QLoRA) адаптери. Якщо ваш адаптер знаходиться в одному каталозі з Modelfile, використовуйте ADAPTER ., щоб вказати шлях до адаптера.

Тепер запустіть команду ollama create з каталогу, де було створено Modelfile:

shell
ollama create my-model

Нарешті, перевірте роботу моделі:

shell
ollama run my-model

Ollama підтримує імпорт адаптерів на основі кількох різних архітектур моделей, зокрема:

  • Llama (включно з Llama 2, Llama 3, Llama 3.1 та Llama 3.2);
  • Mistral (включно з Mistral 1, Mistral 2 та Mixtral); та
  • Gemma (включно з Gemma 1 та Gemma 2)

Ви можете створити адаптер за допомогою фреймворку або інструменту для донавчання, який може експортувати адаптери у форматі Safetensors, наприклад:

Імпорт моделі з вагів Safetensors

Спочатку створіть Modelfile із командою FROM, яка вказує на каталог із вагами Safetensors вашої моделі:

dockerfile
FROM /path/to/safetensors/directory

Якщо ви створюєте Modelfile в одному каталозі з вагами, ви можете використовувати команду FROM ..

Тепер запустіть команду ollama create з каталогу, де ви створили Modelfile:

shell
ollama create my-model

Нарешті, перевірте роботу моделі:

shell
ollama run my-model

Ollama підтримує імпорт моделей для кількох різних архітектур, зокрема:

  • Llama (включно з Llama 2, Llama 3, Llama 3.1 та Llama 3.2);
  • Mistral (включно з Mistral 1, Mistral 2 та Mixtral);
  • Gemma (включно з Gemma 1 та Gemma 2); та
  • Phi3

Сюди входить імпорт як фундаментальних моделей, так і будь-яких моделей, навчених за методом донавчання, які були злиті з фундаментальною моделлю.

Імпорт моделі або адаптера на основі GGUF

Якщо у вас є модель або адаптер на основі GGUF, ви можете імпортувати його в Ollama. Отримати модель або адаптер GGUF можна таким чином:

  • конвертації моделі Safetensors за допомогою convert_hf_to_gguf.py з Llama.cpp;
  • конвертації адаптера Safetensors за допомогою convert_lora_to_gguf.py з Llama.cpp; або
  • завантаженні моделі або адаптера з таких платформ, як HuggingFace

Щоб імпортувати модель GGUF, створіть Modelfile із вмістом:

dockerfile
FROM /path/to/file.gguf

Для адаптера GGUF створіть Modelfile із вмістом:

dockerfile
FROM <model name>
ADAPTER /path/to/file.gguf

Під час імпорту адаптера GGUF важливо використовувати ту саму базову модель, на якій було створено адаптер. Ви можете використовувати:

  • модель з Ollama
  • файл GGUF
  • модель на основі Safetensors

Після створення Modelfile використовуйте команду ollama create, щоб зібрати модель.

shell
ollama create my-model

Квантування моделі

Квантування моделі дозволяє запускати моделі швидше і з меншим споживанням пам'яті, але з зниженою точністю. Це дозволяє запускати модель на обладнанні з обмеженими ресурсами.

Ollama може квантувати моделі на основі FP16 та FP32 до різних рівнів квантування за допомогою прапорця -q/--quantize у команді ollama create.

Спочатку створіть Modelfile із моделлю на основі FP16 або FP32, яку ви хочете квантувати.

dockerfile
FROM /path/to/my/gemma/f16/model

Потім використовуйте ollama create, щоб створити квантовану модель.

shell
$ ollama create --quantize q4_K_M mymodel
transferring model data
quantizing F16 model to Q4_K_M
creating new layer sha256:735e246cc1abfd06e9cdcf95504d6789a6cd1ad7577108a70d9902fef503c1bd
creating new layer sha256:0853f0ad24e5865173bbf9ffcc7b0f5d56b66fd690ab1009867e45e7d2c4db0f
writing manifest
success

Підтримувані рівні квантування

  • q8_0

Квантування за методом K-means

  • q4_K_S
  • q4_K_M

Спільний доступ до вашої моделі на ollama.com

Ви можете поділитися будь-якою створеною вами моделлю, відправивши її на ollama.com, щоб інші користувачі могли з нею ознайомитися.

Спочатку відкрийте в браузері сторінку Реєстрації в Ollama. Якщо у вас вже є обліковий запис, ви можете пропустити цей крок.

Реєстрація

Поле Username буде використано як частина імені вашої моделі (наприклад, jmorganca/mymodel), тому переконайтеся, що вам підходить обране вами ім'я користувача.

Після створення облікового запису та входу в систему перейдіть на сторінку Налаштувань ключів Ollama.

Дотримуйтесь вказівок на сторінці, щоб дізнатися, де знаходиться ваш публічний ключ Ollama.

Ключі Ollama

Натисніть кнопку Add Ollama Public Key, потім скопіюйте та вставте вміст вашого публічного ключа Ollama в текстове поле.

Щоб відправити модель на ollama.com, спочатку переконайтеся, що вона має правильну назву з вашим ім'ям користувача. Можливо, вам доведеться використати команду ollama cp, щоб скопіювати модель та дати їй правильну назву. Коли назва моделі вас влаштовує, використовуйте команду ollama push, щоб відправити її на ollama.com.

shell
ollama cp mymodel myuser/mymodel
ollama push myuser/mymodel

Після відправлення моделі інші користувачі можуть завантажити її та запустити за допомогою команди:

shell
ollama run myuser/mymodel