Skip to content

Inhoudsopgave

Een fine-getuned adapter uit Safetensors-gewichten importeren

Maak eerst een Modelfile met een FROM-commando dat verwijst naar het basismodel dat je hebt gebruikt voor fine-tuning, en een ADAPTER-commando dat verwijst naar de map met je Safetensors-adapter:

dockerfile
FROM <base model name>
ADAPTER /path/to/safetensors/adapter/directory

Zorg ervoor dat je hetzelfde basismodel gebruikt in het FROM-commando als dat je hebt gebruikt om de adapter te maken, anders krijg je onvoorspelbare resultaten. De meeste frameworks gebruiken verschillende kwantiseringsmethoden, dus het is het beste om niet-gekwantiseerde (d.w.z. non-QLoRA) adapters te gebruiken. Als je adapter zich in dezelfde map bevindt als je Modelfile, gebruik dan ADAPTER . om het adapterpad op te geven.

Voer nu ollama create uit in de map waar de Modelfile is gemaakt:

shell
ollama create my-model

Test ten slotte het model:

shell
ollama run my-model

Ollama ondersteunt het importeren van adapters gebaseerd op verschillende modelarchitecturen, waaronder:

  • Llama (inclusief Llama 2, Llama 3, Llama 3.1 en Llama 3.2);
  • Mistral (inclusief Mistral 1, Mistral 2 en Mixtral); en
  • Gemma (inclusief Gemma 1 en Gemma 2)

Je kunt de adapter maken met een fine-tuningframework of -tool die adapters in het Safetensors-formaat kan uitvoeren, zoals:

Een model uit Safetensors-gewichten importeren

Maak eerst een Modelfile met een FROM-commando dat verwijst naar de map met je Safetensors-gewichten:

dockerfile
FROM /path/to/safetensors/directory

Als je de Modelfile in dezelfde map maakt als de gewichten, kun je het commando FROM . gebruiken.

Voer nu het commando ollama create uit in de map waar je de Modelfile hebt gemaakt:

shell
ollama create my-model

Test ten slotte het model:

shell
ollama run my-model

Ollama ondersteunt het importeren van modellen voor verschillende architecturen, waaronder:

  • Llama (inclusief Llama 2, Llama 3, Llama 3.1 en Llama 3.2);
  • Mistral (inclusief Mistral 1, Mistral 2 en Mixtral);
  • Gemma (inclusief Gemma 1 en Gemma 2); en
  • Phi3

Dit omvat het importeren van basismodellen evenals fine-getunde modellen die zijn gefuseerd met een basismodel.

Een op GGUF gebaseerd model of adapter importeren

Als je een op GGUF gebaseerd model of adapter hebt, is het mogelijk om deze te importeren in Ollama. Je kunt een GGUF-model of -adapter verkrijgen door:

  • een Safetensors-model converteren met convert_hf_to_gguf.py van Llama.cpp;
  • een Safetensors-adapter converteren met convert_lora_to_gguf.py van Llama.cpp; of
  • een model of adapter downloaden van een plaats zoals HuggingFace

Om een GGUF-model te importeren, maak je een Modelfile met de volgende inhoud:

dockerfile
FROM /path/to/file.gguf

Voor een GGUF-adapter maak je de Modelfile met:

dockerfile
FROM <model name>
ADAPTER /path/to/file.gguf

Bij het importeren van een GGUF-adapter is het belangrijk om hetzelfde basismodel te gebruiken als het basismodel waarmee de adapter is gemaakt. Je kunt gebruiken:

  • een model van Ollama
  • een GGUF-bestand
  • een op Safetensors gebaseerd model

Zodra je je Modelfile hebt gemaakt, gebruik je het commando ollama create om het model te bouwen.

shell
ollama create my-model

Een model kwantiseren

Het kwantiseren van een model stelt je in staat om modellen sneller en met minder geheugengebruik te draaien, maar met een verminderde nauwkeurigheid. Dit maakt het mogelijk om een model te draaien op bescheidener hardware.

Ollama kan FP16- en FP32-gebaseerde modellen kwantiseren naar verschillende kwantiseringsniveaus met de vlag -q/--quantize bij het commando ollama create.

Maak eerst een Modelfile met het FP16- of FP32-gebaseerde model dat je wilt kwantiseren.

dockerfile
FROM /path/to/my/gemma/f16/model

Gebruik vervolgens ollama create om het gekwantiseerde model te maken.

shell
$ ollama create --quantize q4_K_M mymodel
transferring model data
quantizing F16 model to Q4_K_M
creating new layer sha256:735e246cc1abfd06e9cdcf95504d6789a6cd1ad7577108a70d9902fef503c1bd
creating new layer sha256:0853f0ad24e5865173bbf9ffcc7b0f5d56b66fd690ab1009867e45e7d2c4db0f
writing manifest
success

Ondersteunde kwantiseringen

  • q8_0

K-means kwantiseringen

  • q4_K_S
  • q4_K_M

Je model delen op ollama.com

Je kunt elk model dat je hebt gemaakt delen door het te pushen naar ollama.com zodat andere gebruikers het kunnen uitproberen.

Ga eerst met je browser naar de pagina Ollama Sign-Up. Als je al een account hebt, kun je deze stap overslaan.

Aanmelden

Het veld Gebruikersnaam wordt gebruikt als onderdeel van de naam van je model (bijv. jmorganca/mymodel), dus zorg ervoor dat je tevreden bent over de gebruikersnaam die je hebt gekozen.

Nu je een account hebt aangemaakt en bent ingelogd, ga je naar de pagina Ollama Sleutelinstellingen.

Volg de instructies op de pagina om te bepalen waar je Ollama Openbare Sleutel staat.

Ollama Sleutels

Klik op de knop Voeg Ollama Openbare Sleutel toe, en kopieer en plak de inhoud van je Ollama Openbare Sleutel in het tekstveld.

Om een model te pushen naar ollama.com, zorg er eerst voor dat het correct is genoemd met je gebruikersnaam. Mogelijk moet je het commando ollama cp gebruiken om je model te kopiëren en de juiste naam te geven. Zodra je tevreden bent met de naam van je model, gebruik je het commando ollama push om het naar ollama.com te pushen.

shell
ollama cp mymodel myuser/mymodel
ollama push myuser/mymodel

Zodra je model is gepusht, kunnen andere gebruikers het ophalen en draaien met het volgende commando:

shell
ollama run myuser/mymodel