Inhoudsopgave
- Een Safetensors-adapter importeren
- Een Safetensors-model importeren
- Een GGUF-bestand importeren
- Modellen delen op ollama.com
Een fine-getuned adapter uit Safetensors-gewichten importeren
Maak eerst een Modelfile met een FROM-commando dat verwijst naar het basismodel dat je hebt gebruikt voor fine-tuning, en een ADAPTER-commando dat verwijst naar de map met je Safetensors-adapter:
dockerfile
FROM <base model name>
ADAPTER /path/to/safetensors/adapter/directoryZorg ervoor dat je hetzelfde basismodel gebruikt in het FROM-commando als dat je hebt gebruikt om de adapter te maken, anders krijg je onvoorspelbare resultaten. De meeste frameworks gebruiken verschillende kwantiseringsmethoden, dus het is het beste om niet-gekwantiseerde (d.w.z. non-QLoRA) adapters te gebruiken. Als je adapter zich in dezelfde map bevindt als je Modelfile, gebruik dan ADAPTER . om het adapterpad op te geven.
Voer nu ollama create uit in de map waar de Modelfile is gemaakt:
shell
ollama create my-modelTest ten slotte het model:
shell
ollama run my-modelOllama ondersteunt het importeren van adapters gebaseerd op verschillende modelarchitecturen, waaronder:
- Llama (inclusief Llama 2, Llama 3, Llama 3.1 en Llama 3.2);
- Mistral (inclusief Mistral 1, Mistral 2 en Mixtral); en
- Gemma (inclusief Gemma 1 en Gemma 2)
Je kunt de adapter maken met een fine-tuningframework of -tool die adapters in het Safetensors-formaat kan uitvoeren, zoals:
- Hugging Face fine-tuningframework
- Unsloth
- MLX
Een model uit Safetensors-gewichten importeren
Maak eerst een Modelfile met een FROM-commando dat verwijst naar de map met je Safetensors-gewichten:
dockerfile
FROM /path/to/safetensors/directoryAls je de Modelfile in dezelfde map maakt als de gewichten, kun je het commando FROM . gebruiken.
Voer nu het commando ollama create uit in de map waar je de Modelfile hebt gemaakt:
shell
ollama create my-modelTest ten slotte het model:
shell
ollama run my-modelOllama ondersteunt het importeren van modellen voor verschillende architecturen, waaronder:
- Llama (inclusief Llama 2, Llama 3, Llama 3.1 en Llama 3.2);
- Mistral (inclusief Mistral 1, Mistral 2 en Mixtral);
- Gemma (inclusief Gemma 1 en Gemma 2); en
- Phi3
Dit omvat het importeren van basismodellen evenals fine-getunde modellen die zijn gefuseerd met een basismodel.
Een op GGUF gebaseerd model of adapter importeren
Als je een op GGUF gebaseerd model of adapter hebt, is het mogelijk om deze te importeren in Ollama. Je kunt een GGUF-model of -adapter verkrijgen door:
- een Safetensors-model converteren met
convert_hf_to_gguf.pyvan Llama.cpp; - een Safetensors-adapter converteren met
convert_lora_to_gguf.pyvan Llama.cpp; of - een model of adapter downloaden van een plaats zoals HuggingFace
Om een GGUF-model te importeren, maak je een Modelfile met de volgende inhoud:
dockerfile
FROM /path/to/file.ggufVoor een GGUF-adapter maak je de Modelfile met:
dockerfile
FROM <model name>
ADAPTER /path/to/file.ggufBij het importeren van een GGUF-adapter is het belangrijk om hetzelfde basismodel te gebruiken als het basismodel waarmee de adapter is gemaakt. Je kunt gebruiken:
- een model van Ollama
- een GGUF-bestand
- een op Safetensors gebaseerd model
Zodra je je Modelfile hebt gemaakt, gebruik je het commando ollama create om het model te bouwen.
shell
ollama create my-modelEen model kwantiseren
Het kwantiseren van een model stelt je in staat om modellen sneller en met minder geheugengebruik te draaien, maar met een verminderde nauwkeurigheid. Dit maakt het mogelijk om een model te draaien op bescheidener hardware.
Ollama kan FP16- en FP32-gebaseerde modellen kwantiseren naar verschillende kwantiseringsniveaus met de vlag -q/--quantize bij het commando ollama create.
Maak eerst een Modelfile met het FP16- of FP32-gebaseerde model dat je wilt kwantiseren.
dockerfile
FROM /path/to/my/gemma/f16/modelGebruik vervolgens ollama create om het gekwantiseerde model te maken.
shell
$ ollama create --quantize q4_K_M mymodel
transferring model data
quantizing F16 model to Q4_K_M
creating new layer sha256:735e246cc1abfd06e9cdcf95504d6789a6cd1ad7577108a70d9902fef503c1bd
creating new layer sha256:0853f0ad24e5865173bbf9ffcc7b0f5d56b66fd690ab1009867e45e7d2c4db0f
writing manifest
successOndersteunde kwantiseringen
q8_0
K-means kwantiseringen
q4_K_Sq4_K_M
Je model delen op ollama.com
Je kunt elk model dat je hebt gemaakt delen door het te pushen naar ollama.com zodat andere gebruikers het kunnen uitproberen.
Ga eerst met je browser naar de pagina Ollama Sign-Up. Als je al een account hebt, kun je deze stap overslaan.

Het veld Gebruikersnaam wordt gebruikt als onderdeel van de naam van je model (bijv. jmorganca/mymodel), dus zorg ervoor dat je tevreden bent over de gebruikersnaam die je hebt gekozen.
Nu je een account hebt aangemaakt en bent ingelogd, ga je naar de pagina Ollama Sleutelinstellingen.
Volg de instructies op de pagina om te bepalen waar je Ollama Openbare Sleutel staat.

Klik op de knop Voeg Ollama Openbare Sleutel toe, en kopieer en plak de inhoud van je Ollama Openbare Sleutel in het tekstveld.
Om een model te pushen naar ollama.com, zorg er eerst voor dat het correct is genoemd met je gebruikersnaam. Mogelijk moet je het commando ollama cp gebruiken om je model te kopiëren en de juiste naam te geven. Zodra je tevreden bent met de naam van je model, gebruik je het commando ollama push om het naar ollama.com te pushen.
shell
ollama cp mymodel myuser/mymodel
ollama push myuser/mymodelZodra je model is gepusht, kunnen andere gebruikers het ophalen en draaien met het volgende commando:
shell
ollama run myuser/mymodel