Inhaltsverzeichnis
- Importieren eines fein abgestimmten Adapters aus Safetensors-Gewichten
- Importieren eines Modells aus Safetensors-Gewichten
- Importieren einer GGUF-Datei
- Modelle auf ollama.com teilen
Importieren eines fein abgestimmten Adapters aus Safetensors-Gewichten
Erstellen Sie zuerst eine Modelfile mit einem FROM-Befehl, der auf das Basismodell verweist, das Sie für die Feinabstimmung verwendet haben, sowie einem ADAPTER-Befehl, der auf das Verzeichnis mit Ihrem Safetensors-Adapter verweist:
dockerfile
FROM <base model name>
ADAPTER /path/to/safetensors/adapter/directoryStellen Sie sicher, dass Sie im FROM-Befehl das gleiche Basismodell angeben, das Sie zum Erstellen des Adapters verwendet haben, da Sie sonst unvorhersehbare Ergebnisse erhalten. Die meisten Frameworks verwenden unterschiedliche Quantisierungsmethoden, daher ist es am besten, nicht quantisierte (also nicht-QLoRA) Adapter zu verwenden. Wenn sich Ihr Adapter im selben Verzeichnis wie Ihre Modelfile befindet, verwenden Sie ADAPTER ., um den Adapterpfad anzugeben.
Führen Sie nun ollama create aus dem Verzeichnis aus, in dem die Modelfile erstellt wurde:
shell
ollama create my-modelZuletzt testen Sie das Modell:
shell
ollama run my-modelOllama unterstützt das Importieren von Adaptern auf Basis mehrerer unterschiedlicher Modellarchitekturen, darunter:
- Llama (einschließlich Llama 2, Llama 3, Llama 3.1 und Llama 3.2);
- Mistral (einschließlich Mistral 1, Mistral 2 und Mixtral); und
- Gemma (einschließlich Gemma 1 und Gemma 2)
Sie können den Adapter mit einem Feinabstimmungs-Framework oder -Tool erstellen, das Adapter im Safetensors-Format ausgeben kann, wie zum Beispiel:
- Hugging Face Feinabstimmungs-Framework
- Unsloth
- MLX
Importieren eines Modells aus Safetensors-Gewichten
Erstellen Sie zuerst eine Modelfile mit einem FROM-Befehl, der auf das Verzeichnis mit Ihren Safetensors-Gewichten verweist:
dockerfile
FROM /path/to/safetensors/directoryWenn Sie die Modelfile im selben Verzeichnis wie die Gewichte erstellen, können Sie den Befehl FROM . verwenden.
Führen Sie nun den Befehl ollama create aus dem Verzeichnis aus, in dem Sie die Modelfile erstellt haben:
shell
ollama create my-modelZuletzt testen Sie das Modell:
shell
ollama run my-modelOllama unterstützt das Importieren von Modellen für mehrere unterschiedliche Architekturen, darunter:
- Llama (einschließlich Llama 2, Llama 3, Llama 3.1 und Llama 3.2);
- Mistral (einschließlich Mistral 1, Mistral 2 und Mixtral);
- Gemma (einschließlich Gemma 1 und Gemma 2); und
- Phi3
Dazu gehört das Importieren von Basismodellen sowie allen fein abgestimmten Modellen, die mit einem Basismodell fusioniert wurden.
Importieren eines GGUF-basierten Modells oder Adapters
Wenn Sie ein GGUF-basiertes Modell oder einen Adapter haben, können Sie es/es in Ollama importieren. Sie können ein GGUF-Modell oder einen Adapter erhalten durch:
- Konvertieren eines Safetensors-Modells mit dem
convert_hf_to_gguf.pyaus Llama.cpp; - Konvertieren eines Safetensors-Adapters mit dem
convert_lora_to_gguf.pyaus Llama.cpp; oder - Herunterladen eines Modells oder Adapters von einer Quelle wie HuggingFace
Um ein GGUF-Modell zu importieren, erstellen Sie eine Modelfile mit folgendem Inhalt:
dockerfile
FROM /path/to/file.ggufFür einen GGUF-Adapter erstellen Sie die Modelfile mit:
dockerfile
FROM <model name>
ADAPTER /path/to/file.ggufBeim Importieren eines GGUF-Adapters ist es wichtig, das gleiche Basismodell zu verwenden, mit dem der Adapter erstellt wurde. Sie können verwenden:
- ein Modell von Ollama
- eine GGUF-Datei
- ein auf Safetensors basierendes Modell
Sobald Sie Ihre Modelfile erstellt haben, verwenden Sie den Befehl ollama create, um das Modell zu erstellen.
shell
ollama create my-modelQuantisieren eines Modells
Die Quantisierung eines Modells ermöglicht es Ihnen, Modelle schneller und mit geringerem Speicherverbrauch auszuführen, jedoch mit reduzierter Genauigkeit. Dadurch können Sie ein Modell auf weniger leistungsfähiger Hardware ausführen.
Ollama kann auf FP16 und FP32 basierende Modelle mit dem -q/--quantize-Flag im Befehl ollama create in verschiedene Quantisierungsstufen quantisieren.
Erstellen Sie zuerst eine Modelfile mit dem auf FP16 oder FP32 basierenden Modell, das Sie quantisieren möchten.
dockerfile
FROM /path/to/my/gemma/f16/modelVerwenden Sie ollama create, um das quantisierte Modell zu erstellen.
shell
$ ollama create --quantize q4_K_M mymodel
transferring model data
quantizing F16 model to Q4_K_M
creating new layer sha256:735e246cc1abfd06e9cdcf95504d6789a6cd1ad7577108a70d9902fef503c1bd
creating new layer sha256:0853f0ad24e5865173bbf9ffcc7b0f5d56b66fd690ab1009867e45e7d2c4db0f
writing manifest
successUnterstützte Quantisierungen
q8_0
K-Means-Quantisierungen
q4_K_Sq4_K_M
Teilen Ihres Modells auf ollama.com
Sie können jedes von Ihnen erstellte Modell teilen, indem Sie es zu ollama.com pushen, damit andere Benutzer es ausprobieren können.
Gehen Sie zuerst mit Ihrem Browser zur Seite Ollama-Anmeldung. Wenn Sie bereits ein Konto haben, können Sie diesen Schritt überspringen.

Das Feld Benutzername wird als Teil des Namens Ihres Modells verwendet (z. B. jmorganca/mymodel), stellen Sie also sicher, dass Sie mit dem von Ihnen gewählten Benutzernamen zufrieden sind.
Nachdem Sie ein Konto erstellt und angemeldet haben, gehen Sie zur Seite Ollama-Schlüsseleinstellungen.
Befolgen Sie die Anweisungen auf der Seite, um zu ermitteln, wo sich Ihr öffentlicher Ollama-Schlüssel befindet.

Klicken Sie auf die Schaltfläche Öffentlichen Ollama-Schlüssel hinzufügen und kopieren Sie den Inhalt Ihres öffentlichen Ollama-Schlüssels in das Textfeld.
Um ein Modell zu ollama.com zu pushen, stellen Sie zuerst sicher, dass es mit Ihrem Benutzernamen korrekt benannt ist. Möglicherweise müssen Sie den Befehl ollama cp verwenden, um Ihr Modell zu kopieren und ihm den korrekten Namen zu geben. Sobald Sie mit dem Namen Ihres Modells zufrieden sind, verwenden Sie den Befehl ollama push, um es zu ollama.com zu pushen.
shell
ollama cp mymodel myuser/mymodel
ollama push myuser/mymodelSobald Ihr Modell gepusht wurde, können andere Benutzer es mit dem folgenden Befehl pullen und ausführen:
shell
ollama run myuser/mymodel