Come posso aggiornare Ollama?
Ollama su macOS e Windows scarica automaticamente gli aggiornamenti. Fai clic sull'elemento della barra delle applicazioni o della barra dei menu, quindi fai clic su "Riavvia per aggiornare" per applicare l'aggiornamento. Gli aggiornamenti possono anche essere installati scaricando l'ultima versione manualmente.
Su Linux, esegui nuovamente lo script di installazione:
shell
curl -fsSL https://ollama.com/install.sh | shCome posso visualizzare i log?
Consulta la documentazione Risoluzione dei problemi per ulteriori informazioni sull'utilizzo dei log.
La mia GPU è compatibile con Ollama?
Consulta la documentazione sulle GPU.
Come posso specificare la dimensione della finestra di contesto?
Per impostazione predefinita, Ollama utilizza una dimensione della finestra di contesto di 4096 token.
Questa impostazione può essere sovrascritta tramite la variabile d'ambiente OLLAMA_CONTEXT_LENGTH. Ad esempio, per impostare la finestra di contesto predefinita a 8K, utilizza:
shell
OLLAMA_CONTEXT_LENGTH=8192 ollama servePer modificare questa impostazione quando utilizzi ollama run, usa /set parameter:
shell
/set parameter num_ctx 4096Quando utilizzi l'API, specifica il parametro num_ctx:
shell
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Why is the sky blue?",
"options": {
"num_ctx": 4096
}
}'Come posso verificare se il mio modello è stato caricato sulla GPU?
Utilizza il comando ollama ps per vedere quali modelli sono attualmente caricati in memoria.
shell
ollama psINFO
Output:
NAME ID SIZE PROCESSOR UNTIL
llama3:70b bcfb190ca3a7 42 GB 100% GPU 4 minutes from nowLa colonna Processor indica in quale memoria è stato caricato il modello:
100% GPUindica che il modello è stato caricato interamente sulla GPU100% CPUindica che il modello è stato caricato interamente nella memoria di sistema48%/52% CPU/GPUindica che il modello è stato caricato parzialmente sia sulla GPU che nella memoria di sistema
Come posso configurare il server Ollama?
Il server Ollama può essere configurato tramite variabili d'ambiente.
Impostazione delle variabili d'ambiente su Mac
Se Ollama viene eseguito come applicazione macOS, le variabili d'ambiente devono essere impostate utilizzando launchctl:
Per ogni variabile d'ambiente, esegui
launchctl setenv.bashlaunchctl setenv OLLAMA_HOST "0.0.0.0:11434"Riavvia l'applicazione Ollama.
Impostazione delle variabili d'ambiente su Linux
Se Ollama viene eseguito come servizio systemd, le variabili d'ambiente devono essere impostate utilizzando systemctl:
Modifica il servizio systemd eseguendo
systemctl edit ollama.service. Verrà aperto un editor.Per ogni variabile d'ambiente, aggiungi una riga
Environmentnella sezione[Service]:ini[Service] Environment="OLLAMA_HOST=0.0.0.0:11434"Salva ed esci.
Ricarica
systemde riavvia Ollama:shellsystemctl daemon-reload systemctl restart ollama
Impostazione delle variabili d'ambiente su Windows
Su Windows, Ollama eredita le variabili d'ambiente dell'utente e di sistema.
Chiudi prima Ollama facendo clic sulla sua icona nella barra delle applicazioni.
Apri l'app Impostazioni (Windows 11) o il Pannello di controllo (Windows 10) e cerca variabili d'ambiente.
Fai clic su Modifica le variabili d'ambiente per il tuo account.
Modifica o crea una nuova variabile per il tuo account utente per
OLLAMA_HOST,OLLAMA_MODELS, ecc.Fai clic su OK/Applica per salvare.
Avvia l'applicazione Ollama dal menu Start di Windows.
Come posso utilizzare Ollama dietro a un proxy?
Ollama scarica i modelli da Internet e potrebbe richiedere un server proxy per accedervi. Utilizza HTTPS_PROXY per reindirizzare le richieste in uscita attraverso il proxy. Assicurati che il certificato del proxy sia installato come certificato di sistema. Consulta la sezione precedente per informazioni su come impostare le variabili d'ambiente sulla tua piattaforma.
Note
Evita di impostare HTTP_PROXY. Ollama non utilizza HTTP per il download dei modelli, solo HTTPS. L'impostazione di HTTP_PROXY potrebbe interrompere le connessioni dei client al server.
Come posso utilizzare Ollama dietro a un proxy in Docker?
L'immagine del container Docker di Ollama può essere configurata per utilizzare un proxy passando -e HTTPS_PROXY=https://proxy.example.com all'avvio del container.
In alternativa, il demone Docker può essere configurato per utilizzare un proxy. Le istruzioni sono disponibili per Docker Desktop su macOS, Windows e Linux, e per il demone Docker con systemd.
Assicurati che il certificato sia installato come certificato di sistema quando utilizzi HTTPS. Potrebbe essere necessario creare una nuova immagine Docker quando si utilizza un certificato autofirmato.
dockerfile
FROM ollama/ollama
COPY my-ca.pem /usr/local/share/ca-certificates/my-ca.crt
RUN update-ca-certificatesCrea ed esegui questa immagine:
shell
docker build -t ollama-with-ca .
docker run -d -e HTTPS_PROXY=https://my.proxy.example.com -p 11434:11434 ollama-with-caOllama invia i miei prompt e le mie risposte a ollama.com?
Ollama viene eseguito localmente. Non vediamo i tuoi prompt o i tuoi dati quando lo esegui in locale. Quando utilizzi modelli ospitati nel cloud, elaboriamo i tuoi prompt e le tue risposte per fornire il servizio, ma non archiviamo o registriamo tali contenuti e non li utilizziamo mai per l'addestramento. Raccogliamo informazioni di base sull'account e metadati di utilizzo limitati per fornire il servizio, che non includono il contenuto di prompt o risposte. Non vendiamo i tuoi dati. Puoi eliminare il tuo account in qualsiasi momento.
Come posso disabilitare le funzionalità cloud di Ollama?
Ollama può essere eseguito in modalità solo locale disabilitando le sue funzionalità cloud. Disattivando le funzionalità cloud di Ollama, perderai la possibilità di utilizzare i modelli cloud di Ollama e la ricerca web.
Imposta disable_ollama_cloud nel file ~/.ollama/server.json:
json
{
"disable_ollama_cloud": true
}Puoi anche impostare la variabile d'ambiente:
shell
OLLAMA_NO_CLOUD=1Riavvia Ollama dopo aver modificato la configurazione. Una volta disabilitate, i log di Ollama mostreranno Ollama cloud disabled: true.
Come posso esporre Ollama sulla mia rete?
Per impostazione predefinita, Ollama è associato all'indirizzo 127.0.0.1 sulla porta 11434. Modifica l'indirizzo di associazione tramite la variabile d'ambiente OLLAMA_HOST.
Consulta la sezione precedente per informazioni su come impostare le variabili d'ambiente sulla tua piattaforma.
Come posso utilizzare Ollama con un server proxy?
Ollama esegue un server HTTP e può essere esposto utilizzando un server proxy come Nginx. Per farlo, configura il proxy per inoltrare le richieste e, se necessario, imposta le intestazioni richieste (se non esponi Ollama sulla rete). Ad esempio, con Nginx:
nginx
server {
listen 80;
server_name example.com; # Replace with your domain or IP
location / {
proxy_pass http://localhost:11434;
proxy_set_header Host localhost:11434;
}
}Come posso utilizzare Ollama con ngrok?
Ollama può essere accessibile utilizzando diverse app di tunneling. Ad esempio con Ngrok:
shell
ngrok http 11434 --host-header="localhost:11434"Come posso utilizzare Ollama con Cloudflare Tunnel?
Per utilizzare Ollama con Cloudflare Tunnel, usa i flag --url e --http-host-header:
shell
cloudflared tunnel --url http://localhost:11434 --http-host-header="localhost:11434"Come posso consentire a origini web aggiuntive di accedere a Ollama?
Per impostazione predefinita, Ollama consente richieste cross-origin da 127.0.0.1 e 0.0.0.0. È possibile configurare origini aggiuntive tramite OLLAMA_ORIGINS.
Per le estensioni del browser, è necessario consentire esplicitamente il pattern di origine dell'estensione. Imposta OLLAMA_ORIGINS in modo che includa chrome-extension://*, moz-extension://* e safari-web-extension://* se desideri consentire l'accesso a tutte le estensioni del browser, o estensioni specifiche secondo necessità:
# Consenti a tutte le estensioni di Chrome, Firefox e Safari
OLLAMA_ORIGINS=chrome-extension://*,moz-extension://*,safari-web-extension://* ollama serveConsulta la sezione precedente per informazioni su come impostare le variabili d'ambiente sulla tua piattaforma.
Dove sono archiviati i modelli?
- macOS:
~/.ollama/models - Linux:
/usr/share/ollama/.ollama/models - Windows:
C:\Users\%username%\.ollama\models
Come posso modificarne la posizione?
Se è necessario utilizzare una directory diversa, imposta la variabile d'ambiente OLLAMA_MODELS sulla directory scelta.
Note
Su Linux, utilizzando l'installer standard, l'utente ollama necessita dei permessi di lettura e scrittura sulla directory specificata. Per assegnare la directory all'utente ollama, esegui sudo chown -R ollama:ollama <directory>.
Consulta la sezione precedente per informazioni su come impostare le variabili d'ambiente sulla tua piattaforma.
Come posso utilizzare Ollama in Visual Studio Code?
Esiste già una vasta raccolta di plugin disponibili per VS Code e altri editor che sfruttano Ollama. Consulta l'elenco di estensioni e plugin nella parte inferiore del file readme del repository principale.
Come posso utilizzare Ollama con l'accelerazione GPU in Docker?
Il container Docker di Ollama può essere configurato con l'accelerazione GPU su Linux o Windows (con WSL2). È richiesto il nvidia-container-toolkit. Consulta ollama/ollama per ulteriori dettagli.
L'accelerazione GPU non è disponibile per Docker Desktop su macOS a causa della mancanza di passthrough ed emulazione GPU.
Perché la rete è lenta in WSL2 su Windows 10?
Questo può influire sia sull'installazione di Ollama che sul download dei modelli.
Apri Pannello di controllo > Rete e Internet > Visualizza lo stato della rete e le attività e fai clic su Modifica impostazioni scheda nel pannello di sinistra. Individua l'adattatore vEthernet (WSL), fai clic con il tasto destro e seleziona Proprietà. Fai clic su Configura e apri la scheda Avanzate. Cerca tra tutte le proprietà fino a trovare Large Send Offload Version 2 (IPv4) e Large Send Offload Version 2 (IPv6). Disabilita entrambe queste proprietà.
Come posso precaricare un modello in Ollama per ottenere tempi di risposta più veloci?
Se stai utilizzando l'API, puoi precaricare un modello inviando al server Ollama una richiesta vuota. Questo funziona con entrambi gli endpoint API /api/generate e /api/chat.
Per precaricare il modello mistral utilizzando l'endpoint generate, usa:
shell
curl http://localhost:11434/api/generate -d '{"model": "mistral"}'Per utilizzare l'endpoint di completamento chat, usa:
shell
curl http://localhost:11434/api/chat -d '{"model": "mistral"}'Per precaricare un modello utilizzando la CLI, usa il comando:
shell
ollama run llama3.2 ""Come posso mantenere un modello caricato in memoria o scaricarlo immediatamente?
Per impostazione predefinita, i modelli vengono mantenuti in memoria per 5 minuti prima di essere scaricati. Questo consente di ottenere tempi di risposta più veloci se stai effettuando numerose richieste all'LLM. Se desideri scaricare immediatamente un modello dalla memoria, utilizza il comando ollama stop:
shell
ollama stop llama3.2Se stai utilizzando l'API, usa il parametro keep_alive con gli endpoint /api/generate e /api/chat per impostare la durata di permanenza di un modello in memoria. Il parametro keep_alive può essere impostato su:
- una stringa di durata (ad esempio "10m" o "24h")
- un numero in secondi (ad esempio 3600)
- qualsiasi numero negativo, che manterrà il modello caricato in memoria (ad esempio -1 o "-1m")
- '0', che scaricherà il modello immediatamente dopo aver generato una risposta
Ad esempio, per precaricare un modello e mantenerlo in memoria, usa:
shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": -1}'Per scaricare il modello e liberare memoria, usa:
shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": 0}'In alternativa, puoi modificare la durata di caricamento in memoria di tutti i modelli impostando la variabile d'ambiente OLLAMA_KEEP_ALIVE all'avvio del server Ollama. La variabile OLLAMA_KEEP_ALIVE utilizza gli stessi tipi di parametri del parametro keep_alive menzionati in precedenza. Consulta la sezione che spiega come configurare il server Ollama per impostare correttamente la variabile d'ambiente.
Il parametro API keep_alive con gli endpoint /api/generate e /api/chat sovrascriverà l'impostazione OLLAMA_KEEP_ALIVE.
Come posso gestire il numero massimo di richieste che il server Ollama può mettere in coda?
Se vengono inviate troppe richieste al server, questo risponderà con un errore 503 che indica che il server è sovraccarico. Puoi modificare il numero di richieste che possono essere messe in coda impostando OLLAMA_MAX_QUEUE.
Come gestisce Ollama le richieste concorrenti?
Ollama supporta due livelli di elaborazione concorrente. Se il tuo sistema ha memoria disponibile sufficiente (memoria di sistema quando utilizzi l'inferenza su CPU, o VRAM per l'inferenza su GPU), è possibile caricare più modelli contemporaneamente. Per un determinato modello, se c'è memoria disponibile sufficiente al momento del caricamento, viene configurato per consentire l'elaborazione parallela delle richieste.
Se la memoria disponibile non è sufficiente per caricare un nuovo modello mentre uno o più modelli sono già caricati, tutte le nuove richieste verranno messe in coda fino a quando il nuovo modello non potrà essere caricato. Man mano che i modelli precedenti diventano inattivi, uno o più di essi verranno scaricati per fare spazio al nuovo modello. Le richieste in coda verranno elaborate in ordine. Quando si utilizza l'inferenza su GPU, i nuovi modelli devono poter essere completamente contenuti nella VRAM per consentire il caricamento concorrente di modelli.
L'elaborazione parallela delle richieste per un determinato modello comporta un aumento della dimensione del contesto pari al numero di richieste parallele. Ad esempio, un contesto di 2K con 4 richieste parallele comporterà un contesto di 8K e un'allocazione di memoria aggiuntiva.
Le seguenti impostazioni del server possono essere utilizzate per modificare il modo in cui Ollama gestisce le richieste concorrenti sulla maggior parte delle piattaforme:
OLLAMA_MAX_LOADED_MODELS- Il numero massimo di modelli che possono essere caricati contemporaneamente, a patto che siano contenuti nella memoria disponibile. Il valore predefinito è 3 * il numero di GPU o 3 per l'inferenza su CPU.OLLAMA_NUM_PARALLEL- Il numero massimo di richieste parallele che ogni modello elaborerà contemporaneamente, predefinito 1. La RAM richiesta aumenterà in base aOLLAMA_NUM_PARALLEL*OLLAMA_CONTEXT_LENGTH.OLLAMA_MAX_QUEUE- Il numero massimo di richieste che Ollama metterà in coda quando è occupato prima di rifiutare richieste aggiuntive. Il valore predefinito è 512
Nota: Su Windows con GPU Radeon, il valore predefinito è attualmente 1 modello massimo a causa di limitazioni nella segnalazione della VRAM disponibile in ROCm v5.7. Una volta disponibile ROCm v6.2, le GPU Radeon su Windows seguiranno le impostazioni predefinite indicate sopra. Puoi abilitare il caricamento concorrente di modelli su Radeon in Windows, ma assicurati di non caricare più modelli di quelli che possono essere contenuti nella VRAM della tua GPU.
Come carica Ollama i modelli su più GPU?
Durante il caricamento di un nuovo modello, Ollama valuta la VRAM richiesta per il modello rispetto a quella attualmente disponibile. Se il modello può essere contenuto interamente in una singola GPU, Ollama lo caricherà su quella GPU. Questo di solito garantisce le prestazioni migliori, in quanto riduce la quantità di dati trasferiti attraverso il bus PCI durante l'inferenza. Se il modello non può essere contenuto interamente in una GPU, verrà distribuito su tutte le GPU disponibili.
Come posso abilitare Flash Attention?
Flash Attention è una funzionalità della maggior parte dei modelli moderni che può ridurre significativamente l'utilizzo di memoria all'aumentare della dimensione del contesto. Ollama utilizza Flash Attention automaticamente quando il backend e i dispositivi selezionati lo supportano. Per forzare l'attivazione di Flash Attention, imposta OLLAMA_FLASH_ATTENTION=1 all'avvio del server Ollama. Per disabilitarlo, imposta OLLAMA_FLASH_ATTENTION=0.
Come posso impostare il tipo di quantizzazione per la cache K/V?
La cache del contesto K/V può essere quantizzata per ridurre significativamente l'utilizzo di memoria quando Flash Attention è abilitato.
Per utilizzare la cache K/V quantizzata con Ollama puoi impostare la seguente variabile d'ambiente:
OLLAMA_KV_CACHE_TYPE- Il tipo di quantizzazione per la cache K/V. Il valore predefinito èf16.
Nota
Attualmente questa è un'opzione globale, ovvero tutti i modelli verranno eseguiti con il tipo di quantizzazione specificato.
I tipi di quantizzazione della cache K/V attualmente disponibili sono:
f16- alta precisione e utilizzo di memoria (predefinito).q8_0- quantizzazione a 8 bit, utilizza circa 1/2 della memoria dif16con una perdita di precisione molto piccola, che di solito non ha alcun impatto percettibile sulla qualità del modello (consigliato se non si utilizza f16).q4_0- quantizzazione a 4 bit, utilizza circa 1/4 della memoria dif16con una perdita di precisione da piccola a media che potrebbe essere più percepibile con dimensioni di contesto più elevate.
L'impatto della quantizzazione della cache sulla qualità delle risposte del modello dipende dal modello e dal compito. I modelli con un alto conteggio GQA (ad es. Qwen2) potrebbero subire un impatto maggiore sulla precisione a causa della quantizzazione rispetto ai modelli con un basso conteggio GQA.
Potrebbe essere necessario sperimentare con diversi tipi di quantizzazione per trovare il miglior equilibrio tra utilizzo di memoria e qualità.
Dove posso trovare la mia chiave pubblica Ollama?
La tua chiave pubblica Ollama è la parte pubblica della coppia di chiavi che permette alla tua istanza Ollama locale di comunicare con ollama.com.
Ti servirà per:
- Effettuare il push di modelli su Ollama
- Scaricare modelli privati da Ollama sul tuo computer
- Eseguire modelli ospitati in Ollama Cloud
Come aggiungere la chiave
Accedi tramite la pagina Impostazioni nell'app Mac e Windows
Accedi tramite CLI
shell
ollama signin- Copia e incolla manualmente la chiave nella pagina Chiavi Ollama: https://ollama.com/settings/keys
Dove si trova la chiave pubblica Ollama
| Sistema operativo | Percorso di id_ed25519.pub |
|---|---|
| macOS | ~/.ollama/id_ed25519.pub |
| Linux | /usr/share/ollama/.ollama/id_ed25519.pub |
| Windows | C:\Users\<username>\.ollama\id_ed25519.pub |
Nota
Sostituisci <username> con il tuo nome utente Windows effettivo.
Come posso impedire a Ollama di avviarsi quando accedo al mio computer?
Ollama per Windows e macOS viene registrato come elemento di accesso durante l'installazione. Puoi disabilitare questa opzione se preferisci che Ollama non si avvii automaticamente. Ollama manterrà questa impostazione durante gli aggiornamenti, a meno che non disinstalli l'applicazione.
Windows
- In
Task Managervai alla schedaApp di avvio, cercaollamaquindi fai clic suDisabilita
MacOS
- Apri
Impostazionie cerca "Elementi di accesso", trova la voceOllamasottoConsenti in background, quindi fai clic sul cursore per disabilitarlo.