Skip to content

¿Cómo puedo actualizar Ollama?

Ollama en macOS y Windows descargará actualizaciones de forma automática. Haz clic en el elemento de la barra de tareas o de la barra de menús y luego en "Restart to update" para aplicar la actualización. También puedes instalar actualizaciones descargando la versión más reciente manualmente.

En Linux, vuelve a ejecutar el script de instalación:

shell
curl -fsSL https://ollama.com/install.sh | sh

¿Cómo puedo ver los registros?

Consulta la documentación de Solución de problemas para obtener más información sobre el uso de registros.

¿Mi GPU es compatible con Ollama?

Consulta la documentación de GPU.

¿Cómo puedo especificar el tamaño de la ventana de contexto?

De forma predeterminada, Ollama utiliza un tamaño de ventana de contexto de 4096 tokens.

Este valor se puede modificar con la variable de entorno OLLAMA_CONTEXT_LENGTH. Por ejemplo, para establecer la ventana de contexto predeterminada en 8K, usa:

shell
OLLAMA_CONTEXT_LENGTH=8192 ollama serve

Para cambiar este valor al usar ollama run, usa /set parameter:

shell
/set parameter num_ctx 4096

Al usar la API, especifica el parámetro num_ctx:

shell
curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2",
  "prompt": "Why is the sky blue?",
  "options": {
    "num_ctx": 4096
  }
}'

¿Cómo puedo saber si mi modelo se cargó en la GPU?

Usa el comando ollama ps para ver qué modelos están cargados actualmente en la memoria.

shell
ollama ps

INFO

Salida:

NAME        ID            SIZE    PROCESSOR   UNTIL
llama3:70b  bcfb190ca3a7  42 GB   100% GPU    4 minutes from now

La columna Processor mostrará en qué memoria se cargó el modelo:

  • 100% GPU significa que el modelo se cargó completamente en la GPU
  • 100% CPU significa que el modelo se cargó completamente en la memoria del sistema
  • 48%/52% CPU/GPU significa que el modelo se cargó parcialmente tanto en la GPU como en la memoria del sistema

¿Cómo configuro el servidor de Ollama?

El servidor de Ollama se puede configurar mediante variables de entorno.

Configuración de variables de entorno en Mac

Si Ollama se ejecuta como aplicación de macOS, las variables de entorno deben configurarse mediante launchctl:

  1. Para cada variable de entorno, ejecuta launchctl setenv.

    bash
    launchctl setenv OLLAMA_HOST "0.0.0.0:11434"
  2. Reinicia la aplicación de Ollama.

Configuración de variables de entorno en Linux

Si Ollama se ejecuta como servicio systemd, las variables de entorno deben configurarse mediante systemctl:

  1. Edita el servicio systemd ejecutando systemctl edit ollama.service. Esto abrirá un editor.

  2. Para cada variable de entorno, agrega una línea Environment en la sección [Service]:

    ini
    [Service]
    Environment="OLLAMA_HOST=0.0.0.0:11434"
  3. Guarda y sal.

  4. Recarga systemd y reinicia Ollama:

    shell
    systemctl daemon-reload
    systemctl restart ollama

Configuración de variables de entorno en Windows

En Windows, Ollama hereda tus variables de entorno de usuario y del sistema.

  1. Primero cierra Ollama haciendo clic en él en la barra de tareas.

  2. Abre la aplicación Configuración (Windows 11) o Panel de control (Windows 10) y busca variables de entorno.

  3. Haz clic en Editar variables de entorno de tu cuenta.

  4. Edita o crea una nueva variable para tu cuenta de usuario para OLLAMA_HOST, OLLAMA_MODELS, etc.

  5. Haz clic en Aceptar/Aplicar para guardar.

  6. Inicia la aplicación Ollama desde el menú Inicio de Windows.

¿Cómo uso Ollama detrás de un proxy?

Ollama descarga modelos de Internet y puede necesitar un servidor proxy para acceder a ellos. Usa HTTPS_PROXY para redirigir las solicitudes salientes a través del proxy. Asegúrate de que el certificado del proxy esté instalado como certificado del sistema. Consulta la sección anterior para saber cómo configurar variables de entorno en tu plataforma.

Nota

Evita configurar HTTP_PROXY. Ollama no usa HTTP para descargar modelos, solo HTTPS. Configurar HTTP_PROXY puede interrumpir las conexiones de clientes con el servidor.

¿Cómo uso Ollama detrás de un proxy en Docker?

La imagen del contenedor de Docker de Ollama se puede configurar para usar un proxy pasando -e HTTPS_PROXY=https://proxy.example.com al iniciar el contenedor.

Como alternativa, el demonio de Docker se puede configurar para usar un proxy. Hay instrucciones disponibles para Docker Desktop en macOS, Windows y Linux, así como para el demonio de Docker con systemd.

Asegúrate de que el certificado esté instalado como certificado del sistema al usar HTTPS. Esto puede requerir una nueva imagen de Docker si usas un certificado autofirmado.

dockerfile
FROM ollama/ollama
COPY my-ca.pem /usr/local/share/ca-certificates/my-ca.crt
RUN update-ca-certificates

Compila y ejecuta esta imagen:

shell
docker build -t ollama-with-ca .
docker run -d -e HTTPS_PROXY=https://my.proxy.example.com -p 11434:11434 ollama-with-ca

¿Ollama envía mis preguntas y respuestas de vuelta a ollama.com?

Ollama se ejecuta de forma local. No vemos tus preguntas ni tus datos cuando lo ejecutas localmente. Al usar modelos alojados en la nube, procesamos tus preguntas y respuestas para ofrecer el servicio, pero no almacenamos ni registramos ese contenido y nunca lo usamos para entrenamiento. Recopilamos información básica de la cuenta y metadatos de uso limitados para ofrecer el servicio, que no incluyen el contenido de las preguntas ni las respuestas. No vendemos tus datos. Puedes eliminar tu cuenta en cualquier momento.

¿Cómo desactivo las funciones en la nube de Ollama?

Ollama se puede ejecutar en modo solo local desactivando sus funciones en la nube. Al desactivar estas funciones, perderás la capacidad de usar los modelos en la nube de Ollama y la búsqueda web.

Establece disable_ollama_cloud en ~/.ollama/server.json:

json
{
  "disable_ollama_cloud": true
}

También puedes establecer la variable de entorno:

shell
OLLAMA_NO_CLOUD=1

Reinicia Ollama después de modificar la configuración. Una vez desactivado, los registros de Ollama mostrarán Ollama cloud disabled: true.

¿Cómo puedo exponer Ollama en mi red?

Ollama se enlaza a la dirección 127.0.0.1 en el puerto 11434 de forma predeterminada. Cambia la dirección de enlace con la variable de entorno OLLAMA_HOST.

Consulta la sección anterior para saber cómo configurar variables de entorno en tu plataforma.

¿Cómo puedo usar Ollama con un servidor proxy?

Ollama ejecuta un servidor HTTP y se puede exponer mediante un servidor proxy como Nginx. Para ello, configura el proxy para reenviar solicitudes y, opcionalmente, establece las cabeceras requeridas (si no expones Ollama en la red). Por ejemplo, con Nginx:

nginx
server {
    listen 80;
    server_name example.com;  # Replace with your domain or IP
    location / {
        proxy_pass http://localhost:11434;
        proxy_set_header Host localhost:11434;
    }
}

¿Cómo puedo usar Ollama con ngrok?

Se puede acceder a Ollama mediante diversas aplicaciones de tunelización. Por ejemplo, con Ngrok:

shell
ngrok http 11434 --host-header="localhost:11434"

¿Cómo puedo usar Ollama con Cloudflare Tunnel?

Para usar Ollama con Cloudflare Tunnel, usa los parámetros --url y --http-host-header:

shell
cloudflared tunnel --url http://localhost:11434 --http-host-header="localhost:11434"

¿Cómo puedo permitir que orígenes web adicionales accedan a Ollama?

Ollama permite solicitudes de origen cruzado desde 127.0.0.1 y 0.0.0.0 de forma predeterminada. Se pueden configurar orígenes adicionales con OLLAMA_ORIGINS.

Para extensiones de navegador, deberás permitir explícitamente el patrón de origen de la extensión. Establece OLLAMA_ORIGINS para incluir chrome-extension://*, moz-extension://* y safari-web-extension://* si deseas permitir el acceso a todas las extensiones de navegador, o extensiones específicas según sea necesario:

# Allow all Chrome, Firefox, and Safari extensions
OLLAMA_ORIGINS=chrome-extension://*,moz-extension://*,safari-web-extension://* ollama serve

Consulta la sección anterior para saber cómo configurar variables de entorno en tu plataforma.

¿Dónde se almacenan los modelos?

  • macOS: ~/.ollama/models
  • Linux: /usr/share/ollama/.ollama/models
  • Windows: C:\Users\%username%\.ollama\models

¿Cómo puedo cambiar su ubicación?

Si es necesario usar un directorio diferente, establece la variable de entorno OLLAMA_MODELS con la ruta del directorio elegido.

Nota

En Linux, al usar el instalador estándar, el usuario ollama necesita permisos de lectura y escritura en el directorio especificado. Para asignar el directorio al usuario ollama, ejecuta sudo chown -R ollama:ollama <directory>.

Consulta la sección anterior para saber cómo configurar variables de entorno en tu plataforma.

¿Cómo puedo usar Ollama en Visual Studio Code?

Ya existe una gran colección de complementos disponibles para VS Code, así como para otros editores que usan Ollama. Consulta la lista de extensiones y complementos al final del archivo Léame principal del repositorio.

¿Cómo uso Ollama con aceleración de GPU en Docker?

El contenedor de Docker de Ollama se puede configurar con aceleración de GPU en Linux o Windows (con WSL2). Esto requiere el nvidia-container-toolkit. Consulta ollama/ollama para obtener más detalles.

La aceleración de GPU no está disponible para Docker Desktop en macOS debido a la falta de paso de GPU y emulación.

¿Por qué la red es lenta en WSL2 en Windows 10?

Esto puede afectar tanto a la instalación de Ollama como a la descarga de modelos.

Abre Panel de control > Redes e Internet > Ver estado y tareas de red y haz clic en Cambiar configuración del adaptador en el panel izquierdo. Busca el adaptador vEthernet (WSL), haz clic derecho y selecciona Propiedades. Haz clic en Configurar y abre la pestaña Avanzado. Busca en todas las propiedades hasta encontrar Large Send Offload Version 2 (IPv4) y Large Send Offload Version 2 (IPv6). Desactiva ambas propiedades.

¿Cómo puedo precargar un modelo en Ollama para obtener tiempos de respuesta más rápidos?

Si usas la API, puedes precargar un modelo enviando una solicitud vacía al servidor de Ollama. Esto funciona con ambos endpoints de la API /api/generate y /api/chat.

Para precargar el modelo mistral usando el endpoint de generación, usa:

shell
curl http://localhost:11434/api/generate -d '{"model": "mistral"}'

Para usar el endpoint de finalizaciones de chat, usa:

shell
curl http://localhost:11434/api/chat -d '{"model": "mistral"}'

Para precargar un modelo usando la CLI, usa el comando:

shell
ollama run llama3.2 ""

¿Cómo mantengo un modelo cargado en la memoria o lo descargo inmediatamente?

De forma predeterminada, los modelos se mantienen en la memoria durante 5 minutos antes de descargarse. Esto permite tiempos de respuesta más rápidos si realizas numerosas solicitudes al LLM. Si quieres descargar un modelo de la memoria inmediatamente, usa el comando ollama stop:

shell
ollama stop llama3.2

Si usas la API, usa el parámetro keep_alive con los endpoints /api/generate y /api/chat para establecer el tiempo que un modelo permanece en la memoria. El parámetro keep_alive se puede establecer en:

  • una cadena de duración (como "10m" o "24h")
  • un número en segundos (como 3600)
  • cualquier número negativo que mantendrá el modelo cargado en la memoria (por ejemplo, -1 o "-1m")
  • '0' que descargará el modelo inmediatamente después de generar una respuesta

Por ejemplo, para precargar un modelo y dejarlo en la memoria, usa:

shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": -1}'

Para descargar el modelo y liberar memoria, usa:

shell
curl http://localhost:11434/api/generate -d '{"model": "llama3.2", "keep_alive": 0}'

Como alternativa, puedes cambiar el tiempo que todos los modelos permanecen cargados en la memoria estableciendo la variable de entorno OLLAMA_KEEP_ALIVE al iniciar el servidor de Ollama. La variable OLLAMA_KEEP_ALIVE usa los mismos tipos de parámetros que el parámetro keep_alive mencionado anteriormente. Consulta la sección que explica cómo configurar el servidor de Ollama para establecer correctamente la variable de entorno.

El parámetro de API keep_alive con los endpoints /api/generate y /api/chat anulará la configuración de OLLAMA_KEEP_ALIVE.

¿Cómo gestiono el número máximo de solicitudes que el servidor de Ollama puede poner en cola?

Si se envían demasiadas solicitudes al servidor, este responderá con un error 503 indicando que está sobrecargado. Puedes ajustar la cantidad de solicitudes que se pueden poner en cola estableciendo OLLAMA_MAX_QUEUE.

¿Cómo maneja Ollama las solicitudes concurrentes?

Ollama admite dos niveles de procesamiento concurrente. Si tu sistema tiene suficiente memoria disponible (memoria del sistema al usar inferencia por CPU, o VRAM para inferencia por GPU), se pueden cargar varios modelos al mismo tiempo. Para un modelo determinado, si hay suficiente memoria disponible cuando se carga el modelo, se configura para permitir el procesamiento paralelo de solicitudes.

Si no hay suficiente memoria disponible para cargar un nuevo modelo mientras ya hay uno o más modelos cargados, todas las solicitudes nuevas se pondrán en cola hasta que se pueda cargar el nuevo modelo. A medida que los modelos anteriores quedan inactivos, se descargará uno o más para hacer espacio al nuevo modelo. Las solicitudes en cola se procesarán en orden. Al usar inferencia por GPU, los nuevos modelos deben caber completamente en la VRAM para permitir cargas de modelos concurrentes.

El procesamiento paralelo de solicitudes para un modelo determinado aumenta el tamaño del contexto según la cantidad de solicitudes paralelas. Por ejemplo, un contexto de 2K con 4 solicitudes paralelas dará como resultado un contexto de 8K y una asignación de memoria adicional.

Se pueden usar las siguientes configuraciones del servidor para ajustar cómo maneja Ollama las solicitudes concurrentes en la mayoría de las plataformas:

  • OLLAMA_MAX_LOADED_MODELS: la cantidad máxima de modelos que se pueden cargar de forma concurrente, siempre que quepan en la memoria disponible. El valor predeterminado es 3 multiplicado por la cantidad de GPUs, o 3 para inferencia por CPU.
  • OLLAMA_NUM_PARALLEL: la cantidad máxima de solicitudes paralelas que procesará cada modelo al mismo tiempo, el valor predeterminado es 1. La RAM requerida se escalará según OLLAMA_NUM_PARALLEL multiplicado por OLLAMA_CONTEXT_LENGTH.
  • OLLAMA_MAX_QUEUE: la cantidad máxima de solicitudes que Ollama pondrá en cola cuando esté ocupado antes de rechazar solicitudes adicionales. El valor predeterminado es 512

Nota: En Windows con GPUs Radeon, el valor predeterminado actual es un máximo de 1 modelo debido a limitaciones en el informe de VRAM disponible de ROCm v5.7. Una vez que ROCm v6.2 esté disponible, las Radeon en Windows seguirán los valores predeterminados anteriores. Puedes habilitar cargas de modelos concurrentes en Radeon en Windows, pero asegúrate de no cargar más modelos de los que caben en la VRAM de tu GPU.

¿Cómo carga Ollama los modelos en varias GPUs?

Al cargar un modelo nuevo, Ollama evalúa la VRAM requerida para el modelo en comparación con la disponible en ese momento. Si el modelo cabe completamente en una sola GPU, Ollama lo cargará en esa GPU. Esto generalmente proporciona el mejor rendimiento, ya que reduce la cantidad de datos que se transfieren por el bus PCI durante la inferencia. Si el modelo no cabe completamente en una GPU, se distribuirá entre todas las GPUs disponibles.

¿Cómo puedo activar Flash Attention?

Flash Attention es una funcionalidad de la mayoría de los modelos modernos que puede reducir significativamente el uso de memoria a medida que crece el tamaño del contexto. Ollama usa Flash Attention automáticamente cuando el backend y los dispositivos seleccionados lo admiten. Para forzar la activación de Flash Attention, establece la variable OLLAMA_FLASH_ATTENTION=1 al iniciar el servidor de Ollama. Para desactivarlo, establece OLLAMA_FLASH_ATTENTION=0.

¿Cómo puedo establecer el tipo de cuantización para la caché K/V?

La caché de contexto K/V se puede cuantizar para reducir significativamente el uso de memoria cuando Flash Attention está activado.

Para usar la caché K/V cuantizada con Ollama, puedes establecer la siguiente variable de entorno:

  • OLLAMA_KV_CACHE_TYPE: el tipo de cuantización para la caché K/V. El valor predeterminado es f16.

Nota

Actualmente se trata de una opción global, lo que significa que todos los modelos se ejecutarán con el tipo de cuantización especificado.

Los tipos de cuantización de caché K/V disponibles actualmente son:

  • f16: alta precisión y uso de memoria (predeterminado).
  • q8_0: cuantización de 8 bits, usa aproximadamente la mitad de la memoria de f16 con una pérdida de precisión muy pequeña, por lo que generalmente no tiene un impacto notable en la calidad del modelo (recomendado si no usas f16).
  • q4_0: cuantización de 4 bits, usa aproximadamente la cuarta parte de la memoria de f16 con una pérdida de precisión de pequeña a media que puede ser más notable en tamaños de contexto más grandes.

El impacto de la cuantización de la caché en la calidad de las respuestas del modelo dependerá del modelo y de la tarea. Los modelos que tienen un recuento alto de GQA (por ejemplo, Qwen2) pueden sufrir un impacto mayor en la precisión por la cuantización que los modelos con un recuento bajo de GQA.

Es posible que tengas que probar diferentes tipos de cuantización para encontrar el equilibrio óptimo entre uso de memoria y calidad.

¿Dónde puedo encontrar mi clave pública de Ollama?

Tu clave pública de Ollama es la parte pública del par de claves que permite que tu instancia local de Ollama se comunique con ollama.com.

La necesitarás para:

  • Subir modelos a Ollama
  • Descargar modelos privados de Ollama a tu equipo
  • Ejecutar modelos alojados en Ollama Cloud

Cómo agregar la clave

  • Inicia sesión a través de la página de Configuración en la aplicación de Mac y Windows

  • Inicia sesión mediante CLI

shell
ollama signin

Dónde se almacena la clave pública de Ollama

Sistema operativoRuta de id_ed25519.pub
macOS~/.ollama/id_ed25519.pub
Linux/usr/share/ollama/.ollama/id_ed25519.pub
WindowsC:\Users\<username>\.ollama\id_ed25519.pub

Nota

Reemplaza <username> por tu nombre de usuario real de Windows.

¿Cómo puedo evitar que Ollama se inicie al iniciar sesión en mi equipo?

Ollama para Windows y macOS se registra como elemento de inicio de sesión durante la instalación. Puedes desactivar esta opción si prefieres que Ollama no se inicie automáticamente. Ollama mantendrá esta configuración en todas las actualizaciones, a menos que desinstales la aplicación.

Windows

  • En el Administrador de tareas ve a la pestaña Aplicaciones de inicio, busca ollama y luego haz clic en Deshabilitar

MacOS

  • Abre Configuración y busca "Elementos de inicio de sesión", encuentra la entrada de Ollama en Permitir en segundo plano, luego haz clic en el control deslizante para desactivarlo.