La falla crítica de Ollama puede filtrar mensajes, claves API y memoria del servidor de implementaciones de IA expuestas

Una vulnerabilidad crítica de Ollama puede permitir que atacantes no autenticados roben datos confidenciales de servidores de IA expuestos.La falla, rastreada como CVE-2026-7482y apodado Bleeding Llama, afecta a las versiones de Ollama anteriores a la 0.17.1.

Los investigadores de Cyera dijeron que el errorpuede exponer datos de la memoria del proceso de Ollama, incluidas indicaciones del usuario, indicaciones del sistema, variables de entorno, claves API, tokens y otros secretos. El riesgo es mayor para los servidores de Ollama a los que se puede acceder desde Internet sin un firewall, un proxy de autenticación o controles de red estrictos.

El problema es importante porque Ollama se utiliza ampliamente para ejecutar grandes modelos de lenguaje localmente o en una infraestructura autohospedada. En entornos empresariales, esos servidores pueden procesar código fuente, documentos internos, datos de clientes, resultados de herramientas e instrucciones privadas del sistema.

¿Qué es la llama sangrante?

Bleeding Llama es una vulnerabilidad de lectura fuera de límites enCarga del modelo GGUF de Ollamar. Ocurre cuando Ollama procesa un archivo modelo especialmente diseñado con metadatos tensoriales que no coinciden con el tamaño real del archivo.

Cuando el servidor vulnerable maneja ese archivo con formato incorrecto, puede leer más allá del búfer de memoria previsto. Esa memoria puede contener información sensible del mismo proceso de Ollama.

Cyera dijo que los atacantes pueden luego usar la creación de modelos de Ollama y las funciones de inserción para mover el artefacto del modelo generado a un servidor controlado por el atacante, llevando consigo la memoria filtrada.

De un vistazo

Detallelo que significa
CVECVE-2026-7482
ApodoBleeding Llama
Software afectadoOllama antes de la versión 0.17.1
tipo de errorMontón de lecturas fuera de límites en el procesamiento del modelo GGUF
Impacto principalRevelación de memoria del proceso Ollama
Posibles datos filtradosAvisos, avisos del sistema, variables de entorno, claves API, tokens y secretos
Sistemas de mayor riesgoImplementaciones de Ollama accesibles a la red sin autenticación ni fuertes controles de acceso
Versión fija0.17.1 o posterior

Cómo funciona la vulnerabilidad Ollama

Ollama admite archivos GGUF, un formato común utilizado para datos de modelos de IA locales. Estos archivos incluyen metadatos que describen los tensores, incluida su forma y tamaño.

Cyera encontró que Ollama no hizo adecuadamentevalide si los metadatos del tensor coinciden con la cantidad real de datos en el archivo cargado. Un archivo diseñado podría declarar un tensor mucho más grande que el que realmente contenía el archivo.

Durante la conversión del modelo, Ollama podría leer más allá del final del búfer previsto. Los datos adicionales provienen de una memoria dinámica cercana y podrían incluir contenido confidencial de otras interacciones de IA o datos de configuración.

Por qué los datos filtrados pueden ser peligrosos

Los avisos y avisos del sistema pueden incluir lógica empresarial interna, instrucciones privadas, detalles del cliente, mensajes de los empleados o información del producto no publicada. En los flujos de trabajo de codificación, las indicaciones también pueden incluir código fuente, detalles de errores y arquitectura técnica.

Las variables ambientales pueden crear un riesgo aún mayor. A menudo almacenan claves API, tokens de nube, credenciales de bases de datos, secretos de cuentas de servicio y tokens de autenticación utilizados por herramientas conectadas.

El riesgo crece cuandoOllama corre con asistentes de codificación, herramientas de automatización o agentes internos. Las salidas de las herramientas y el contexto privado pueden pasar por el mismo espacio de memoria y convertirse en parte de los datos expuestos.

La exposición depende del acceso a la red.

La documentación oficial de Ollama diceEl servicio se vincula a 127.0.0.1 de forma predeterminada, lo que limita el acceso a la máquina local. Los usuarios pueden cambiar ese comportamiento con la variable de entorno OLLAMA_HOST cuando quieran exponer Ollama en una red.

Esta distinción importa. Una instancia de Ollama solo local tiene una superficie de ataque más pequeña, mientras que un servidor expuesto a Internet o a una red interna sin controles de acceso enfrenta un riesgo mucho mayor.

Los investigadores de seguridad informaron que es posible acceder en línea a cientos de miles de implementaciones de Ollama. Las organizaciones no deben asumir que sus servidores de IA permanecen privados a menos que hayan verificado directamente la exposición de la red.

¿Quién debería responder primero?

  • Equipos que ejecutan Ollama en servidores con acceso a Internet
  • Organizaciones que utilizan Ollama detrás de servidores proxy débiles o no autenticados
  • Desarrolladores exponiendo a Ollama con OLLAMA_HOST=0.0.0.0
  • Empresas que utilizan Ollama con asistentes de codificación o agentes de IA
  • Equipos que pasan secretos, código fuente o datos de clientes a través de modelos de IA locales.
  • Equipos de seguridad que gestionan la infraestructura de IA en entornos de nube o contenedores.

¿Qué deberían hacer las organizaciones ahora?

Las organizaciones deben actualizar Ollama inmediatamente a la versión 0.17.1 o posterior. Dado que las versiones más recientes de Ollama ya están disponibles, el método más seguro es instalar la última versión estable en lugar de detenerse en la versión fija mínima.

Los equipos también deben eliminar la exposición directa a Internet. Ollama debe estar detrás de un firewall, VPN, red privada, proxy de autenticación u otra capa de control de acceso.

Cualquier implementación expuesta debe pasar por una revisión de incidentes. Los equipos de seguridad deben verificar los registros de acceso, buscar creación de modelos inusuales o actividad push, y rotar secretos que puedan haber existido en variables o indicaciones de entorno.

  • Actualice Ollama a la última versión estable.
  • Confirme que todas las implementaciones ejecuten la versión 0.17.1 o posterior.
  • Compruebe si se puede acceder al puerto 11434 desde Internet.
  • Elimine el acceso público a menos que exista una gran necesidad comercial.
  • Coloque a Ollama detrás de los controles de autenticación y red.
  • Restrinja el acceso a usuarios, hosts y servicios internos de confianza.
  • Revise los registros para detectar la creación de modelos sospechosos y la actividad push.
  • Rote las claves, tokens y secretos de API que puedan haberse cargado en el proceso de Ollama.
  • Revise las indicaciones y los resultados de las herramientas para la exposición de datos confidenciales.
  • Evite colocar secretos de larga duración en variables de entorno disponibles para los servicios de IA.

Por qué la infraestructura de IA necesita un seguimiento más estrecho

Bleeding Llama muestra cómo la infraestructura de IA puede convertirse en una fuente de datos confidenciales incluso cuando no almacena una base de datos tradicional. El tiempo de ejecución del modelo aún puede procesar mensajes, secretos, valores de configuración y respuestas de herramientas en la memoria.

Eso hace que los servidores de IA sean objetivos atractivos. Los atacantes no siempre necesitan comprometer la base de datos de la aplicación si pueden extraer secretos y contexto empresarial de la capa de inferencia.

Los equipos de seguridad deberían tratar los sistemas de IA locales como infraestructura de producción. Necesitan parches, control de acceso, registros, segmentación de red y reglas de gestión de secretos, al igual que las aplicaciones web, las API y los sistemas de compilación.

Preguntas frecuentes

¿Qué es CVE-2026-7482?

CVE-2026-7482 es una vulnerabilidad crítica de lectura fuera de límites del montón en el cargador de modelos GGUF de Ollama. Puede exponer memoria sensible del proceso Ollama.

¿Qué es la llama sangrante?

Bleeding Llama es el apodo que Cyera le dio a CVE-2026-7482. El nombre se refiere a la capacidad de la vulnerabilidad de perder memoria de las implementaciones de Ollama.

¿Qué datos pueden robar los atacantes?

Los atacantes pueden acceder a mensajes, mensajes del sistema, variables de entorno, claves API, tokens, secretos y otros datos presentes en la memoria del proceso de Ollama.

¿Qué versiones de Ollama se ven afectadas?

Las versiones de Ollama anteriores a la 0.17.1 se ven afectadas. Las organizaciones deben actualizar a 0.17.1 o posterior, preferiblemente la última versión estable.