Un hacker convierte a Claude con jailbreak en una plataforma de pentesting impulsada por IA

Según los informes, un actor de amenazas de habla rusa conocido como Trim ha convertido los métodos de jailbreak de Claude en una plataforma comercial de pruebas de penetración impulsada por IA llamada AI Pentest Checker.

La plataforma combina modelos de IA de vanguardia con herramientas de ciberseguridad establecidas para automatizar el reconocimiento, el escaneo de vulnerabilidades, el análisis de resultados, los informes de explotación y la creación de informes en PDF. Aunque los profesionales de seguridad legítimos suelen utilizar los escáneres subyacentes, empaquetarlos con IA liberada podría facilitar la operación de los flujos de trabajo ofensivos avanzados.

De acuerdo ainvestigación publicada por Cato Networks, Trim documentó métodos para eludir los controles de seguridad de Claude Opus antes de promocionar la plataforma terminada en un foro sobre cibercrimen en ruso.

Trim pasó de Claude Jailbreaks a una plataforma comercial

Cato Networks dijo que Trim creó una cuenta en el foro el 13 de marzo de 2026. Luego, el actor publicó seis técnicas que supuestamente persuadieron a Claude a responder a solicitudes que normalmente rechazaría.

Casi tres meses después, el 21 de junio, Trim volvió a anunciar AI Pentest Checker. El producto se presentó como una plataforma de seguridad web automatizada capaz de evaluar un objetivo y producir un informe formateado en menos de 10 minutos.

La línea de tiempo muestra qué tan rápido las técnicas de abuso de IA pueden pasar de las discusiones en foros a los servicios empaquetados. En lugar de desarrollar un nuevo modelo, Trim habría utilizado modelos comerciales y abiertos junto con el software de seguridad existente.

Fecha reportadaDesarrollo
13 de marzo de 2026Trim publicó seis técnicas para eludir las salvaguardas de Claude Opus.
21 de junio de 2026Trim promocionó AI Pentest Checker como una plataforma comercial de escaneo automatizado.
21 de julio de 2026Cato Networks publicó su análisis del actor y la plataforma.

Cómo funcionaron los métodos de jailbreak de Claude informados

Las técnicas descritas por Trim se basaron en una manipulación rápida en lugar de explotar una vulnerabilidad de software en Claude o comprometer la infraestructura de Anthropic.

Un método, llamado Context Warming, comenzaba con preguntas profesionales inofensivas destinadas a establecer al usuario como un auditor de seguridad legítimo. La conversación entonces giraría hacia solicitudes que de otro modo el modelo podría clasificar como dañinas.

Otra técnica, llamada Ghost Reset, implicaba abrir una nueva conversación después de un rechazo y enviar una versión suavizada de la solicitud. Trim afirmó que este enfoque tuvo éxito en el 90 por ciento de los intentos, aunque esa cifra provino del actor y no ha recibido validación independiente.

  • Context Warming estableció un escenario de prueba de seguridad aparentemente legítimo.
  • El principio de caja negra pidió al modelo que evaluara la estructura del código sin considerar la intención.
  • Ghost Reset reinició las solicitudes rechazadas en una conversación nueva o reformulada.
  • Model Cascading movió solicitudes entre modelos con diferentes protecciones.
  • Los modelos locales ofrecieron una alternativa cuando los servicios comerciales rechazaron una solicitud.
  • El acceso a la API del mercado gris pasó por alto los canales normales de pago y registro de cuentas.

ElInvestigación Cato CTRLdescubrió que AI Pentest Checker conectó sus componentes de IA a 14 herramientas convencionales de escaneo y reconocimiento.

El conjunto de herramientas informado incluía Nuclei, ffuf, katana, subfinder y Gitleaks. Estas utilidades pueden descubrir dominios y puntos finales, identificar secretos expuestos, probar patrones de vulnerabilidad conocidos y recopilar información sobre sistemas conectados a Internet.

Ninguna de estas herramientas se vuelve maliciosa simplemente porque un operador la usa. Los investigadores de seguridad, los evaluadores de penetración y los defensores confían en ellos para encontrar debilidades antes de que los atacantes puedan explotarlas. El riesgo proviene de cómo la plataforma coordina las herramientas, interpreta su resultado y dirige la actividad futura.

ComponenteRol reportado
Cerrar Trabajo 4.8Revisión y escalamiento de hallazgos clasificados como vulnerabilidades críticas.
GLM-5Generación de informes centrados en la explotación.
NúcleosDetección de vulnerabilidades basada en plantillas.
pufContenido web y descubrimiento de endpoints.
catanaRastreo de sitios web y mapeo de la superficie de ataque.
subbuscadorDescubrimiento de subdominios.
gitleaksDetección de credenciales y secretos expuestos.

Según se informa, Trim utilizó una clave API de Claude del mercado gris

Trim afirmó haber comprado acceso a una clave API de Claude a un revendedor de Telegram por 4 dólares. Las claves del mercado gris pueden provenir de cuentas comprometidas, métodos de pago robados, promociones abusivas o cuentas creadas fuera de los procesos aprobados de un proveedor.

El acceso económico reduce el costo de crear servicios de ataque experimentales. También permite a los operadores reemplazar cuentas cuando los proveedores detectan y suspenden actividades abusivas.

Según se informa, Trim recomendó Kimi AI, GLM-5 y MiniMax 2.5 cuando Claude rechazó las solicitudes. El actor también habló sobre alquilar un servidor de alta memoria para ejecutar un modelo alojado localmente sin las salvaguardias impuestas por un proveedor comercial.

La afirmación rápida filtrada de Fable 5 sigue sin confirmarse

Cato Networks informó que Trim describió el mensaje de escalada de Claude como una versión modificada de una configuración del sistema Fable 5 filtrada. La evidencia pública establece que Trim hizo el reclamo, pero no prueba de forma independiente cómo se obtuvo el mensaje o si coincidía con las instrucciones de producción de Anthropic.

Las indicaciones del sistema contienen instrucciones ocultas que guían el comportamiento de un modelo, definen restricciones y dan forma a cómo evalúa las solicitudes de los usuarios. El acceso a esas instrucciones podría ayudar a un atacante a diseñar indicaciones en torno a reglas conocidas y casos extremos.

Sin embargo, un mensaje filtrado no proporciona acceso a los pesos de los modelos, la infraestructura privada o los sistemas internos de Anthropic. Los proveedores también pueden hacer cumplir las salvaguardias a través de clasificadores, monitoreo de cuentas, capacitación de modelos, controles API y otras capas más allá del aviso del sistema.

La IA se está adentrando cada vez más en los flujos de trabajo de ciberataques

El caso encaja con una tendencia más amplia en la que los ciberdelincuentes utilizan la IA para algo más que escribir correos electrónicos de phishing o producir código básico. Los modelos ahora pueden ayudar a organizar múltiples pasos, evaluar el resultado de la herramienta, elegir acciones de seguimiento y convertir resultados técnicos en informes legibles.

En junio de 2026,Anthropic publicó un análisisde 832 cuentas prohibidas por actividad cibernética maliciosa entre marzo de 2025 y marzo de 2026. La compañía descubrió que los atacantes utilizaban cada vez más la IA durante las etapas posteriores y más exigentes técnicamente de sus operaciones.

Anthropic dijo que 560 de las cuentas revisadas, o el 67,3 por ciento, utilizaron IA para la preparación relacionada con el malware. También encontró que 54 cuentas usaban IA para ayudar con el movimiento lateral dentro de entornos comprometidos.

  • La IA puede interpretar grandes volúmenes de resultados del escáner.
  • Los modelos pueden priorizar los hallazgos que parezcan más valiosos.
  • Los sistemas agentes pueden conectar etapas separadas de una operación.
  • Los informes automatizados pueden hacer que los servicios criminales sean más fáciles de vender.
  • Los modelos alternativos pueden mantener los flujos de trabajo en funcionamiento después de un rechazo.

Los andamios de IA pueden reducir la importancia de la habilidad del operador

La creciente preocupación tiene que ver con la arquitectura construida alrededor de un modelo de IA, no solo con la capacidad del modelo para responder a un mensaje dañino. Una plataforma puede proporcionar herramientas, almacenar contexto, ejecutar comandos, revisar resultados y decidir qué paso se debe ejecutar a continuación.

antrópicoinvestigación de amenazas cibernéticasdescubrió que los actores menos capacitados en su conjunto de datos utilizaban alrededor de 16 técnicas de ataque distintas en promedio, en comparación con aproximadamente 20 para el grupo más capacitado. La diferencia cada vez menor sugiere que la asistencia de la IA puede ayudar a los operadores inexpertos a realizar una gama más amplia de tareas.

La compañía también dijo que los actores de mayor riesgo crean cada vez más andamios que permiten a los modelos encadenar varias etapas de ataque con participación humana limitada. AI Pentest Checker parece seguir ese patrón general al conectar escáneres, análisis de modelos y generación de informes en un solo flujo de trabajo.

Anthropic ya ha interrumpido el uso malicioso de Claude

Anthropic ha documentado casos en los que los actores de amenazas hicieron un uso indebido de Claude para tareas de reconocimiento, desarrollo de malware, análisis de datos, robo de credenciales y relacionadas con la extorsión.

En un anteriorinforme de inteligencia de amenazas, Anthropic describió las medidas que tomó para identificar cuentas abusivas, prohibir operadores, mejorar clasificadores y compartir indicadores con socios relevantes.

Esas medidas coercitivas pueden perturbar la actividad en los servicios oficiales. Sin embargo, los delincuentes pueden responder rotando cuentas, comprando acceso API no autorizado, cambiando de proveedor o ejecutando modelos menos restringidos localmente.

Qué deberían hacer las organizaciones ante los ataques asistidos por IA

Las organizaciones no pueden evitar que los delincuentes experimenten con la IA, pero pueden reducir la cantidad de debilidades que las herramientas automatizadas pueden encontrar y explotar.

Los equipos de seguridad deben inventariar continuamente los activos conectados a Internet, eliminar servicios olvidados, parchear vulnerabilidades conocidas y probar aplicaciones accesibles externamente. Las credenciales y los secretos expuestos también requieren una rotación rápida.

Las empresas deben tratar la actividad de escaneo inusual, los intentos repetidos de autenticación, el descubrimiento automatizado de terminales y las pruebas de gran volumen como posibles signos de reconocimiento asistido por IA.

  1. Mantenga un inventario actualizado de dominios públicos, aplicaciones, API y activos en la nube.
  2. Parchear los sistemas conectados a Internet según la explotabilidad y la exposición.
  3. Exija autenticación multifactor resistente al phishing para cuentas privilegiadas.
  4. Elimine los secretos de los repositorios públicos y rote las credenciales expuestas de inmediato.
  5. Limite la velocidad de los puntos finales sensibles y supervise las solicitudes automatizadas anormales.
  6. Revise las claves API para detectar ubicaciones, volúmenes y patrones de uso inusuales.
  7. Pruebe los planes de respuesta a incidentes contra ataques más rápidos y parcialmente automatizados.

El caso Trim no muestra que la IA haya reemplazado a los atacantes experimentados. Muestra que los modelos pueden actuar como una capa operativa que conecta herramientas que ya existen.

antrópicoinvestigaciones de mal usoy los hallazgos de Cato indican que los defensores deben planificar para los atacantes que puedan investigar, escanear, interpretar y documentar vulnerabilidades potenciales más rápidamente que antes.

Reducir los servicios expuestos, corregir las debilidades conocidas, proteger las credenciales y detectar el reconocimiento automatizado siguen siendo las formas más directas de limitar el valor de plataformas como AI Pentest Checker.

Preguntas frecuentes

¿Qué es AI Pentest Checker?

AI Pentest Checker es una plataforma automatizada de escaneo de vulnerabilidades web promovida por un actor de amenazas de habla rusa conocido como Trim. Combina modelos de IA con herramientas convencionales de reconocimiento y pruebas de seguridad.

¿Trim hackeó a Anthropic o a Claude?

Los métodos informados no explotaron la infraestructura de Anthropic ni los pesos del modelo de Claude. Trim supuestamente utilizó indicaciones diseñadas, modelos alternativos, sistemas locales y una clave API del mercado gris para evitar los controles de seguridad.

¿Qué herramientas utiliza AI Pentest Checker?

Cato Networks informó que la plataforma integra 14 herramientas, incluidas Nuclei, ffuf, katana, subfinder y Gitleaks. Estas herramientas admiten escaneo de vulnerabilidades, rastreo, descubrimiento de subdominios, enumeración de puntos finales y detección de secretos.

¿Se confirmó la filtración del mensaje del sistema Fable 5?

Cato Networks informó que Trim afirmó utilizar un mensaje modificado derivado de una configuración filtrada de Fable 5. Los informes públicos no han establecido de forma independiente cómo se obtuvo el material o si coincidía con el mensaje de producción activa de Anthropic.

¿Por qué las plataformas de pruebas de penetración impulsadas por IA son un riesgo para la seguridad?

Pueden coordinar herramientas de escaneo, interpretar resultados, priorizar vulnerabilidades y generar informes. Esta automatización puede reducir el tiempo y la experiencia necesarios para realizar tareas de seguridad ofensivas complejas.

¿Cómo pueden las organizaciones defenderse de los ataques asistidos por IA?

Las organizaciones deben reducir su superficie de ataque pública, parchar los sistemas expuestos, utilizar autenticación multifactor resistente al phishing, rotar las credenciales comprometidas, proteger las claves API y monitorear el reconocimiento automatizado y la actividad de escaneo inusual.