Secondo quanto riferito, un attore di minacce di lingua russa noto come Trim ha trasformato i metodi di jailbreak di Claude in una piattaforma commerciale di test di penetrazione basata sull'intelligenza artificiale chiamata AI Pentest Checker.
La piattaforma combina modelli di intelligenza artificiale di frontiera con strumenti consolidati di sicurezza informatica per automatizzare la ricognizione, la scansione delle vulnerabilità, l’analisi dei risultati, il reporting sullo sfruttamento e la creazione di report PDF. Sebbene i legittimi professionisti della sicurezza utilizzino comunemente gli scanner sottostanti, assemblarli con un’intelligenza artificiale jailbroken potrebbe rendere più semplice il funzionamento dei flussi di lavoro offensivi avanzati.
Secondoricerca pubblicata da Cato Networks, Tagliare i metodi documentati per aggirare i controlli di sicurezza di Claude Opus prima di promuovere la piattaforma finita su un forum sulla criminalità informatica in lingua russa.
Trim spostato dai jailbreak di Claude a una piattaforma commerciale
Cato Networks ha detto che Trim ha creato un account sul forum il 13 marzo 2026. L'attore ha poi pubblicato sei tecniche che presumibilmente hanno convinto Claude a rispondere a richieste che normalmente avrebbe rifiutato.
Quasi tre mesi dopo, il 21 giugno, Trim è tornato a pubblicizzare AI Pentest Checker. Il prodotto è stato presentato come una piattaforma automatizzata di sicurezza web in grado di valutare un obiettivo e produrre un report formattato in meno di 10 minuti.
La sequenza temporale mostra la rapidità con cui le tecniche di abuso dell’intelligenza artificiale possono passare dalle discussioni nei forum ai servizi pacchettizzati. Invece di sviluppare un nuovo modello, Trim avrebbe utilizzato modelli commerciali e aperti insieme al software di sicurezza esistente.
| Data riportata | Sviluppo |
|---|---|
| 13 marzo 2026 | Trim ha pubblicato sei tecniche dichiarate per aggirare le garanzie di Claude Opus. |
| 21 giugno 2026 | Trim ha promosso AI Pentest Checker come piattaforma di scansione automatizzata commerciale. |
| 21 luglio 2026 | Cato Networks ha pubblicato la sua analisi dell'attore e della piattaforma. |
Come funzionavano i metodi di jailbreak di Claude segnalati
Le tecniche descritte da Trim si basavano su una manipolazione tempestiva piuttosto che sfruttare una vulnerabilità del software in Claude o compromettere l’infrastruttura di Anthropic.
Un metodo, chiamato Context Warming, iniziava con domande professionali innocue intese a stabilire l'utente come legittimo revisore della sicurezza. La conversazione si sposterebbe quindi verso richieste che il modello potrebbe altrimenti classificare come dannose.
Un'altra tecnica, chiamata Ghost Reset, prevedeva l'apertura di una nuova conversazione dopo un rifiuto e l'invio di una versione attenuata della richiesta. Trim ha affermato che questo approccio ha avuto successo nel 90% dei tentativi, sebbene tale cifra provenisse dall'attore e non abbia ricevuto una convalida indipendente.
- Il riscaldamento del contesto ha creato uno scenario di test di sicurezza apparentemente legittimo.
- Il principio della scatola nera richiedeva al modello di valutare la struttura del codice senza considerare l'intento.
- Ghost Reset ha riavviato le richieste rifiutate in una conversazione nuova o riformulata.
- Model Cascading ha spostato le richieste tra modelli con salvaguardie diverse.
- I modelli locali fornivano un’alternativa quando i servizi commerciali rifiutavano una richiesta.
- L’accesso alle API del mercato grigio ha aggirato la normale registrazione dell’account e i canali di pagamento.
ILIndagine Catone CTRLha scoperto che AI Pentest Checker collegava i suoi componenti AI a 14 strumenti convenzionali di scansione e ricognizione.
Il set di strumenti segnalato includeva Nuclei, ffuf, katana, subfinder e Gitleaks. Queste utilità possono scoprire domini ed endpoint, identificare segreti esposti, testare modelli di vulnerabilità noti e raccogliere informazioni sui sistemi connessi a Internet.
Nessuno di questi strumenti diventa dannoso semplicemente perché un operatore lo utilizza. Ricercatori di sicurezza, penetration tester e difensori si affidano a loro per individuare i punti deboli prima che gli aggressori possano sfruttarli. Il rischio deriva dal modo in cui la piattaforma coordina gli strumenti, interpreta il loro output e dirige ulteriori attività.
| Componente | Ruolo segnalato |
|---|---|
| Chiudi lavoro 4.8 | Revisione ed escalation dei risultati classificati come vulnerabilità critiche. |
| GLM-5 | Generazione di report incentrati sullo sfruttamento. |
| Nuclei | Rilevamento delle vulnerabilità basato su modelli. |
| fuffa | Contenuto Web e rilevamento degli endpoint. |
| katana | Scansione del sito web e mappatura della superficie di attacco. |
| subfinder | Scoperta del sottodominio. |
| Gitleaks | Rilevamento di credenziali e segreti esposti. |
Secondo quanto riferito, Trim ha utilizzato una chiave API Claude del mercato grigio
Trim ha affermato di aver acquistato l'accesso a una chiave API Claude da un rivenditore Telegram per $ 4. Le chiavi del mercato grigio possono provenire da account compromessi, metodi di pagamento rubati, promozioni abusate o account creati al di fuori dei processi approvati da un fornitore.
L’accesso a basso costo riduce il costo della creazione di servizi di attacco sperimentali. Consente inoltre agli operatori di sostituire gli account quando i fornitori rilevano e sospendono attività abusive.

Secondo quanto riferito, Trim ha consigliato Kimi AI, GLM-5 e MiniMax 2.5 quando Claude ha rifiutato le richieste. L'attore ha anche discusso del noleggio di un server con memoria elevata per eseguire un modello ospitato localmente senza le garanzie imposte da un fornitore commerciale.
La richiesta tempestiva di Fable 5 trapelata rimane non confermata
Cato Networks ha riferito che Trim ha descritto la richiesta di escalation di Claude come una versione modificata di una configurazione di sistema di Fable 5 trapelata. Le prove pubbliche dimostrano che Trim ha presentato l’affermazione, ma non dimostrano in modo indipendente come sia stata ottenuta la richiesta o se corrispondesse alle istruzioni di produzione di Anthropic.
I prompt del sistema contengono istruzioni nascoste che guidano il comportamento di un modello, definiscono restrizioni e determinano il modo in cui valuta le richieste degli utenti. L'accesso a tali istruzioni potrebbe aiutare un utente malintenzionato a progettare suggerimenti in base a regole conosciute e casi limite.
Tuttavia, un messaggio trapelato non fornisce accesso ai pesi del modello, alle infrastrutture private o ai sistemi interni di Anthropic. I fornitori possono anche applicare misure di salvaguardia tramite classificatori, monitoraggio degli account, formazione dei modelli, controlli API e altri livelli oltre la richiesta di sistema.
L’intelligenza artificiale sta entrando sempre più nei flussi di lavoro degli attacchi informatici
Il caso si adatta a una tendenza più ampia secondo cui i criminali informatici utilizzano l’intelligenza artificiale per qualcosa di più che scrivere e-mail di phishing o produrre codice di base. I modelli ora possono aiutare a organizzare più passaggi, valutare l'output dello strumento, scegliere azioni di follow-up e convertire i risultati tecnici in report leggibili.
Nel giugno 2026,Anthropic ha pubblicato un'analisisu 832 account vietati per attività informatiche dannose tra marzo 2025 e marzo 2026. L'azienda ha scoperto che gli aggressori utilizzavano sempre più l'intelligenza artificiale durante le fasi successive e tecnicamente più impegnative delle loro operazioni.
Anthropic ha affermato che 560 degli account esaminati, ovvero il 67,3%, hanno utilizzato l’intelligenza artificiale per la preparazione relativa al malware. Ha inoltre scoperto che 54 account hanno utilizzato l’intelligenza artificiale per assistere nei movimenti laterali all’interno di ambienti compromessi.
- L’intelligenza artificiale può interpretare grandi volumi di output dello scanner.
- I modelli possono dare priorità ai risultati che appaiono più preziosi.
- I sistemi agenti possono collegare fasi separate di un'operazione.
- La segnalazione automatizzata può facilitare la vendita dei servizi criminali.
- I modelli di fallback possono mantenere i flussi di lavoro in esecuzione dopo un rifiuto.
Le impalcature AI possono ridurre l'importanza delle abilità dell'operatore
La crescente preoccupazione riguarda l’architettura costruita attorno a un modello di intelligenza artificiale, non solo la capacità del modello di rispondere a un suggerimento dannoso. Una piattaforma può fornire strumenti, archiviare contesto, eseguire comandi, esaminare i risultati e decidere quale passaggio eseguire successivamente.
Antropicoricerca sulle minacce informaticheha scoperto che gli attori meno qualificati nel suo set di dati utilizzavano in media circa 16 tecniche di attacco distinte, rispetto a circa 20 per il gruppo più esperto. La differenza sempre più ridotta suggerisce che l’assistenza dell’intelligenza artificiale può aiutare gli operatori inesperti a svolgere una gamma più ampia di compiti.
La società ha inoltre affermato che gli attori ad alto rischio creano sempre più impalcature che consentono ai modelli di concatenare diverse fasi di attacco con un input umano limitato. AI Pentest Checker sembra seguire questo modello generale collegando scanner, analisi del modello e generazione di report in un unico flusso di lavoro.
Anthropic ha già interrotto l'uso dannoso di Claude
Anthropic ha documentato casi in cui gli autori delle minacce hanno abusato di Claude per ricognizioni, sviluppo di malware, analisi di dati, furto di credenziali e attività legate all'estorsione.
In un precedenterapporto di intelligence sulle minacce, Anthropic ha descritto le misure adottate per identificare gli account abusivi, vietare gli operatori, migliorare i classificatori e condividere gli indicatori con i partner pertinenti.
Tali misure di applicazione possono interrompere l’attività dei servizi ufficiali. Tuttavia, i criminali possono rispondere ruotando gli account, acquistando accessi API non autorizzati, cambiando fornitore o eseguendo modelli meno limitati a livello locale.
Cosa dovrebbero fare le organizzazioni riguardo agli attacchi assistiti dall'intelligenza artificiale
Le organizzazioni non possono impedire ai criminali di sperimentare l’intelligenza artificiale, ma possono ridurre il numero di punti deboli che gli strumenti automatizzati possono individuare e sfruttare.
I team di sicurezza dovrebbero inventariare continuamente le risorse connesse a Internet, rimuovere i servizi dimenticati, correggere le vulnerabilità note e testare le applicazioni accessibili dall'esterno. Anche le credenziali e i segreti esposti richiedono una rotazione rapida.
Le aziende dovrebbero considerare attività di scansione insolite, tentativi di autenticazione ripetuti, rilevamento automatizzato di endpoint e sondaggi ad alto volume come possibili segni di ricognizione assistita dall’intelligenza artificiale.
- Mantieni un inventario aggiornato di domini pubblici, applicazioni, API e risorse cloud.
- Applicare patch ai sistemi rivolti verso Internet in base alla sfruttabilità e all'esposizione.
- Richiedi l'autenticazione a più fattori resistente al phishing per gli account privilegiati.
- Rimuovi i segreti dai repository pubblici e ruota immediatamente le credenziali esposte.
- Limita la velocità degli endpoint sensibili e monitora le richieste automatizzate anomale.
- Esamina le chiavi API per posizioni, volumi e modelli di utilizzo insoliti.
- Testa i piani di risposta agli incidenti contro attacchi più rapidi e parzialmente automatizzati.
Il caso Trim non dimostra che l’intelligenza artificiale abbia sostituito gli aggressori esperti. Dimostra che i modelli possono agire come un livello operativo che collega strumenti già esistenti.
Antropicoindagini sugli abusie i risultati di Cato indicano che i difensori dovrebbero pianificare gli aggressori in grado di ricercare, scansionare, interpretare e documentare le potenziali vulnerabilità più rapidamente di prima.
La riduzione dei servizi esposti, la correzione dei punti deboli noti, la protezione delle credenziali e il rilevamento della ricognizione automatizzata rimangono i modi più diretti per limitare il valore di piattaforme come AI Pentest Checker.
Domande frequenti
Cos'è l'AI Pentest Checker?
AI Pentest Checker è una piattaforma di scansione automatizzata delle vulnerabilità web segnalata promossa da un attore di minacce di lingua russa noto come Trim. Combina modelli di intelligenza artificiale con strumenti convenzionali di ricognizione e test di sicurezza.
Trim ha hackerato Anthropic o Claude?
I metodi riportati non hanno sfruttato l’infrastruttura di Anthropic o i pesi del modello di Claude. Trim avrebbe utilizzato suggerimenti predisposti, modelli di fallback, sistemi locali e una chiave API del mercato grigio per aggirare i controlli di sicurezza.
Quali strumenti utilizza AI Pentest Checker?
Cato Networks ha riferito che la piattaforma integra 14 strumenti, tra cui Nuclei, ffuf, katana, subfinder e Gitleaks. Questi strumenti supportano la scansione delle vulnerabilità, la scansione, l'individuazione dei sottodomini, l'enumerazione degli endpoint e il rilevamento dei segreti.
Il messaggio di sistema di Fable 5 è stato confermato come trapelato?
Cato Networks ha riferito che Trim ha affermato di utilizzare un prompt modificato derivato da una configurazione di Fable 5 trapelata. I resoconti pubblici non hanno stabilito in modo indipendente come sia stato ottenuto il materiale o se corrispondesse alla richiesta di produzione attiva di Anthropic.
Perché le piattaforme di penetration test basate sull’intelligenza artificiale rappresentano un rischio per la sicurezza?
Possono coordinare gli strumenti di scansione, interpretare i risultati, dare priorità alle vulnerabilità e generare report. Questa automazione può ridurre il tempo e le competenze necessarie per eseguire complesse attività di sicurezza offensive.
Come possono le organizzazioni difendersi dagli attacchi assistiti dall’intelligenza artificiale?
Le organizzazioni dovrebbero ridurre la superficie di attacco pubblica, applicare patch ai sistemi esposti, utilizzare l’autenticazione multifattore resistente al phishing, ruotare le credenziali compromesse, proteggere le chiavi API e monitorare la ricognizione automatizzata e le attività di scansione insolite.
