Een Russisch sprekende bedreigingsacteur, bekend als Trim, heeft naar verluidt de jailbreakmethoden van Claude omgezet in een commercieel AI-aangedreven penetratietestplatform genaamd AI Pentest Checker.
Het platform combineert grensverleggende AI-modellen met gevestigde cyberbeveiligingstools om verkenning, scannen van kwetsbaarheden, resultaatanalyse, exploitatierapportage en het maken van PDF-rapporten te automatiseren. Hoewel legitieme beveiligingsprofessionals de onderliggende scanners vaak gebruiken, kan het verpakken ervan met gejailbreakte AI geavanceerde offensieve workflows eenvoudiger te bedienen maken.
Volgensonderzoek gepubliceerd door Cato NetworksSnijd gedocumenteerde methoden af om de veiligheidscontroles van Claude Opus te omzeilen voordat het voltooide platform wordt gepromoot op een Russischtalig cybercriminaliteitsforum.
Trim is verhuisd van Claude Jailbreaks naar een commercieel platform
Cato Networks zei dat Trim op 13 maart 2026 een account op het forum had aangemaakt. De acteur publiceerde vervolgens zes technieken die Claude zouden hebben overgehaald om te reageren op verzoeken die hij normaal gesproken zou afwijzen.
Bijna drie maanden later, op 21 juni, keerde Trim terug om reclame te maken voor AI Pentest Checker. Het product werd gepresenteerd als een geautomatiseerd webbeveiligingsplatform dat in staat is een doelwit te beoordelen en in minder dan 10 minuten een opgemaakt rapport te produceren.
De tijdlijn laat zien hoe snel AI-misbruiktechnieken kunnen overgaan van forumdiscussies naar pakketdiensten. In plaats van een nieuw model te ontwikkelen, gebruikte Trim naar verluidt commerciële en open modellen naast bestaande beveiligingssoftware.
| Gerapporteerde datum | Ontwikkeling |
|---|---|
| 13 maart 2026 | Trim publiceerde zes geclaimde technieken om de waarborgen van Claude Opus te omzeilen. |
| 21 juni 2026 | Trim promootte AI Pentest Checker als een commercieel geautomatiseerd scanplatform. |
| 21 juli 2026 | Cato Networks publiceerde zijn analyse van de acteur en het platform. |
Hoe de gerapporteerde jailbreakmethoden van Claude werkten
De door Trim beschreven technieken waren gebaseerd op snelle manipulatie in plaats van misbruik te maken van een softwarekwetsbaarheid in Claude of de infrastructuur van Anthropic in gevaar te brengen.
Eén methode, Context Warming genaamd, begon met onschuldige professionele vragen die bedoeld waren om van de gebruiker een legitieme beveiligingsauditor te maken. Het gesprek zou dan verschuiven naar verzoeken die het model anders als schadelijk zou kunnen classificeren.
Een andere techniek, genaamd Ghost Reset, omvatte het openen van een nieuw gesprek na een weigering en het indienen van een verzachte versie van het verzoek. Trim beweerde dat deze aanpak in 90 procent van de pogingen slaagde, hoewel dat cijfer afkomstig was van de acteur en geen onafhankelijke validatie heeft gekregen.
- Context Warming creëerde een ogenschijnlijk legitiem scenario voor het testen van de beveiliging.
- Black Box Principle vroeg het model om de codestructuur te evalueren zonder rekening te houden met de intentie.
- Ghost Reset heeft geweigerde verzoeken opnieuw opgestart in een nieuw of opnieuw geformuleerd gesprek.
- Model Cascading verplaatste verzoeken tussen modellen met verschillende beveiligingen.
- Lokale modellen boden een alternatief toen commerciële diensten een verzoek weigerden.
- API-toegang op de grijze markt omzeilde de normale accountregistratie- en betalingskanalen.
DeCato CTRL-onderzoekontdekte dat AI Pentest Checker zijn AI-componenten verbond met 14 conventionele scan- en verkenningstools.
De gerapporteerde toolset omvatte Nuclei, ffuf, katana, subfinder en Gitleaks. Deze hulpprogramma's kunnen domeinen en eindpunten ontdekken, blootliggende geheimen identificeren, bekende kwetsbaarheidspatronen testen en informatie verzamelen over internetgerichte systemen.
Geen van deze tools wordt kwaadaardig simpelweg omdat een operator ze gebruikt. Beveiligingsonderzoekers, penetratietesters en verdedigers vertrouwen erop om zwakke punten te vinden voordat aanvallers deze kunnen misbruiken. Het risico komt voort uit de manier waarop het platform de tools coördineert, de resultaten ervan interpreteert en verdere activiteiten aanstuurt.
| Onderdeel | Gerapporteerde rol |
|---|---|
| Sluit werk 4.8 | Beoordeling en escalatie van bevindingen die zijn geclassificeerd als kritieke kwetsbaarheden. |
| GLM-5 | Genereren van op exploitatie gerichte rapporten. |
| Kernen | Op sjablonen gebaseerde detectie van kwetsbaarheden. |
| pluis | Webinhoud en eindpuntdetectie. |
| katana | Websitecrawlen en aanvalsoppervlak in kaart brengen. |
| subzoeker | Ontdekking van subdomeinen. |
| Gitleaks | Detectie van blootgestelde inloggegevens en geheimen. |
Trim heeft naar verluidt een Claude API-sleutel van de grijze markt gebruikt
Trim beweerde toegang tot een Claude API-sleutel te hebben gekocht bij een Telegram-reseller voor $ 4. Grijze marktsleutels kunnen afkomstig zijn van gecompromitteerde accounts, gestolen betaalmethoden, misbruikte promoties of accounts die buiten de goedgekeurde processen van een provider zijn gemaakt.
Goedkope toegang verlaagt de kosten van het bouwen van experimentele aanvalsdiensten. Operators kunnen hiermee ook accounts vervangen wanneer providers misbruik detecteren en opschorten.

Trim heeft naar verluidt Kimi AI, GLM-5 en MiniMax 2.5 aanbevolen toen Claude verzoeken weigerde. De acteur besprak ook het huren van een server met veel geheugen om een lokaal gehost model te draaien zonder de waarborgen die door een commerciële provider worden afgedwongen.
Uitgelekte Fable 5 Prompt-claim blijft onbevestigd
Cato Networks meldde dat Trim de escalatieprompt van Claude beschreef als een aangepaste versie van een gelekte Fable 5-systeemconfiguratie. Uit het openbare bewijsmateriaal blijkt dat Trim de bewering heeft gedaan, maar het bewijst niet op onafhankelijke wijze hoe de prompt werd verkregen en of deze overeenkwam met de productie-instructies van Anthropic.
Systeemprompts bevatten verborgen instructies die het gedrag van een model sturen, beperkingen definiëren en bepalen hoe het gebruikersverzoeken evalueert. Toegang tot deze instructies kan een aanvaller helpen bij het ontwerpen van aanwijzingen rond bekende regels en randgevallen.
Een gelekte prompt biedt echter geen toegang tot modelgewichten, privé-infrastructuur of de interne systemen van Anthropic. Providers kunnen ook waarborgen afdwingen via classificaties, accountmonitoring, modeltraining, API-controles en andere lagen buiten de systeemprompt.
AI dringt dieper door in de workflows voor cyberaanvallen
De zaak past in een bredere trend waarin cybercriminelen AI gebruiken voor meer dan alleen het schrijven van phishing-e-mails of het produceren van basiscode. Modellen kunnen nu helpen bij het organiseren van meerdere stappen, het evalueren van de tooloutput, het kiezen van vervolgacties en het omzetten van technische resultaten in leesbare rapporten.
In juni 2026,Anthropic publiceerde een analysevan de 832 accounts die tussen maart 2025 en maart 2026 werden verboden vanwege kwaadaardige cyberactiviteiten. Het bedrijf ontdekte dat aanvallers steeds vaker AI gebruikten tijdens latere en technisch veeleisender fasen van hun operaties.
Anthropic zei dat 560 van de beoordeelde accounts, oftewel 67,3 procent, AI gebruikten voor malware-gerelateerde voorbereiding. Ook bleek dat 54 accounts AI gebruikten om te helpen bij zijwaartse bewegingen binnen gecompromitteerde omgevingen.
- AI kan grote hoeveelheden scanneruitvoer interpreteren.
- Modellen kunnen prioriteit geven aan bevindingen die waardevoller lijken.
- Agentische systemen kunnen afzonderlijke fasen van een operatie met elkaar verbinden.
- Geautomatiseerde rapportage kan ervoor zorgen dat criminele diensten gemakkelijker te verkopen zijn.
- Fallback-modellen kunnen ervoor zorgen dat workflows na een weigering blijven draaien.
AI-steigers kunnen het belang van de vaardigheden van operators verminderen
De groeiende zorg betreft de architectuur die rond een AI-model is gebouwd, en niet alleen het vermogen van het model om een schadelijke prompt te beantwoorden. Een platform kan tools leveren, context opslaan, opdrachten uitvoeren, resultaten bekijken en beslissen welke stap vervolgens moet worden uitgevoerd.
Antropische'sonderzoek naar cyberdreigingenontdekte dat minder bekwame actoren in de dataset gemiddeld ongeveer zestien verschillende aanvalstechnieken gebruikten, vergeleken met ongeveer twintig voor de meest bekwame groep. Het kleiner wordende verschil suggereert dat AI-ondersteuning onervaren operators kan helpen een breder scala aan taken uit te voeren.
Het bedrijf zei ook dat actoren met een hoger risico steeds vaker steigers creëren waarmee modellen verschillende aanvalsfasen aan elkaar kunnen koppelen met beperkte menselijke inbreng. AI Pentest Checker lijkt dat algemene patroon te volgen door scanners, modelanalyse en het genereren van rapporten in één workflow met elkaar te verbinden.
Anthropic heeft eerder kwaadaardig Claude-gebruik verstoord
Anthropic heeft gevallen gedocumenteerd waarin bedreigingsactoren Claude misbruikten voor verkenning, malware-ontwikkeling, gegevensanalyse, diefstal van inloggegevens en afpersingsgerelateerde taken.
In een eerderdreigingsinlichtingenrapport, beschreef Anthropic de maatregelen die het nam om onrechtmatige accounts te identificeren, exploitanten te verbieden, classificaties te verbeteren en indicatoren te delen met relevante partners.
Deze handhavingsmaatregelen kunnen de activiteit van officiële diensten verstoren. Criminelen kunnen hierop echter reageren door accounts te wisselen, ongeautoriseerde API-toegang te kopen, van provider te wisselen of lokaal minder beperkte modellen uit te voeren.
Wat organisaties moeten doen tegen AI-ondersteunde aanvallen
Organisaties kunnen niet voorkomen dat criminelen met AI experimenteren, maar ze kunnen wel het aantal zwakke punten verminderen dat geautomatiseerde tools kunnen vinden en misbruiken.
Beveiligingsteams moeten voortdurend internetgerichte middelen inventariseren, vergeten services verwijderen, bekende kwetsbaarheden patchen en extern toegankelijke applicaties testen. Blootgestelde inloggegevens en geheimen vereisen ook een snelle rotatie.
Bedrijven moeten ongebruikelijke scanactiviteiten, herhaalde authenticatiepogingen, geautomatiseerde eindpuntdetectie en grootschalige onderzoeken beschouwen als mogelijke tekenen van door AI ondersteunde verkenningen.
- Houd een actuele inventaris bij van publieke domeinen, applicaties, API's en cloudmiddelen.
- Patch internetgerichte systemen op basis van exploiteerbaarheid en blootstelling.
- Vereis phishing-bestendige meervoudige authenticatie voor bevoorrechte accounts.
- Verwijder geheimen uit openbare opslagplaatsen en roteer openbaar gemaakte inloggegevens onmiddellijk.
- Beperk gevoelige eindpunten en bewaak abnormale geautomatiseerde verzoeken.
- Controleer API-sleutels op ongebruikelijke locaties, volumes en gebruikspatronen.
- Test incidentresponsplannen tegen snellere, gedeeltelijk geautomatiseerde aanvallen.
Uit de Trim-zaak blijkt niet dat AI ervaren aanvallers heeft vervangen. Het laat zien dat modellen kunnen fungeren als een operationele laag die al bestaande tools met elkaar verbindt.
Antropische'sonderzoeken naar misbruiken de bevindingen van Cato geven aan dat verdedigers zich moeten voorbereiden op aanvallers die potentiële kwetsbaarheden sneller dan voorheen kunnen onderzoeken, scannen, interpreteren en documenteren.
Het verminderen van blootgestelde services, het oplossen van bekende zwakke punten, het beschermen van inloggegevens en het detecteren van geautomatiseerde verkenningen blijven de meest directe manieren om de waarde van platforms zoals AI Pentest Checker te beperken.
Veelgestelde vragen
Wat is AI PentestChecker?
AI Pentest Checker is een gerapporteerd geautomatiseerd platform voor het scannen van webkwetsbaarheden, gepromoot door een Russisch sprekende bedreigingsacteur die bekend staat als Trim. Het combineert AI-modellen met conventionele verkennings- en beveiligingstesttools.
Heeft Trim Anthropic of Claude gehackt?
De gerapporteerde methoden maakten geen gebruik van de infrastructuur van Anthropic of de modelgewichten van Claude. Trim zou gebruik hebben gemaakt van vervaardigde aanwijzingen, fallback-modellen, lokale systemen en een API-sleutel voor de grijze markt om veiligheidscontroles te omzeilen.
Welke tools gebruikt AI Pentest Checker?
Cato Networks meldde dat het platform 14 tools integreert, waaronder Nuclei, ffuf, katana, subfinder en Gitleaks. Deze tools ondersteunen het scannen van kwetsbaarheden, crawlen, ontdekken van subdomeinen, opsomming van eindpunten en detectie van geheimen.
Werd bevestigd dat de Fable 5-systeemprompt gelekt was?
Cato Networks meldde dat Trim beweerde een aangepaste prompt te gebruiken die was afgeleid van een gelekte Fable 5-configuratie. In de openbare berichtgeving is niet onafhankelijk vastgesteld hoe het materiaal is verkregen en of het overeenkwam met de actieve productieprompt van Anthropic.
Waarom vormen AI-aangedreven penetratietestplatforms een veiligheidsrisico?
Ze kunnen scantools coördineren, resultaten interpreteren, kwetsbaarheden prioriteren en rapporten genereren. Deze automatisering kan de tijd en expertise die nodig is om complexe offensieve beveiligingstaken uit te voeren, verminderen.
Hoe kunnen organisaties zich verdedigen tegen AI-ondersteunde aanvallen?
Organisaties moeten hun publieke aanvalsoppervlak verkleinen, kwetsbare systemen patchen, phishing-resistente meervoudige authenticatie gebruiken, gecompromitteerde inloggegevens rouleren, API-sleutels beschermen en monitoren op geautomatiseerde verkenningen en ongebruikelijke scanactiviteiten.
