Hacker verwandelt Claude mit Jailbreak in eine KI-gestützte Pentesting-Plattform

Berichten zufolge hat ein russischsprachiger Bedrohungsakteur namens Trim die Jailbreak-Methoden von Claude in eine kommerzielle KI-gestützte Penetrationstestplattform namens AI Pentest Checker umgewandelt.

Die Plattform kombiniert bahnbrechende KI-Modelle mit etablierten Cybersicherheitstools, um Aufklärung, Schwachstellen-Scans, Ergebnisanalysen, Ausnutzungsberichte und die Erstellung von PDF-Berichten zu automatisieren. Obwohl seriöse Sicherheitsexperten häufig die zugrunde liegenden Scanner verwenden, könnte die Kombination mit KI mit Jailbreak die Bedienung komplexer Angriffsabläufe erleichtern.

Entsprechendvon Cato Networks veröffentlichte Studie, Trim dokumentierte Methoden zur Umgehung der Sicherheitskontrollen von Claude Opus, bevor die fertige Plattform in einem russischsprachigen Cyberkriminalitätsforum beworben wurde.

Trim wechselte von Claude Jailbreaks zu einer kommerziellen Plattform

Cato Networks sagte, Trim habe am 13. März 2026 ein Konto im Forum erstellt. Anschließend veröffentlichte der Schauspieler sechs Techniken, die Claude angeblich davon überzeugt hätten, auf Anfragen zu antworten, die er normalerweise ablehnte.

Fast drei Monate später, am 21. Juni, kehrte Trim zurück, um für AI Pentest Checker zu werben. Das Produkt wurde als automatisierte Web-Sicherheitsplattform vorgestellt, die in der Lage ist, ein Ziel zu bewerten und in weniger als 10 Minuten einen formatierten Bericht zu erstellen.

Die Zeitleiste zeigt, wie schnell KI-Missbrauchstechniken von Forumsdiskussionen zu Paketdiensten übergehen können. Anstatt ein neues Modell zu entwickeln, nutzte Trim Berichten zufolge neben bestehender Sicherheitssoftware auch kommerzielle und offene Modelle.

Gemeldetes DatumEntwicklung
13. März 2026Trim veröffentlichte sechs angebliche Techniken zur Umgehung der Schutzmaßnahmen von Claude Opus.
21. Juni 2026Trim bewarb AI Pentest Checker als kommerzielle automatisierte Scan-Plattform.
21. Juli 2026Cato Networks hat seine Analyse des Akteurs und der Plattform veröffentlicht.

Wie die gemeldeten Claude-Jailbreak-Methoden funktionierten

Die von Trim beschriebenen Techniken beruhten auf sofortiger Manipulation und nicht auf der Ausnutzung einer Softwareschwachstelle in Claude oder der Kompromittierung der Infrastruktur von Anthropic.

Eine Methode namens „Context Warming“ begann mit harmlosen Fachfragen, um den Benutzer als legitimen Sicherheitsprüfer zu etablieren. Das Gespräch würde sich dann auf Anfragen verlagern, die das Model andernfalls als schädlich einstufen würde.

Eine andere Technik namens Ghost Reset bestand darin, nach einer Ablehnung ein neues Gespräch zu eröffnen und eine abgeschwächte Version der Anfrage einzureichen. Trim behauptete, dass dieser Ansatz in 90 Prozent der Versuche erfolgreich war, obwohl diese Zahl vom Schauspieler stammte und keine unabhängige Bestätigung erhalten hat.

  • Context Warming hat ein scheinbar legitimes Sicherheitstestszenario etabliert.
  • Das Black-Box-Prinzip forderte das Modell auf, die Codestruktur zu bewerten, ohne die Absicht zu berücksichtigen.
  • Ghost Reset hat abgelehnte Anfragen in einer neuen oder neu gestalteten Konversation neu gestartet.
  • Durch die Modellkaskadierung wurden Anforderungen zwischen Modellen mit unterschiedlichen Sicherheitsmaßnahmen verschoben.
  • Lokale Modelle boten eine Alternative, wenn kommerzielle Dienste eine Anfrage ablehnten.
  • Der API-Zugriff auf den grauen Markt umging die normalen Kontoregistrierungs- und Zahlungskanäle.

DerCato CTRL-Untersuchungstellte fest, dass AI Pentest Checker seine KI-Komponenten mit 14 herkömmlichen Scan- und Aufklärungstools verband.

Das gemeldete Toolset umfasste Nuclei, ffuf, Katana, Subfinder und Gitleaks. Diese Dienstprogramme können Domänen und Endpunkte erkennen, offengelegte Geheimnisse identifizieren, bekannte Schwachstellenmuster testen und Informationen über mit dem Internet verbundene Systeme sammeln.

Keines dieser Tools wird bösartig, nur weil ein Betreiber es verwendet. Sicherheitsforscher, Penetrationstester und Verteidiger verlassen sich darauf, dass sie Schwachstellen finden, bevor Angreifer sie ausnutzen können. Das Risiko ergibt sich aus der Art und Weise, wie die Plattform die Tools koordiniert, ihre Ergebnisse interpretiert und weitere Aktivitäten steuert.

KomponenteGemeldete Rolle
Schließen Sie die Arbeit 4.8Überprüfung und Eskalation von als kritische Schwachstellen eingestuften Erkenntnissen.
GLM-5Erstellung von ausbeutungsorientierten Berichten.
KerneVorlagenbasierte Schwachstellenerkennung.
ffErkennung von Webinhalten und Endpunkten.
KatanaWebsite-Crawling und Angriffsflächen-Mapping.
SubfinderSubdomain-Erkennung.
GitleaksErkennung offengelegter Anmeldeinformationen und Geheimnisse.

Berichten zufolge hat Trim einen API-Schlüssel von Grey-Market Claude verwendet

Trim gab an, für 4 US-Dollar Zugriff auf einen Claude-API-Schlüssel von einem Telegram-Reseller erworben zu haben. Graumarktschlüssel können von kompromittierten Konten, gestohlenen Zahlungsmethoden, missbrauchten Werbeaktionen oder Konten stammen, die außerhalb der genehmigten Prozesse eines Anbieters erstellt wurden.

Ein günstiger Zugang senkt die Kosten für den Aufbau experimenteller Angriffsdienste. Außerdem können Betreiber Konten ersetzen, wenn Anbieter missbräuchliche Aktivitäten erkennen und sperren.

Berichten zufolge empfahl Trim Kimi AI, GLM-5 und MiniMax 2.5, als Claude Anfragen ablehnte. Der Schauspieler diskutierte auch über die Anmietung eines Servers mit hohem Speicher, um ein lokal gehostetes Modell ohne die von einem kommerziellen Anbieter durchgesetzten Sicherheitsmaßnahmen auszuführen.

Durchgesickerte Fable 5-Prompt-Behauptung bleibt unbestätigt

Cato Networks berichtete, dass Trim die Claude-Eskalationsaufforderung als eine modifizierte Version einer durchgesickerten Fable 5-Systemkonfiguration beschrieb. Die öffentlichen Beweise belegen, dass Trim die Behauptung aufgestellt hat, sie beweisen jedoch nicht unabhängig, wie die Aufforderung zustande kam oder ob sie mit den Produktionsanweisungen von Anthropic übereinstimmte.

Systemeingabeaufforderungen enthalten versteckte Anweisungen, die das Verhalten eines Modells steuern, Einschränkungen definieren und beeinflussen, wie es Benutzeranfragen bewertet. Der Zugriff auf diese Anweisungen könnte einem Angreifer dabei helfen, Eingabeaufforderungen rund um bekannte Regeln und Randfälle zu entwerfen.

Eine durchgesickerte Eingabeaufforderung bietet jedoch keinen Zugriff auf Modellgewichte, private Infrastruktur oder die internen Systeme von Anthropic. Anbieter können außerdem Schutzmaßnahmen durch Klassifikatoren, Kontoüberwachung, Modellschulung, API-Kontrollen und andere Ebenen über die Systemeingabeaufforderung hinaus durchsetzen.

KI dringt immer tiefer in Cyberangriffs-Workflows vor

Der Fall passt zu einem breiteren Trend, bei dem Cyberkriminelle KI für mehr nutzen, als nur Phishing-E-Mails zu schreiben oder einfachen Code zu erstellen. Modelle können nun dabei helfen, mehrere Schritte zu organisieren, die Werkzeugausgabe zu bewerten, Folgemaßnahmen auszuwählen und technische Ergebnisse in lesbare Berichte umzuwandeln.

Im Juni 2026,Anthropic veröffentlichte eine Analysevon 832 Konten, die zwischen März 2025 und März 2026 wegen böswilliger Cyberaktivitäten gesperrt wurden. Das Unternehmen stellte fest, dass Angreifer in späteren und technisch anspruchsvolleren Phasen ihrer Operationen zunehmend KI verwendeten.

Anthropic gab an, dass 560 der überprüften Konten oder 67,3 Prozent KI für die Malware-bezogene Vorbereitung nutzten. Es wurde außerdem festgestellt, dass 54 Konten KI zur Unterstützung der seitlichen Bewegung in gefährdeten Umgebungen verwendeten.

  • KI kann große Mengen an Scannerausgaben interpretieren.
  • Modelle können Erkenntnisse priorisieren, die wertvoller erscheinen.
  • Agentensysteme können separate Phasen eines Vorgangs verbinden.
  • Durch automatisierte Meldungen können kriminelle Dienste leichter verkauft werden.
  • Fallback-Modelle können Arbeitsabläufe nach einer Ablehnung am Laufen halten.

KI-Gerüste können die Bedeutung der Bedienerfähigkeiten verringern

Die wachsende Sorge betrifft die Architektur, die auf einem KI-Modell basiert, und nicht nur die Fähigkeit des Modells, auf eine schädliche Aufforderung zu antworten. Eine Plattform kann Tools bereitstellen, Kontext speichern, Befehle ausführen, Ergebnisse überprüfen und entscheiden, welcher Schritt als nächstes ausgeführt werden soll.

AnthropicsCyber-Bedrohungsforschungstellte fest, dass weniger erfahrene Akteure in ihrem Datensatz im Durchschnitt etwa 16 verschiedene Angriffstechniken verwendeten, verglichen mit etwa 20 für die Gruppe mit den höchsten Fähigkeiten. Der kleiner werdende Unterschied deutet darauf hin, dass die KI-Unterstützung unerfahrenen Bedienern dabei helfen kann, ein breiteres Aufgabenspektrum auszuführen.

Das Unternehmen sagte außerdem, dass Akteure mit höherem Risiko zunehmend Gerüste schaffen, die es Modellen ermöglichen, mehrere Angriffsphasen mit begrenztem menschlichen Input miteinander zu verketten. AI Pentest Checker scheint diesem allgemeinen Muster zu folgen, indem es Scanner, Modellanalyse und Berichtserstellung in einem Arbeitsablauf verbindet.

Anthropic hat zuvor den böswilligen Claude-Einsatz unterbunden

Anthropic hat Fälle dokumentiert, in denen Bedrohungsakteure Claude für Aufklärungs-, Malware-Entwicklungs-, Datenanalyse-, Anmeldedatendiebstahl- und Erpressungszwecke missbrauchten.

In einem früherenThreat-Intelligence-BerichtAnthropic beschrieb Maßnahmen, die ergriffen wurden, um missbräuchliche Konten zu identifizieren, Betreiber zu sperren, Klassifikatoren zu verbessern und Indikatoren mit relevanten Partnern zu teilen.

Diese Durchsetzungsmaßnahmen können die Tätigkeit offizieller Dienste stören. Allerdings können Kriminelle darauf reagieren, indem sie Konten wechseln, unbefugten API-Zugriff kaufen, den Anbieter wechseln oder weniger eingeschränkte Modelle lokal ausführen.

Was Unternehmen gegen KI-gestützte Angriffe tun sollten

Organisationen können Kriminelle nicht daran hindern, mit KI zu experimentieren, aber sie können die Anzahl der Schwachstellen reduzieren, die automatisierte Tools finden und ausnutzen können.

Sicherheitsteams sollten kontinuierlich mit dem Internet verbundene Ressourcen inventarisieren, vergessene Dienste entfernen, bekannte Schwachstellen schließen und extern zugängliche Anwendungen testen. Offengelegte Zugangsdaten und Geheimnisse erfordern ebenfalls eine schnelle Rotation.

Unternehmen sollten ungewöhnliche Scanaktivitäten, wiederholte Authentifizierungsversuche, automatisierte Endpunkterkennung und umfangreiche Sondierungen als mögliche Anzeichen einer KI-gestützten Aufklärung betrachten.

  1. Pflegen Sie einen aktuellen Bestand an öffentlichen Domänen, Anwendungen, APIs und Cloud-Assets.
  2. Patchen Sie mit dem Internet verbundene Systeme entsprechend ihrer Ausnutzbarkeit und Gefährdung.
  3. Fordern Sie eine phishingresistente Multifaktor-Authentifizierung für privilegierte Konten.
  4. Entfernen Sie Geheimnisse aus öffentlichen Repositorys und rotieren Sie offengelegte Anmeldeinformationen sofort.
  5. Begrenzen Sie die Rate sensibler Endpunkte und überwachen Sie abnormale automatisierte Anfragen.
  6. Überprüfen Sie API-Schlüssel auf ungewöhnliche Speicherorte, Volumina und Nutzungsmuster.
  7. Testen Sie Pläne zur Reaktion auf Vorfälle gegen schnellere, teilweise automatisierte Angriffe.

Der Trim-Fall zeigt nicht, dass KI erfahrene Angreifer ersetzt hat. Es zeigt, dass Modelle als operative Ebene fungieren können, die bereits vorhandene Tools verbindet.

AnthropicsMissbrauchsermittlungenund Catos Erkenntnisse deuten darauf hin, dass Verteidiger Angreifer einplanen sollten, die potenzielle Schwachstellen schneller als bisher recherchieren, scannen, interpretieren und dokumentieren können.

Die Reduzierung exponierter Dienste, die Behebung bekannter Schwachstellen, der Schutz von Anmeldeinformationen und die Erkennung automatisierter Aufklärung bleiben die direktesten Möglichkeiten, den Wert von Plattformen wie AI Pentest Checker zu begrenzen.

FAQ

Was ist AI Pentest Checker?

AI Pentest Checker ist eine Berichten zufolge automatisierte Web-Schwachstellen-Scan-Plattform, die von einem russischsprachigen Bedrohungsakteur namens Trim gefördert wird. Es kombiniert KI-Modelle mit herkömmlichen Aufklärungs- und Sicherheitstesttools.

Hat Trim Anthropic oder Claude gehackt?

Die gemeldeten Methoden nutzten weder die Infrastruktur von Anthropic noch die Modellgewichte von Claude. Trim nutzte angeblich manipulierte Eingabeaufforderungen, Fallback-Modelle, lokale Systeme und einen Graumarkt-API-Schlüssel, um Sicherheitskontrollen zu umgehen.

Welche Tools verwendet AI Pentest Checker?

Cato Networks berichtete, dass die Plattform 14 Tools integriert, darunter Nuclei, ffuf, Katana, Subfinder und Gitleaks. Diese Tools unterstützen das Scannen von Schwachstellen, das Crawlen, die Erkennung von Subdomänen, die Endpunktaufzählung und die Erkennung von Geheimnissen.

Wurde die Systemaufforderung von Fable 5 als durchgesickert bestätigt?

Cato Networks berichtete, dass Trim behauptete, eine modifizierte Eingabeaufforderung zu verwenden, die aus einer durchgesickerten Fable 5-Konfiguration abgeleitet sei. Die öffentliche Berichterstattung hat nicht unabhängig festgestellt, wie das Material beschafft wurde oder ob es mit der aktiven Produktionsaufforderung von Anthropic übereinstimmte.

Warum stellen KI-gestützte Penetrationstestplattformen ein Sicherheitsrisiko dar?

Sie können Scan-Tools koordinieren, Ergebnisse interpretieren, Schwachstellen priorisieren und Berichte erstellen. Diese Automatisierung kann den Zeit- und Fachaufwand verringern, der für die Durchführung komplexer Angriffssicherheitsaufgaben erforderlich ist.

Wie können sich Organisationen gegen KI-gestützte Angriffe wehren?

Unternehmen sollten ihre öffentliche Angriffsfläche reduzieren, exponierte Systeme patchen, eine phishing-resistente Multifaktor-Authentifizierung verwenden, kompromittierte Anmeldeinformationen rotieren, API-Schlüssel schützen und auf automatisierte Aufklärung und ungewöhnliche Scan-Aktivitäten achten.