Ο χάκερ μετατρέπει τον jailbroken Claude σε πλατφόρμα Pentesting με τεχνητή νοημοσύνη

Ένας ρωσόφωνος ηθοποιός απειλών, γνωστός ως Trim, φέρεται να έχει μετατρέψει τις μεθόδους jailbreak του Claude σε μια εμπορική πλατφόρμα δοκιμών διείσδυσης με τροφοδοσία AI που ονομάζεται AI Pentest Checker.

Η πλατφόρμα συνδυάζει μοντέλα τεχνητής νοημοσύνης συνόρων με καθιερωμένα εργαλεία κυβερνοασφάλειας για την αυτοματοποίηση της αναγνώρισης, της σάρωσης ευπάθειας, της ανάλυσης αποτελεσμάτων, της αναφοράς εκμετάλλευσης και της δημιουργίας αναφορών PDF. Αν και οι νόμιμοι επαγγελματίες ασφαλείας χρησιμοποιούν συνήθως τους υποκείμενους σαρωτές, η συσκευασία τους με τεχνητή νοημοσύνη με jailbroken θα μπορούσε να διευκολύνει τη λειτουργία των προηγμένων επιθετικών ροών εργασίας.

Σύμφωνα μεέρευνα που δημοσιεύτηκε από την Cato Networks, Περικόψτε τεκμηριωμένες μεθόδους για την παράκαμψη των ελέγχων ασφαλείας του Claude Opus πριν προωθήσετε την ολοκληρωμένη πλατφόρμα σε ένα ρωσόφωνο φόρουμ για το έγκλημα στον κυβερνοχώρο.

Το Trim μεταφέρθηκε από τα Claude Jailbreaks σε μια Εμπορική Πλατφόρμα

Η Cato Networks είπε ότι ο Trim δημιούργησε έναν λογαριασμό στο φόρουμ στις 13 Μαρτίου 2026. Στη συνέχεια, ο ηθοποιός δημοσίευσε έξι τεχνικές που φέρεται να έπεισαν τον Claude να ανταποκριθεί σε αιτήματα που κανονικά θα απέρριπτε.

Σχεδόν τρεις μήνες αργότερα, στις 21 Ιουνίου, ο Trim επέστρεψε για να διαφημίσει το AI Pentest Checker. Το προϊόν παρουσιάστηκε ως μια αυτοματοποιημένη πλατφόρμα ασφάλειας ιστού ικανή να αξιολογήσει έναν στόχο και να παράγει μια μορφοποιημένη αναφορά σε λιγότερο από 10 λεπτά.

Το χρονοδιάγραμμα δείχνει πόσο γρήγορα οι τεχνικές κατάχρησης τεχνητής νοημοσύνης μπορούν να μετακινηθούν από τις συζητήσεις του φόρουμ σε συσκευασμένες υπηρεσίες. Αντί να αναπτύξει ένα νέο μοντέλο, η Trim χρησιμοποίησε εμπορικά και ανοιχτά μοντέλα μαζί με υπάρχον λογισμικό ασφαλείας.

Ημερομηνία αναφοράςΑνάπτυξη
13 Μαρτίου 2026Ο Trim δημοσίευσε έξι διεκδικούμενες τεχνικές για την παράκαμψη των διασφαλίσεων του Claude Opus.
21 Ιουνίου 2026Η Trim προώθησε το AI Pentest Checker ως εμπορική πλατφόρμα αυτοματοποιημένης σάρωσης.
21 Ιουλίου 2026Η Cato Networks δημοσίευσε την ανάλυσή της για τον ηθοποιό και την πλατφόρμα.

Πώς λειτούργησαν οι αναφερόμενες μέθοδοι του Claude Jailbreak

Οι τεχνικές που περιγράφονται από τον Trim βασίζονταν σε άμεση χειραγώγηση αντί να εκμεταλλευτούν μια ευπάθεια λογισμικού στον Claude ή να θέσουν σε κίνδυνο την υποδομή του Anthropic.

Μια μέθοδος, που ονομάζεται Context Warming, ξεκίνησε με ακίνδυνες επαγγελματικές ερωτήσεις που είχαν σκοπό να καθιερώσουν τον χρήστη ως νόμιμο ελεγκτή ασφαλείας. Στη συνέχεια, η συζήτηση θα μετατοπιστεί προς αιτήματα που διαφορετικά το μοντέλο θα μπορούσε να ταξινομήσει ως επιβλαβή.

Μια άλλη τεχνική, που ονομάζεται Ghost Reset, περιελάμβανε το άνοιγμα μιας νέας συνομιλίας μετά από άρνηση και την υποβολή μιας πιο απαλής έκδοσης του αιτήματος. Ο Trim ισχυρίστηκε ότι αυτή η προσέγγιση πέτυχε στο 90 τοις εκατό των προσπαθειών, αν και αυτό το ποσοστό προήλθε από τον ηθοποιό και δεν έχει λάβει ανεξάρτητη επικύρωση.

  • Το Context Warming καθιέρωσε ένα φαινομενικά νόμιμο σενάριο δοκιμών ασφαλείας.
  • Το Black Box Principle ζήτησε από το μοντέλο να αξιολογήσει τη δομή του κώδικα χωρίς να λάβει υπόψη του την πρόθεση.
  • Το Ghost Reset επανεκκίνησε τα απορριφθέντα αιτήματα σε μια νέα συνομιλία ή σε μια νέα συνομιλία.
  • Το Model Cascading μετέφερε αιτήματα μεταξύ μοντέλων με διαφορετικές διασφαλίσεις.
  • Τα τοπικά μοντέλα παρείχαν μια εναλλακτική λύση όταν οι εμπορικές υπηρεσίες απέρριψαν ένα αίτημα.
  • Η πρόσβαση στο API της γκρίζας αγοράς παρέκαμψε τα κανονικά κανάλια εγγραφής και πληρωμής λογαριασμού.

ΟΈρευνα Cato CTRLδιαπίστωσε ότι το AI Pentest Checker συνέδεσε τα στοιχεία AI του με 14 συμβατικά εργαλεία σάρωσης και αναγνώρισης.

Το αναφερόμενο σύνολο εργαλείων περιελάμβανε Nuclei, ffuf, katana, subfinder και Gitleaks. Αυτά τα βοηθητικά προγράμματα μπορούν να ανακαλύψουν τομείς και τελικά σημεία, να εντοπίσουν εκτεθειμένα μυστικά, να δοκιμάσουν γνωστά πρότυπα ευπάθειας και να συλλέξουν πληροφορίες σχετικά με συστήματα που αντιμετωπίζουν το Διαδίκτυο.

Κανένα από αυτά τα εργαλεία δεν γίνεται κακόβουλο απλώς και μόνο επειδή το χρησιμοποιεί ένας χειριστής. Οι ερευνητές ασφαλείας, οι ελεγκτές διείσδυσης και οι υπερασπιστές βασίζονται σε αυτούς για να βρουν αδυναμίες προτού οι εισβολείς μπορέσουν να τις εκμεταλλευτούν. Ο κίνδυνος προέρχεται από το πώς η πλατφόρμα συντονίζει τα εργαλεία, ερμηνεύει την παραγωγή τους και κατευθύνει περαιτέρω δραστηριότητα.

ΣυστατικόΑναφερόμενος ρόλος
Κλείσιμο εργασίας 4.8Επανεξέταση και κλιμάκωση ευρημάτων που ταξινομούνται ως κρίσιμα τρωτά σημεία.
GLM-5Δημιουργία αναφορών με επίκεντρο την εκμετάλλευση.
ΠυρήνεςΑνίχνευση ευπάθειας βάσει προτύπων.
φουφΑνακάλυψη περιεχομένου ιστού και τελικού σημείου.
κατάναΑνίχνευση ιστότοπου και χαρτογράφηση επιφάνειας επίθεσης.
υποβρισκόμενοςΑνακάλυψη υποτομέα.
GitleaksΑνίχνευση εκτεθειμένων διαπιστευτηρίων και μυστικών.

Η περικοπή φέρεται να χρησιμοποίησε ένα κλειδί API Claude Grey-Market

Ο Trim ισχυρίστηκε ότι αγόρασε πρόσβαση σε ένα κλειδί Claude API από έναν μεταπωλητή Telegram για 4 $. Τα κλειδιά της γκρίζας αγοράς μπορεί να προέρχονται από παραβιασμένους λογαριασμούς, κλεμμένες μεθόδους πληρωμής, καταχρηστικές προωθήσεις ή λογαριασμούς που έχουν δημιουργηθεί εκτός των εγκεκριμένων διαδικασιών ενός παρόχου.

Η φθηνή πρόσβαση μειώνει το κόστος δημιουργίας πειραματικών υπηρεσιών επίθεσης. Επιτρέπει επίσης στους χειριστές να αντικαθιστούν λογαριασμούς όταν οι πάροχοι εντοπίζουν και αναστέλλουν καταχρηστική δραστηριότητα.

Ο Trim φέρεται να συνέστησε τα Kimi AI, GLM-5 και MiniMax 2.5 όταν ο Claude απέρριψε αιτήματα. Ο ηθοποιός συζήτησε επίσης την ενοικίαση ενός διακομιστή υψηλής μνήμης για την εκτέλεση ενός τοπικά φιλοξενούμενου μοντέλου χωρίς τις διασφαλίσεις που επιβάλλονται από έναν εμπορικό πάροχο.

Ο ισχυρισμός προτροπής Fable 5 που διέρρευσε παραμένει ανεπιβεβαίωτος

Η Cato Networks ανέφερε ότι ο Trim περιέγραψε την προτροπή κλιμάκωσης του Claude ως μια τροποποιημένη έκδοση μιας διαμόρφωσης συστήματος Fable 5 που διέρρευσε. Τα δημόσια στοιχεία αποδεικνύουν ότι ο Trim έκανε τον ισχυρισμό, αλλά δεν αποδεικνύει ανεξάρτητα πώς λήφθηκε η προτροπή ή εάν ταίριαζε με τις οδηγίες παραγωγής της Anthropic.

Οι προτροπές συστήματος περιέχουν κρυφές οδηγίες που καθοδηγούν τη συμπεριφορά ενός μοντέλου, ορίζουν περιορισμούς και διαμορφώνουν τον τρόπο με τον οποίο αξιολογεί τα αιτήματα των χρηστών. Η πρόσβαση σε αυτές τις οδηγίες θα μπορούσε να βοηθήσει έναν εισβολέα να σχεδιάσει προτροπές γύρω από γνωστούς κανόνες και περιπτώσεις ακμών.

Ωστόσο, μια προτροπή που διέρρευσε δεν παρέχει πρόσβαση σε βάρη μοντέλων, ιδιωτική υποδομή ή εσωτερικά συστήματα της Anthropic. Οι πάροχοι μπορούν επίσης να επιβάλουν διασφαλίσεις μέσω ταξινομητών, παρακολούθησης λογαριασμών, εκπαίδευσης μοντέλων, στοιχείων ελέγχου API και άλλων επιπέδων πέρα ​​από την προτροπή του συστήματος.

Η τεχνητή νοημοσύνη προχωρά βαθύτερα στις ροές εργασίας κυβερνοεπιθέσεων

Η υπόθεση ταιριάζει με μια ευρύτερη τάση στην οποία οι εγκληματίες του κυβερνοχώρου χρησιμοποιούν την τεχνητή νοημοσύνη για περισσότερα από το να γράφουν μηνύματα ηλεκτρονικού ψαρέματος ή να παράγουν βασικό κώδικα. Τα μοντέλα μπορούν πλέον να βοηθήσουν στην οργάνωση πολλών βημάτων, στην αξιολόγηση της απόδοσης του εργαλείου, στην επιλογή επακόλουθων ενεργειών και στη μετατροπή των τεχνικών αποτελεσμάτων σε αναγνώσιμες αναφορές.

Τον Ιούνιο του 2026,Η Anthropic δημοσίευσε μια ανάλυση832 λογαριασμών που απαγορεύτηκαν για κακόβουλη δραστηριότητα στον κυβερνοχώρο μεταξύ Μαρτίου 2025 και Μαρτίου 2026. Η εταιρεία διαπίστωσε ότι οι επιτιθέμενοι χρησιμοποιούσαν όλο και περισσότερο τεχνητή νοημοσύνη κατά τη διάρκεια μεταγενέστερων και πιο απαιτητικών τεχνικά σταδίων των εργασιών τους.

Η Anthropic είπε ότι 560 από τους λογαριασμούς που εξετάστηκαν, ή το 67,3 τοις εκατό, χρησιμοποιούσαν τεχνητή νοημοσύνη για προετοιμασία που σχετίζεται με κακόβουλο λογισμικό. Διαπίστωσε επίσης ότι 54 λογαριασμοί χρησιμοποίησαν τεχνητή νοημοσύνη για να βοηθήσουν στην πλευρική μετακίνηση μέσα σε παραβιασμένα περιβάλλοντα.

  • Το AI μπορεί να ερμηνεύσει μεγάλους όγκους εξόδου σαρωτή.
  • Τα μοντέλα μπορούν να δώσουν προτεραιότητα σε ευρήματα που φαίνονται πιο πολύτιμα.
  • Τα συστήματα πράκτορα μπορούν να συνδέσουν ξεχωριστά στάδια μιας λειτουργίας.
  • Η αυτοματοποιημένη αναφορά μπορεί να κάνει ευκολότερη την πώληση εγκληματικών υπηρεσιών.
  • Τα εναλλακτικά μοντέλα μπορούν να διατηρήσουν τη ροή εργασιών σε λειτουργία μετά από άρνηση.

Το AI Scaffolding μπορεί να μειώσει τη σημασία της ικανότητας χειριστή

Η αυξανόμενη ανησυχία αφορά την αρχιτεκτονική που βασίζεται σε ένα μοντέλο AI, όχι μόνο την ικανότητα του μοντέλου να απαντά σε μια επιβλαβή προτροπή. Μια πλατφόρμα μπορεί να παρέχει εργαλεία, να αποθηκεύει το περιβάλλον, να εκτελεί εντολές, να εξετάζει τα αποτελέσματα και να αποφασίζει ποιο βήμα θα εκτελεστεί στη συνέχεια.

Anthropic’sέρευνα για τις κυβερνοαπειλέςδιαπίστωσε ότι οι λιγότερο ειδικευμένοι ηθοποιοί στο σύνολο δεδομένων του χρησιμοποιούσαν περίπου 16 διαφορετικές τεχνικές επίθεσης κατά μέσο όρο, σε σύγκριση με περίπου 20 για την πιο εξειδικευμένη ομάδα. Η περιορισμένη διαφορά υποδηλώνει ότι η βοήθεια AI μπορεί να βοηθήσει τους άπειρους χειριστές να εκτελέσουν ένα ευρύτερο φάσμα εργασιών.

Η εταιρεία είπε επίσης ότι οι παράγοντες υψηλότερου κινδύνου δημιουργούν όλο και περισσότερο σκαλωσιές που επιτρέπουν στα μοντέλα να συνδυάζουν πολλά στάδια επίθεσης με περιορισμένη ανθρώπινη συνεισφορά. Το AI Pentest Checker φαίνεται να ακολουθεί αυτό το γενικό μοτίβο συνδέοντας σαρωτές, ανάλυση μοντέλων και δημιουργία αναφορών σε μία ροή εργασίας.

Η Anthropic έχει προηγουμένως διαταράξει την κακόβουλη χρήση του Claude

Η Anthropic έχει τεκμηριώσει περιπτώσεις στις οποίες οι παράγοντες απειλών έκαναν κατάχρηση του Claude για αναγνώριση, ανάπτυξη κακόβουλου λογισμικού, ανάλυση δεδομένων, κλοπή διαπιστευτηρίων και εργασίες που σχετίζονται με εκβιασμό.

Σε παλαιότεροέκθεση πληροφοριών απειλών, η Anthropic περιέγραψε τα μέτρα που έλαβε για τον εντοπισμό καταχρηστικών λογαριασμών, την απαγόρευση παρόχων, τη βελτίωση των ταξινομητών και την κοινή χρήση δεικτών με σχετικούς συνεργάτες.

Αυτά τα μέτρα επιβολής μπορούν να διαταράξουν τη δραστηριότητα στις επίσημες υπηρεσίες. Ωστόσο, οι εγκληματίες ενδέχεται να απαντήσουν εναλλάσσοντας λογαριασμούς, αγοράζοντας μη εξουσιοδοτημένη πρόσβαση στο API, εναλλάσσοντας παρόχους ή εκτελώντας λιγότερο περιορισμένα μοντέλα τοπικά.

Τι πρέπει να κάνουν οι οργανισμοί για τις επιθέσεις που υποβοηθούνται από AI

Οι οργανισμοί δεν μπορούν να εμποδίσουν τους εγκληματίες να πειραματιστούν με την τεχνητή νοημοσύνη, αλλά μπορούν να μειώσουν τον αριθμό των αδυναμιών που μπορούν να βρουν και να εκμεταλλευτούν τα αυτοματοποιημένα εργαλεία.

Οι ομάδες ασφαλείας θα πρέπει να αποθεματοποιούν συνεχώς στοιχεία που αντιμετωπίζουν το Διαδίκτυο, να αφαιρούν τις ξεχασμένες υπηρεσίες, να επιδιορθώνουν γνωστά τρωτά σημεία και να δοκιμάζουν εξωτερικά προσβάσιμες εφαρμογές. Τα εκτεθειμένα διαπιστευτήρια και μυστικά απαιτούν επίσης γρήγορη εναλλαγή.

Οι εταιρείες θα πρέπει να αντιμετωπίζουν την ασυνήθιστη δραστηριότητα σάρωσης, τις επαναλαμβανόμενες προσπάθειες ελέγχου ταυτότητας, την αυτοματοποιημένη ανακάλυψη τελικού σημείου και την ανίχνευση μεγάλου όγκου ως πιθανά σημάδια αναγνώρισης με τη βοήθεια τεχνητής νοημοσύνης.

  1. Διατηρήστε ένα τρέχον απόθεμα δημόσιων τομέων, εφαρμογών, API και στοιχείων cloud.
  2. Επιδιορθώστε τα συστήματα που αντιμετωπίζουν το Διαδίκτυο σύμφωνα με τη δυνατότητα εκμετάλλευσης και την έκθεση.
  3. Απαιτείται έλεγχος ταυτότητας πολλαπλών παραγόντων ανθεκτικό στο phishing για προνομιούχους λογαριασμούς.
  4. Αφαιρέστε μυστικά από δημόσια αποθετήρια και περιστρέψτε αμέσως τα εκτεθειμένα διαπιστευτήρια.
  5. Τελικά σημεία με ευαίσθητα όρια ρυθμού και παρακολούθηση μη φυσιολογικών αυτοματοποιημένων αιτημάτων.
  6. Ελέγξτε τα κλειδιά API για ασυνήθιστες τοποθεσίες, τόμους και μοτίβα χρήσης.
  7. Δοκιμάστε σχέδια αντιμετώπισης περιστατικών έναντι ταχύτερων, μερικώς αυτοματοποιημένων επιθέσεων.

Η υπόθεση Trim δεν δείχνει ότι η τεχνητή νοημοσύνη έχει αντικαταστήσει έμπειρους επιτιθέμενους. Δείχνει ότι τα μοντέλα μπορούν να λειτουργήσουν ως λειτουργικό επίπεδο που συνδέει εργαλεία που ήδη υπάρχουν.

Anthropic’sέρευνες κατάχρησηςκαι τα ευρήματα του Cato υποδεικνύουν ότι οι υπερασπιστές θα πρέπει να σχεδιάζουν επιτιθέμενους που μπορούν να ερευνήσουν, να σαρώσουν, να ερμηνεύσουν και να τεκμηριώσουν πιθανές ευπάθειες πιο γρήγορα από πριν.

Η μείωση των εκτεθειμένων υπηρεσιών, η διόρθωση γνωστών αδυναμιών, η προστασία των διαπιστευτηρίων και ο εντοπισμός της αυτοματοποιημένης αναγνώρισης παραμένουν οι πιο άμεσοι τρόποι περιορισμού της αξίας πλατφορμών όπως το AI Pentest Checker.

FAQ

Τι είναι το AI Pentest Checker;

Το AI Pentest Checker είναι μια αναφερόμενη αυτοματοποιημένη πλατφόρμα σάρωσης ευπάθειας ιστού που προωθείται από έναν ρωσόφωνο παράγοντα απειλών, γνωστό ως Trim. Συνδυάζει μοντέλα AI με συμβατικά εργαλεία αναγνώρισης και δοκιμών ασφαλείας.

Ο Trim χακάρισε τον Anthropic ή τον Claude;

Οι αναφερόμενες μέθοδοι δεν αξιοποίησαν την υποδομή του Anthropic ή τα βάρη του μοντέλου του Claude. Περικοπή φέρεται να χρησιμοποίησε δημιουργημένα μηνύματα προτροπής, εναλλακτικά μοντέλα, τοπικά συστήματα και ένα κλειδί API της γκρι αγοράς για να επιλύσετε τους ελέγχους ασφαλείας.

Ποια εργαλεία χρησιμοποιεί το AI Pentest Checker;

Η Cato Networks ανέφερε ότι η πλατφόρμα ενσωματώνει 14 εργαλεία, συμπεριλαμβανομένων των Nuclei, ffuf, katana, subfinder και Gitleaks. Αυτά τα εργαλεία υποστηρίζουν σάρωση ευπάθειας, ανίχνευση, ανακάλυψη υποτομέα, απαρίθμηση τελικών σημείων και μυστικό εντοπισμό.

Επιβεβαιώθηκε ότι η προτροπή συστήματος Fable 5 είχε διαρρεύσει;

Η Cato Networks ανέφερε ότι ο Trim ισχυρίστηκε ότι χρησιμοποιούσε μια τροποποιημένη προτροπή που προέρχεται από μια διαμόρφωση του Fable 5 που διέρρευσε. Οι δημόσιες αναφορές δεν έχουν εξακριβώσει ανεξάρτητα τον τρόπο με τον οποίο ελήφθη το υλικό ή εάν ανταποκρίνεται στις εντολές παραγωγής της Anthropic.

Γιατί οι πλατφόρμες δοκιμών διείσδυσης που λειτουργούν με τεχνητή νοημοσύνη αποτελούν κίνδυνο για την ασφάλεια;

Μπορούν να συντονίζουν τα εργαλεία σάρωσης, να ερμηνεύουν τα αποτελέσματα, να δίνουν προτεραιότητα σε τρωτά σημεία και να δημιουργούν αναφορές. Αυτός ο αυτοματισμός μπορεί να μειώσει τον χρόνο και την τεχνογνωσία που απαιτούνται για την εκτέλεση σύνθετων επιθετικών εργασιών ασφαλείας.

Πώς μπορούν οι οργανισμοί να αμυνθούν από επιθέσεις που υποβοηθούνται από AI;

Οι οργανισμοί θα πρέπει να μειώσουν την επιφάνεια της δημόσιας επίθεσης τους, να διορθώσουν εκτεθειμένα συστήματα, να χρησιμοποιήσουν πιστοποίηση πολλαπλών παραγόντων ανθεκτικό στο phishing, να περιστρέψουν τα παραβιασμένα διαπιστευτήρια, να προστατεύσουν τα κλειδιά API και να παρακολουθούν για αυτοματοποιημένη αναγνώριση και ασυνήθιστη δραστηριότητα σάρωσης.