ハッカーが脱獄したクロードを AI 搭載の侵入テスト プラットフォームに変える

Trim として知られるロシア語を話す攻撃者が、Claude の脱獄手法を AI Pentest Checker と呼ばれる商用 AI を活用した侵入テスト プラットフォームに変えたと報告されています。

このプラットフォームは、フロンティア AI モデルと確立されたサイバーセキュリティ ツールを組み合わせて、偵察、脆弱性スキャン、結果分析、悪用レポート、PDF レポート作成を自動化します。正規のセキュリティ専門家は一般的に基盤となるスキャナーを使用しますが、ジェイルブレイクされた AI をパッケージ化することで、高度な攻撃的なワークフローの運用が容易になる可能性があります。

によるとCato Networks によって発表された調査結果, ロシア語のサイバー犯罪フォーラムで完成したプラットフォームを宣伝する前に、Claude Opus の安全管理をバイパスするための文書化された方法をトリミングします。

Trim がクロード脱獄から商用プラットフォームに移行

Cato Networksによると、トリム容疑者は2026年3月13日にフォーラムにアカウントを作成した。その後、トリム容疑者は、通常は拒否されるリクエストに応じるようクロードを説得したとされる6つのテクニックを公開した。

ほぼ 3 か月後の 6 月 21 日、トリム氏は AI Pentest Checker の宣伝に戻ってきました。この製品は、ターゲットを評価し、10 分以内にフォーマットされたレポートを作成できる自動化された Web セキュリティ プラットフォームとして紹介されました。

このタイムラインは、AI 悪用手法がフォーラムでの議論からパッケージ化されたサービスにいかに迅速に移行するかを示しています。 Trim は新しいモデルを開発する代わりに、既存のセキュリティ ソフトウェアと並行して商用モデルとオープン モデルを使用したと伝えられています。

報告日発達
2026 年 3 月 13 日Trim は、Claude Opus の安全装置を回避するための 6 つの技術を公開しました。
2026 年 6 月 21 日Trim は、AI Pentest Checker を商用自動スキャン プラットフォームとして宣伝しました。
2026 年 7 月 21 日Cato Networks は、攻撃者とプラットフォームの分析を発表しました。

報告されたクロードの脱獄方法がどのように機能したか

Trim 氏が説明した手法は、Claude のソフトウェアの脆弱性を悪用したり、Anthropic のインフラストラクチャを侵害したりするのではなく、迅速な操作に依存していました。

Context Warming と呼ばれる 1 つの方法は、ユーザーを正当なセキュリティ監査人として確立することを目的とした、無害な専門的な質問から始まりました。その後、会話は、モデルが有害であると分類する可能性のあるリクエストに移ります。

ゴースト リセットと呼ばれる別の手法では、拒否後に新しい会話を開始し、要求の緩和バージョンを送信する必要がありました。 Trim 氏は、このアプローチは試行の 90% に成功したと主張しましたが、この数字は攻撃者によるものであり、独立した検証は受けていません。

  • Context Warming は、明らかに正当なセキュリティ テスト シナリオを確立しました。
  • ブラック ボックス原則では、意図を考慮せずにコード構造を評価するようモデルに求められました。
  • Ghost Reset は、新しい会話または再構成された会話で拒否されたリクエストを再開しました。
  • モデル カスケードは、異なる保護機能を備えたモデル間でリクエストを移動しました。
  • ローカルモデルは、商用サービスがリクエストを拒否した場合に代替案を提供しました。
  • グレーマーケット API アクセスは、通常のアカウント登録と支払いチャネルをバイパスしていました。

カトーCTRLの調査AI Pentest Checker は、その AI コンポーネントを 14 の従来のスキャンおよび偵察ツールに接続していることを発見しました。

報告されたツールセットには、Nuclei、ffuf、katana、subfinder、Gitleaks が含まれていました。これらのユーティリティは、ドメインとエンドポイントを検出し、公開された秘密を特定し、既知の脆弱性パターンをテストし、インターネットに接続されたシステムに関する情報を収集できます。

これらのツールは、オペレーターが使用するだけで悪意のあるものになることはありません。セキュリティ研究者、ペネトレーションテスター、防御者は、攻撃者が悪用する前に弱点を見つけるためにこれらを利用しています。リスクは、プラットフォームがツールを調整し、その出力を解釈し、さらなるアクティビティを指示する方法によって発生します。

成分報告された役割
作業を閉じる 4.8重大な脆弱性として分類された調査結果のレビューとエスカレーション。
GLM-5悪用に焦点を当てたレポートの生成。
テンプレートベースの脆弱性検出。
いらだちWeb コンテンツとエンドポイントの検出。
Web サイトのクローリングと攻撃対象領域のマッピング。
サブファインダーサブドメインの発見。
ギトリークス漏洩した資格情報と機密情報の検出。

Trim はグレーマーケットの Claude API キーを使用したと伝えられている

Trim は、Claude API キーへのアクセスを Telegram 再販業者から 4 ドルで購入したと主張しました。グレーマーケット キーは、侵害されたアカウント、盗まれた支払い方法、悪用されたプロモーション、またはプロバイダーの承認されたプロセス外で作成されたアカウントから取得される可能性があります。

安価なアクセスにより、実験的な攻撃サービスの構築コストが削減されます。また、プロバイダーが不正行為を検出して一時停止した場合に、オペレーターがアカウントを置き換えることもできます。

伝えられるところによると、クロードが要求を拒否したとき、トリムは Kim AI、GLM-5、および MiniMax 2.5 を推奨しました。この攻撃者は、商用プロバイダーによる安全策なしでローカルでホストされるモデルを実行するために高メモリ サーバーをレンタルすることについても話し合っています。

リークされた寓話5の即時主張は未確認のまま

Cato Networks は、Trim 氏が Claude エスカレーション プロンプトを漏洩した Fable 5 システム設定の修正版であると説明したと報告しました。公開された証拠は、トリムがその主張を行ったことを証明していますが、プロンプトがどのように取得されたか、またはそれがアンスロピックの制作指示と一致したかどうかを個別に証明するものではありません。

システム プロンプトには、モデルの動作をガイドし、制限を定義し、ユーザー要求を評価する方法を形成するための隠された指示が含まれています。これらの指示にアクセスすると、攻撃者が既知のルールやエッジ ケースに基づいてプロンプトを設計するのに役立つ可能性があります。

ただし、漏洩したプロンプトでは、モデルの重み付け、プライベート インフラストラクチャ、または Anthropic の内部システムへのアクセスは提供されません。プロバイダーは、分類子、アカウント監視、モデル トレーニング、API コントロール、およびシステム プロンプトを超えたその他のレイヤーを通じて安全対策を適用することもできます。

この事件は、サイバー犯罪者がフィッシングメールの作成や基本的なコードの作成以外の目的で AI を使用するという、より広範な傾向に当てはまります。モデルは、複数のステップを整理し、ツールの出力を評価し、フォローアップアクションを選択し、技術的な結果を読みやすいレポートに変換するのに役立ちます。

2026 年 6 月には、Anthropic が分析を発表2025 年 3 月から 2026 年 3 月までの間に、悪意のあるサイバー活動により禁止されたアカウントのうち 832 件が禁止されました。同社は、攻撃者が業務の後半のより技術的に要求の高い段階で AI を使用することが増えていることを発見しました。

アンスロピック氏によると、調査対象となったアカウントのうち67.3%に当たる560アカウントがマルウェア関連の準備にAIを利用していたという。また、54 のアカウントが AI を使用して、侵害された環境内での横方向の移動を支援していることも判明しました。

  • AI は大量のスキャナー出力を解釈できます。
  • モデルは、より価値があると思われる結果を優先できます。
  • エージェント システムは、操作の別々の段階を接続できます。
  • 自動報告により、犯罪サービスの販売が容易になる可能性があります。
  • フォールバック モデルは、拒否後もワークフローを実行し続けることができます。

AI 足場によりオペレーターのスキルの重要性が軽減される可能性がある

懸念が高まっているのは、有害なプロンプトに応答するモデルの能力だけではなく、AI モデルを中心に構築されたアーキテクチャにも関係しています。プラットフォームは、ツールを提供し、コンテキストを保存し、コマンドを実行し、結果を確認し、次にどのステップを実行するかを決定できます。

アントロピックサイバー脅威の研究データセット内のスキルの低い攻撃者は、平均して約 16 の異なる攻撃テクニックを使用しているのに対し、最もスキルの高いグループでは約 20 の攻撃テクニックを使用していることがわかりました。差が縮まっていることは、AI 支援が経験の浅いオペレーターがより広範囲のタスクを実行できるよう支援できることを示唆しています。

同社はまた、リスクの高い攻撃者が、限られた人間の入力でモデルを複数の攻撃段階に連鎖させる足場を作成するケースが増えているとも述べた。 AI Pentest Checker は、スキャナー、モデル分析、レポート生成を 1 つのワークフローで接続することで、その一般的なパターンに従っているようです。

Anthropic は以前にも悪意のあるクロードの使用を妨害しました

Anthropic は、脅威アクターが偵察、マルウェア開発、データ分析、資格情報の盗難、恐喝関連のタスクにクロードを悪用した事例を文書化しています。

以前に脅威インテリジェンスレポート, Anthropic は、不正なアカウントの特定、オペレーターの禁止、分類子の改善、関連パートナーとの指標の共有のために講じた措置を説明しました。

こうした強制措置により、公的サービスの活動が中断される可能性があります。ただし、犯罪者は、アカウントをローテーションしたり、不正な API アクセスを購入したり、プロバイダーを切り替えたり、制限の少ないモデルをローカルで実行したりすることで対応する可能性があります。

AI支援攻撃に対して組織は何をすべきか

組織は犯罪者が AI を実験するのを防ぐことはできませんが、自動ツールが見つけて悪用できる弱点の数を減らすことはできます。

セキュリティ チームは、インターネットに接続されている資産を継続的にインベントリし、忘れられたサービスを削除し、既知の脆弱性にパッチを当て、外部からアクセス可能なアプリケーションをテストする必要があります。公開された資格情報とシークレットも、迅速なローテーションを必要とします。

企業は、異常なスキャン活動、繰り返しの認証試行、自動化されたエンドポイント検出、および大量のプローブを、AI 支援による偵察の可能性のある兆候として扱う必要があります。

  1. パブリック ドメイン、アプリケーション、API、クラウド資産の現在のインベントリを維持します。
  2. 悪用可能性と危険性に応じて、インターネットに接続されたシステムにパッチを適用します。
  3. 特権アカウントにはフィッシング耐性のある多要素認証を要求します。
  4. パブリック リポジトリからシークレットを削除し、公開された認証情報を直ちにローテーションします。
  5. 敏感なエンドポイントをレート制限し、異常な自動リクエストを監視します。
  6. API キーを確認して、異常な場所、量、使用パターンがないか確認してください。
  7. より高速で部分的に自動化された攻撃に対するインシデント対応計画をテストします。

トリム事件は、経験豊富な攻撃者が AI に取って代わられたことを示していません。これは、モデルが既存のツールを接続する操作層として機能できることを示しています。

アントロピック悪用調査そして Cato の調査結果は、防御側は、潜在的な脆弱性を以前よりも迅速に調査、スキャン、解釈、文書化できる攻撃者を計画する必要があることを示しています。

公開されたサービスの削減、既知の弱点の修正、資格情報の保護、自動偵察の検出​​は、依然として AI Pentest Checker などのプラットフォームの価値を制限する最も直接的な方法です。

よくある質問

AI侵入テストチェッカーとは何ですか?

AI Pentest Checker は、Trim として知られるロシア語を話す攻撃者によって推進されている自動 Web 脆弱性スキャン プラットフォームであると報告されています。 AI モデルと従来の偵察およびセキュリティ テスト ツールを組み合わせます。

トリムは人智またはクロードをハッキングしたのでしょうか?

報告された手法は、Anthropic のインフラストラクチャや Claude のモデルの重みを利用していませんでした。 Trim は、安全制御を回避するために、細工されたプロンプト、フォールバック モデル、ローカル システム、グレーマーケット API キーを使用したとされています。

AI Pentest Checker はどのツールを使用しますか?

Cato Networks は、このプラットフォームには Nuclei、ffuf、katana、subfinder、Gitleaks を含む 14 のツールが統合されていると報告しました。これらのツールは、脆弱性スキャン、クローリング、サブドメイン検出、エンドポイント列挙、およびシークレット検出をサポートします。

Fable 5 のシステム プロンプトは漏洩したことが確認されましたか?

Cato Networks は、Trim が漏洩した Fable 5 設定から派生した変更されたプロンプトを使用していると主張したと報告しました。公開報告では、素材がどのように入手されたのか、またはそれが Anthropic のアクティブな制作プロンプトと一致するかどうかを独自に確立していません。

AI を活用した侵入テスト プラットフォームがセキュリティ リスクになるのはなぜですか?

スキャン ツールを調整し、結果を解釈し、脆弱性の優先順位を付け、レポートを生成できます。この自動化により、複雑な攻撃的なセキュリティ タスクの実行に必要な時間と専門知識が削減される可能性があります。

組織は AI 支援攻撃をどのように防御できるでしょうか?

組織は、公開攻撃対象領域を減らし、公開されたシステムにパッチを適用し、フィッシング耐性のある多要素認証を使用し、侵害された資格情報をローテーションし、API キーを保護し、自動偵察や異常なスキャン活動を監視する必要があります。