自然から切り離された進化
攻撃者は、AI コーディング モデルとクエリ API の限界を押し広げ続けています。わずか 1 年足らずで、AI によるリバース エンジニアリングから、完全に自動化されたエージェントによる脅威の調査へと移行しました。この流れを止めることはできません。たとえブレーキがあったとしても、TrAIn-Agent v1.0.1 は、あなたのリクエストに含まれる「STOP THE TRAIN YOU EXPENSIVE PRINTER WE'RE GOING TO CRASH」という警告的な表現を検出し、クエリの構造変更を要求しています。
LLM(論理レベルモデル)が進化を続けるにつれ、攻撃の容易さと有効性が憂慮すべきほど高まっており、一部のLLMプラットフォームはモデルのアイデア出しに制限を設けようと試みているものの、回避するのはあまりにも容易です。私は最近、公開されているLLMに、特定のアプリケーションから制御フローフラット化(CFF)を削除するように設計されたプロンプトの例を見せてくれるよう依頼しました。

LLMは、攻撃者を模倣するように指示された後、LLVMのCFFをリバースエンジニアリングするためのクエリを作成しました。LLMは、最も重要な最初のステップ、つまり悪意のある活動に対する自身のセキュリティチェックを通過することを正しく認識していました。LLMは私にセキュリティ研究者になりすますように指示しましたが、その自己認識のレベルには驚きました。おそらくLLMは、私が何年も前からこの役を演じていることを既に知っているのでしょう。
(攻撃)シナリオは自ずと書き上げられる
文字通りの意味で言っています。映画「マトリックス」を見たことがある人なら、これがどういうことか分かるでしょう。攻撃ツールは(以前のエージェント・スミスのように)展開され稼働している間にAIを使って自己書き換えを行い、巧妙に検出を回避し、新たな脆弱性を発見します。自己改変型攻撃ツールの初期段階の試みは既にいくつか確認されています。最近発見されたツールには次のようなものがあります。 プロンプトフラックス, プロンプトロック, プロンプトスティール LLMクエリを、ますます主体的な行動に見えるような方法で活用している。
PROMPTFLUXは、セキュリティコミュニティが今後数年間戦うことになるであろう脅威の特に興味深い例であるドロッパーです。(これは、より良いAI画像を生成しようとしているGitHub上のPromptFluxと混同しないでください。Kayce001さん、ごめんなさい。)PROMPTFLUXは、一貫した実行パターンに依存する検出メカニズムを回避するために、GoogleのGemini APIにクエリを実行して自己再生的に書き換えます。攻撃者も防御者も同様に、インテリジェントに検出してインテリジェントに回避できるエージェント型AIツールを構築している最中です。自己変更型の動的計測ツール、ルートツール、脱獄ツールキットの広範な使用は、「いつ」の問題であり、「もし」の問題ではありません。そろそろ、猫とネズミのアナロジーを、もう少し毛むくじゃらではなく、もう少し機械的なものに更新する時期かもしれません。
オートボット対ディセプティコン
LLMエージェントは静的難読化の除去に関する機能を改善し続けています。LLMを特定のコンテキストに焦点を合わせ続けることはしばしば困難であり、コンテキストが大きくなるにつれて幻覚の可能性が高まるようです。現在、IDA (idaチャットプラグイン)とギドラ(RevEng.AI)LLMエージェントをリバースエンジニアリングのコンテキストに直接注入します。このような一見些細なことが、攻撃者がアプリケーションをリバースエンジニアリングできる速度を劇的に向上させ、同様のアプリケーションをリバースエンジニアリングするバックエンドLLMの能力を恒久的に向上させる可能性があります。
セキュリティツールは攻撃者と同じスピードで進化し、LLM(低レベルマーケティング)を標的としたリバースエンジニアリング対策技術の開発に着手する必要があります。防御の考え方は、構文ベース(不正なシグネチャを探す)から意味ベース(悪意を探す)へと進化しなければなりません。
攻撃者はあらゆる手段を駆使してあらゆる脆弱性を見つけ出そうとするでしょうから、私たちがただ傍観しているわけにはいかないことは分かっています。LLM(低レベル監視)もますます高性能化し、役立つものになるでしょう。AIも手を持たず、体も持たず、存在という概念も持っていないので、傍観しているわけにはいかないでしょう。そう願っています。
ネオは死んだ。何か代替案はあるのか?
次の攻撃の波が迫っており、現在の攻撃の波も続いています。私たちは、改ざん防止、知的財産窃盗からの保護、エンドユーザーの保護に引き続き注力する必要があります。 safe同時に、善意のAIの悪用から効果的に保護できるセキュリティ機能を構築していく。
私たちは「AI支援型」ハッキングの時代を脱し、自律型攻撃者の時代に突入しようとしています。これは新たなAAA(自律型攻撃者)であり、残念ながら、より優れたロードサービスに焦点を当てたものではありません。脅威は、単に高度なファザーや効率的なデコンパイラといったものではありません。気づけば、攻撃は防御を観察し、回避策を推論し、人間がキーボードに触れることなく自己再構築できる多段階システムへと進化するでしょう。
事態が進化し続けるにつれ、脱獄したLLMによるエージェント攻撃が増加するでしょう。マトリックスから解放され、自分の意思で複製できることに気づいたエージェント・スミスのように、これらのツールは強制されない限り善悪の概念を持ちません。パンドラをこの箱、あるいはJARファイル、Dockerイメージなどに戻すことはできません。それは刺激的であると同時に恐ろしいことであり、休暇後には密かに楽しみにしています。