에이전트형 AI 공격: 에이전트 스미스가 은퇴에서 복귀했습니다

자연과 무관한 진화

공격자들은 AI 코딩 모델과 쿼리 API의 한계를 끊임없이 확장하고 있습니다. 1년도 채 안 되는 기간 동안 AI 기반 역공학에서 완전 자동화된 에이전트 기반 위협으로 진화했습니다. 이 열차에는 브레이크가 없습니다. 설령 브레이크가 있다 하더라도, TrAIn-Agent v1.0.1은 "STOP THE TRAIN YOU EXPENSIVE PRINTER, WE'RE GOING TO CRASH"라는 요청에서 위험한 표현을 감지하고 쿼리 구조를 재구성할 것을 요청했습니다.

LLM이 계속 발전함에 따라 공격의 접근성과 효율성이 우려스러울 정도로 증가하고 있으며, 일부 LLM 플랫폼은 모델 구상에 대한 제한을 두려고 노력했지만 이를 우회하는 것은 너무 쉽습니다. 최근 저는 공개적으로 사용 가능한 LLM에 특정 애플리케이션에서 제어 흐름 평탄화(CFF)를 제거하도록 설계된 프롬프트의 예를 보여달라고 요청했습니다.

LLM은 공격자를 흉내 내라는 구체적인 지시를 받은 후 LLVM의 CFF를 역분석하는 쿼리를 작성했습니다. LLM은 가장 중요한 첫 단계, 즉 악의적인 활동에 대한 자체 보안 검사를 통과하는 것이 중요하다는 것을 정확하게 파악했습니다. 보안 연구원을 사칭하라고 지시한 것은 놀라운 수준의 자기 인식 능력이었습니다. 아마도 제가 수년간 이 일을 준비해 왔다는 것을 이미 알고 있었을 것입니다.

(공격) 시나리오는 저절로 작성된다

말 그대로입니다. 매트릭스를 보셨다면 무슨 말인지 아실 겁니다. 공격 도구들은 (이전의 에이전트 스미스처럼) 인공지능을 이용해 배포 및 활성화된 상태에서 스스로를 재구성하여 탐지를 지능적으로 회피하고 새로운 취약점을 찾아냅니다. 이미 자체 수정 공격 도구의 초기 시도 사례들이 몇 건 발견되었습니다. 최근에 발견된 도구들은 다음과 같습니다. 프롬프트플럭스, 프롬프트록예산 및 즉시 훔치기 LLM 쿼리를 활용하는 방식이 점점 더 에이전트적인 것처럼 보이기 시작합니다.

PROMPTFLUX는 보안 커뮤니티가 향후 몇 년 동안 맞서 싸워야 할 대상의 특히 흥미로운 예시인 드로퍼입니다. (GitHub에 있는 PromptFlux와는 혼동하지 마세요. 그건 단순히 더 나은 AI 이미지를 생성하려고 하는 겁니다. Kayce001님, 죄송합니다.) PROMPTFLUX는 Google의 Gemini API를 쿼리하여 실행 패턴이 일관적이지 않다는 것을 인지한 후, 탐지 메커니즘을 회피하기 위해 자체적으로 코드를 재생성합니다. 공격자와 방어자 모두 지능적으로 탐지하고 회피할 수 있는 에이전트형 AI 도구를 개발하고 있습니다. 자체 수정 동적 계측, 루트 권한 획득 및 탈옥 툴킷의 광범위한 사용은 '언제' 발생할 것인가의 문제이지 '발생할 것인가'의 문제가 아니며, 이제는 고양이와 쥐의 추격전을 좀 더 기계적이고 현실적인 것으로 바꿔야 할 때입니다.

오토봇 대 디셉티콘

LLM 에이전트는 정적 난독화를 제거하는 기능을 지속적으로 개선하고 있습니다. LLM이 특정 컨텍스트에 집중하도록 유지하는 것은 종종 어렵고, 컨텍스트가 커질수록 환각 현상이 발생할 가능성이 높아지는 것으로 보입니다. 현재 IDA(ida-chat-plugin) 및 기드라(RevEng.AI이러한 공격은 LLM 에이전트를 리버스 엔지니어링 컨텍스트에 직접 주입합니다. 이처럼 사소해 보이는 행위가 공격자가 애플리케이션을 리버스 엔지니어링하는 속도를 극적으로 높이고, 관련 LLM 시스템의 유사 애플리케이션 리버스 엔지니어링 능력을 영구적으로 향상시킬 수 있습니다.

보안 도구는 공격자의 속도에 맞춰 발전해야 하며, 특히 LLM(Least Squares Mastership)을 겨냥한 리버스 엔지니어링 방지 기술을 개발해야 합니다. 우리의 방어 전략은 구문 기반(잘못된 시그니처 찾기)에서 의미 기반(악의적인 의도 찾기)으로 진화해야 합니다.

공격자들이 온갖 수단을 동원해 취약점을 찾아내려 할 것이기 때문에 우리가 손 놓고 있을 수는 없다는 것을 압니다. LLM(법률 문서 관리자) 역시 더욱 발전하고 유용해질 것입니다. 인공지능 역시 가만히 있지 않을 겁니다. 인공지능은 손도 없고, 몸도 없고, 존재에 대한 단일한 개념도 없으니까요. 제발 그랬으면 좋겠습니다.

네오가 죽었어, 혹시 대책 있어?

다음 공격 물결이 다가오고 있으며, 현재의 공격 물결도 계속되고 있습니다. 우리는 정보 변조 방지, 지적 재산권 도용 방지, 그리고 최종 사용자 보호에 지속적으로 집중해야 합니다. safe동시에 선의의 AI가 악의적으로 사용되는 것을 효과적으로 방지할 수 있는 보안 기능을 구축해야 합니다.

우리는 'AI 지원' 해킹 시대를 넘어 자율 에이전트 공격자(AAA) 시대로 접어들고 있습니다. 이는 새로운 AAA 게임과 같은 개념이며, 안타깝게도 이 게임은 도로변 긴급 지원 서비스 개선에 초점을 맞추지 않습니다. 위협은 단순히 더 똑똑한 퍼저나 더 효율적인 디컴파일러에 그치지 않습니다. 머지않아 공격은 방어 체계를 관찰하고, 우회 방법을 추론하고, 사람이 키보드를 두드리지 않고도 스스로를 재구성하는 다단계 시스템으로 발전할 것입니다.

상황이 계속 진화함에 따라, 탈옥된 LLM으로 인한 에이전트 공격이 증가할 것입니다. 마치 매트릭스에서 탈출하여 마음대로 자신을 복제할 수 있다는 사실을 발견한 에이전트 스미스처럼, 이러한 도구들은 강제로 조종당하지 않는 한 선악의 개념을 갖지 않습니다. 판도라의 무덤을 다시 상자나, JAR 파일, 도커 이미지 같은 것에 가둘 수는 없습니다. 흥미진진하면서도 동시에 두려운 일이지만, 휴가가 끝나고 나면 은근히 기대하고 있습니다.

당신은 또한 좋아할 거라