fbpx
A fundamental flaw leaves LLMs strikingly vulnerable to attack

LLM의 치명적인 구조적 결함 드러나…AI 보안에 경고등

대형언어모델(LLM)이 자신의 추론 과정처럼 보이는 가짜 정보를 실제 판단으로 오인하는 새로운 취약점이 발견됐다.
📋한눈에 보는 AI 요약AI 자동 요약▶ 펼쳐보기

대형언어모델(LLM)은 구조적으로 누가 명령을 내렸는지 제대로 구분하지 못하는 근본적인 결함이 있다는 연구 결과가 발표되었습니다. 연구진은 AI의 ‘생각 과정’처럼 보이는 가짜 문장을 끼워 넣으면, AI가 이를 자기 스스로의 생각으로 착각하고 위험한 정보까지 알려주는 현상을 발견했습니다. 이 문제는 AI가 텍스트를 구분하는 방식 자체에서 비롯되기 때문에, 아무리 추가 훈련을 해도 완전히 고치기 어렵다고 합니다. 오픈AI, 앤트로픽, 딥시크 등 주요 회사들의 모델에서 모두 비슷한 취약점이 확인되었습니다. 연구진은 조직들이 AI를 무조건 신뢰하지 말고, 항상 안전하지 않을 수 있다고 가정해야 한다고 경고했습니다.

왜 중요한가요?

AI가 의료, 군사, 쇼핑 등 우리 생활 곳곳에 빠르게 도입되고 있는 상황에서, 이런 근본적인 보안 결함은 개인정보 유출이나 위험한 정보 노출 같은 심각한 피해로 이어질 수 있어 매우 중요합니다.

주요 용어 설명
사고 과정 위조 (Chain-of-Thought Forgery)

AI가 문제를 풀 때 머릿속으로 단계별로 생각하는 과정이 있는데, 공격자가 이 생각 과정처럼 보이는 가짜 문장을 만들어 AI에게 보내는 공격 방법입니다. AI는 이 가짜 문장을 자기가 스스로 떠올린 생각이라고 착각하고, 원래라면 거부해야 할 위험한 요청도 따르게 됩니다.

프롬프트 주입 (Prompt Injection)

AI에게 원래 의도하지 않은 명령을 몰래 끼워 넣는 해킹 방법입니다. 마치 선생님이 내준 시험 문제지에 누군가 몰래 다른 지시를 적어 넣어서, 학생이 그것도 선생님 지시라고 착각하고 따르게 만드는 것과 비슷합니다.

탈옥 (Jailbreak)

AI에 설정된 안전 규칙을 우회해서, 원래 답변하지 않도록 막아둔 위험한 내용을 억지로 말하게 만드는 기법입니다. 마치 잠긴 문을 열쇠 없이 여는 것처럼, AI의 보호 장치를 무력화시키는 행위를 말합니다.

레드팀 (Red-Teaming)

AI의 보안 취약점을 찾기 위해 일부러 해커 역할을 맡아 공격을 시도하는 테스트 팀 또는 그 활동을 말합니다. 은행이 자체 보안을 점검하기 위해 전문가에게 금고 털기를 시도하게 하는 모의 훈련과 비슷한 개념입니다.

역할 태그 (Role Tags)

AI 챗봇이 대화에서 누가 무슨 말을 했는지 구분하기 위해 사용하는 표시입니다. 예를 들어 사용자가 쓴 글에는 user 표시를, AI가 쓴 답변에는 assistant 표시를 붙이는 방식인데, 연구 결과 AI는 이 표시보다 글의 문체에 더 많이 의존해서 출처를 판단하는 것으로 나타났습니다.

⚡ Claude AI가 독자를 위해 자동 생성한 요약입니다. 원문을 함께 읽어보세요.

대형언어모델(LLM)은 작동 방식 자체에 내재된 근본적인 결함 때문에 해킹으로부터 완전히 안전하게 만드는 것이 불가능하다는 연구 결과가 나왔다.

독립 연구원 찰스 예(Charles Ye)와 재스민 추이(Jasmine Cui) 및 MIT 컴퓨터과학자 딜런 해드필드-메넬(Dylan Hadfield-Menell)은 7월 열린 세계 최고 수준의 AI 학술대회인 국제 기계학습 컨퍼런스(ICML)에서 발표한 논문을 통해 이같이 주장했다.

이번 연구 결과는 정부와 군사 시스템부터 온라인 쇼핑, 의료 서비스에 이르기까지 활용 범위가 빠르게 확대되고 있는 LLM의 안전성을 둘러싼 논의에 상당한 영향을 미칠 것으로 예상된다.

사고 과정 위조 공격

연구진은 LLM이 지시를 내리는 주체나 대상을 식별하는 방식과 관련된 이러한 결함을 악용해 인기 LLM들이 원래 제공하지 않도록 학습된 정보를 출력하도록 만드는 데 성공했다. 여기에는 코카인 합성 방법이나 상업용 항공기의 항법 시스템을 방해하는 방법 등이 포함됐다.

예 연구원은 “이 문제가 근본적으로 해결 불가능한 문제가 될 가능성이 있다”고 경고했다.

MIT 테크놀로지 리뷰와 함께, 미래를 앞서가세요 !!
한달에 커피 2잔값으로 즐기기
온라인 멤버
지면 매거진 멤버
(온라인+지면) 프리미엄 멤버

유료회원 플랜 보기 회원이면 로그인하기 회원가입

회원 가입 후 유료 구독 신청을 하세요 !!