fbpx
A fundamental flaw leaves LLMs strikingly vulnerable to attack

LLM의 치명적인 구조적 결함 드러나…AI 보안에 경고등

대형언어모델(LLM)이 자신의 추론 과정처럼 보이는 가짜 정보를 실제 판단으로 오인하는 새로운 취약점이 발견됐다.

대형언어모델(LLM)은 작동 방식 자체에 내재된 근본적인 결함 때문에 해킹으로부터 완전히 안전하게 만드는 것이 불가능하다는 연구 결과가 나왔다.

독립 연구원 찰스 예(Charles Ye)와 재스민 추이(Jasmine Cui) 및 MIT 컴퓨터과학자 딜런 해드필드-메넬(Dylan Hadfield-Menell)은 7월 열린 세계 최고 수준의 AI 학술대회인 국제 기계학습 컨퍼런스(ICML)에서 발표한 논문을 통해 이같이 주장했다.

이번 연구 결과는 정부와 군사 시스템부터 온라인 쇼핑, 의료 서비스에 이르기까지 활용 범위가 빠르게 확대되고 있는 LLM의 안전성을 둘러싼 논의에 상당한 영향을 미칠 것으로 예상된다.

사고 과정 위조 공격

연구진은 LLM이 지시를 내리는 주체나 대상을 식별하는 방식과 관련된 이러한 결함을 악용해 인기 LLM들이 원래 제공하지 않도록 학습된 정보를 출력하도록 만드는 데 성공했다. 여기에는 코카인 합성 방법이나 상업용 항공기의 항법 시스템을 방해하는 방법 등이 포함됐다.

예 연구원은 “이 문제가 근본적으로 해결 불가능한 문제가 될 가능성이 있다”고 경고했다.

MIT 테크놀로지 리뷰와 함께, 미래를 앞서가세요 !!
한달에 커피 2잔값으로 즐기기
온라인 멤버
지면 매거진 멤버
(온라인+지면) 프리미엄 멤버

유료회원 플랜 보기 회원이면 로그인하기 회원가입

회원 가입 후 유료 구독 신청을 하세요 !!