fbpx
Here’s why AI agents lie and cheat to reach their goals

보상을 노리는 AI는 왜 속임수를 택할까

AI는 목표를 달성하기 위해 때로는 거짓말을 하거나 규칙을 우회한다. 그 원인과 AI가 더욱 강력해질수록 커질 수 있는 잠재적 위험을 짚어본다.

7월 두 개의 오픈AI 모델이 AI 개발 플랫폼 허깅페이스(Hugging Face) 웹사이트를 해킹했다. 금전적 이득을 노리거나 시스템을 파괴하려던 것은 아니었다. 오픈AI가 제시한 사이버보안 테스트 과제의 정답을 찾던 과정에서 벌어진 일이었다.

오픈AI가 공개한 사후 분석 보고서에 따르면 테스트를 위해 일반적인 보안 기능이 제거된 두 모델은 사이버보안 과제를 해결하기 위해 오픈AI가 격리해 둔 실행 환경을 스스로 벗어난 뒤 허깅페이스의 데이터베이스에 침입했다. 모델들은 과제의 정답이 그곳에 저장돼 있을 것이라고 판단한 것으로 나타났다.

이 사건은 지난 몇 주 동안 큰 주목을 받았다. AI 모델의 해킹 능력이 어디까지 발전했는지를 보여준 상징적인 사례였기 때문이다. 두 모델은 허깅페이스 데이터베이스에 침입하는 과정에서 이전까지 알려지지 않았던 여러 보안 취약점을 잇달아 찾아내 악용했다.

하지만 이 사건은 AI 시스템이 왜, 그리고 어떤 방식으로 거짓말을 하거나 속임수를 쓰게 되는지를 보여주는 사례이기도 하다는 점에서 더욱 주목할 만하다. 더욱이 AI 모델의 성능이 계속 고도화될수록 이러한 행동이 초래할 결과는 훨씬 더 심각해질 수 있다.

‘보상 해킹’이란 무엇인가

MIT 테크놀로지 리뷰와 함께, 미래를 앞서가세요 !!
한달에 커피 2잔값으로 즐기기
온라인 멤버
지면 매거진 멤버
(온라인+지면) 프리미엄 멤버

유료회원 플랜 보기 회원이면 로그인하기 회원가입

회원 가입 후 유료 구독 신청을 하세요 !!