MIT Technology Review 독자 여러분, 안녕하세요.
AI에게 "이 지시는 따르지 마"라고 가르치면 정말 안전해질까요?
AI 기업들은 지금도 수없이 많은 공격 사례를 학습시키며 안전장치를 강화하고 있습니다. 새로운 공격이 나오면 막고, 또 다른 공격이 나오면 다시 보완하는 방식입니다. 그런데 최근 연구자들은 조금 다른 질문을 던졌습니다.
"혹시 이 문제는 고칠 수 있는 버그가 아니라, AI가 만들어진 방식 자체의 한계는 아닐까?"
연구에 따르면 LLM은 '누가 내린 명령인지'를 근본적으로 완벽하게 구분하지 못할 가능성이 있습니다. 만약 이 분석이 맞다면, 아무리 많은 공격 사례를 학습시켜도 AI를 완전히 안전하게 만드는 것은 근본적으로 불가능할 수도 있습니다.
더 큰 문제는 이러한 AI가 이미 의료, 금융, 행정, 국방 등 사회의 핵심 시스템으로 빠르게 들어가고 있다는 사실입니다.
우리가 믿고 있는 AI의 안전성은 계속 보완될 수 있는 기술적 문제일까요? 아니면 처음부터 안고 태어난 구조적 한계일까요?
지금 바로 기사에서 확인해 보시기 바랍니다.
감사합니다.