fbpx
Kids outlearn AI—and we still don’t know why

AI는 왜 아이처럼 언어를 배우지 못할까

LLM은 언어를 배우는 데 아이보다 훨씬 많은 데이터가 필요하다. 그 이유를 밝혀내면 더 효율적인 모델을 만들 수 있을 뿐 아니라, 발달하는 아이의 마음도 더 깊이 이해할 수 있다.

우리가 아는 한 인류는 적어도 10만 년 동안 서로 대화를 나눠왔다. 그리고 그 오랜 시간 동안 인간의 언어를 완벽하게 익힐 수 있는 존재는 세상에 단 하나뿐이었다. 바로 인간의 아이다.

하지만 이제는 둘이 됐다.

챗GPT가 출시된 지 불과 4년 만에 우리는 스마트폰이나 컴퓨터와 자연스럽게 대화하는 일을 당연하게 여기게 됐다. 클로드, 딥시크, 오픈AI의 GPT 계열 모델 같은 대형언어모델(LLM)은 사람처럼 보일 만큼 유창하고 유연하게 대화한다. 하지만 학습 과정을 들여다보면 문제가 하나 있다. 컴퓨터에 인간의 언어를 가르치려면 사람이 언어를 배우는 데 필요한 양보다 훨씬 많은 데이터가 필요하다. LLM이 학습하면서 처리하는 단어는 사람이 모국어를 익히는 동안 접하는 단어의 10만 배에 달한다. 아이가 언어를 본격적으로 익히기 시작하는 첫돌 무렵까지 듣는 단어와 비교하면 격차는 훨씬 더 크다.

스탠퍼드 대학교의 인지과학자 마이클 C. 프랭크(Michael C. Frank)는 LLM을 두고 “최근의 발전은 놀랍다”면서도 “아이들은 거실에서 1년 만에 이런 도약을 이뤄내지만, AI는 숲 하나를 통째로 태우고 인류의 지식을 모조리 긁어모아야 겨우 같은 지점에 도달한다”고 말했다.

아이와 기계 사이의 이 거대한 간극을 ‘데이터 효율성 격차(data efficiency gap)’라고 부른다. 이는 인지과학자에게는 흥미로운 질문을, AI 모델 설계자에게는 풀어야 할 과제를 던진다. 아이들은 어떻게 지금까지 만들어진 가장 정교한 언어 기계보다도 여전히 뛰어난 걸까?

MIT 테크놀로지 리뷰와 함께, 미래를 앞서가세요 !!
한달에 커피 2잔값으로 즐기기
온라인 멤버
지면 매거진 멤버
(온라인+지면) 프리미엄 멤버

유료회원 플랜 보기 회원이면 로그인하기 회원가입

회원 가입 후 유료 구독 신청을 하세요 !!