fbpx

[인터뷰] AI는 왜 아직 보드게임판을 읽지 못하는가

AI는 고난도 수학과 코딩에서 인간 상위권에 올랐지만, 눈앞의 공간과 형태를 읽는 능력은 유아 수준에 머물러 있다. 구글에서 14년간 언어모델의 토대를 닦은 후 엘로리안 AI를 창업한 앤드류 다이는 이 간극을 메우는 데 설계와 제조, 로봇 산업의 향방이 걸려 있다고 말한다.
📋한눈에 보는 AI 요약AI 자동 요약▶ 펼쳐보기

AI는 글을 읽고 수학 문제를 풀거나 코드를 짜는 능력은 뛰어나지만, 사진 속 물체의 개수를 세거나 위치를 파악하는 시각적 능력은 아직 많이 부족합니다. 구글 딥마인드 출신의 앤드루 다이 CEO는 보드게임판 사진을 AI에 보여줬을 때 말의 개수조차 제대로 세지 못하는 것을 보고, 시각적 추론 전문 회사 엘로리안을 창업했습니다. 엘로리안은 AI가 생각하는 도중에 직접 그림을 그리고 수정하며 추론하는 ‘시각적 생각의 사슬’이라는 새로운 방식을 개발하고 있습니다. 이 기술이 성공하면 건축 설계, 로봇, 영상 분석 등 눈으로 보고 판단해야 하는 수많은 산업에 AI가 본격적으로 적용될 수 있습니다. 회사는 올해 4분기에 외부 개발자용 API를 공개할 계획입니다.

왜 중요한가요?

우리 주변의 많은 직업은 도면 확인, 작물 상태 관찰, 영상 분석처럼 눈으로 보고 판단하는 일인데, AI의 시각 능력이 향상되면 이런 작업이 훨씬 빠르고 정확해져서 설계·제조·농업·의료 등 일상 곳곳이 크게 달라질 수 있기 때문입니다.

주요 용어 설명
시각적 생각의 사슬 (Visual Chain of Thought)

사람이 어려운 문제를 풀 때 종이에 그림을 그려가며 생각하는 것처럼, AI도 추론 과정에서 직접 이미지를 그리고 수정하면서 답을 찾아가는 방식입니다. 기존 AI는 글과 코드로만 생각했지만, 이 방식은 그림까지 활용해 공간적인 문제를 더 잘 풀 수 있도록 합니다.

사전학습 (Pre-training)

AI가 특정 과제를 배우기 전에, 먼저 방대한 양의 데이터를 읽으며 기본적인 지식과 패턴을 익히는 과정입니다. 마치 학생이 시험 공부를 하기 전에 먼저 교과서 전체를 훑어보며 기초를 다지는 것과 비슷합니다. 이렇게 기초를 쌓으면 이후 세부 과제를 더 잘 수행할 수 있습니다.

합성 데이터 (Synthetic Data)

실제로 촬영하거나 수집한 것이 아니라, 컴퓨터 프로그램으로 인공적으로 만들어낸 학습용 데이터입니다. 예를 들어 건축 도면이나 위성사진처럼 구하기 어려운 자료를 가상으로 생성하는 것입니다. 다만 현실의 복잡함을 완벽히 담지 못할 수 있다는 한계가 있습니다.

멀티모달 파운데이션 모델 (Multimodal Foundation Model)

글, 이미지, 소리 등 여러 종류의 정보를 동시에 이해하고 처리할 수 있는 대규모 AI 모델입니다. 사람이 눈으로 보고, 귀로 듣고, 글을 읽으며 종합적으로 판단하는 것처럼, 다양한 형태의 데이터를 함께 다룰 수 있도록 설계된 기반 모델입니다.

울퉁불퉁한 경계선 (Jagged Frontier)

AI가 체스나 코딩처럼 어떤 분야에서는 사람을 뛰어넘으면서도, 사진 속 물건 세기처럼 다른 분야에서는 아이 수준에 머무는 불균형한 능력 발전 현상을 비유한 표현입니다. 마치 산등성이처럼 높은 봉우리와 깊은 골짜기가 공존하는 모습에 빗댄 것입니다.

⚡ Claude AI가 독자를 위해 자동 생성한 요약입니다. 원문을 함께 읽어보세요.

AI가 넘어야 할 다음 벽은 ‘더 잘 읽는 것’이 아니라 ‘보고 판단하는 것’이다. 인터넷의 텍스트를 읽으며 성장한 AI는 수학 올림피아드 문제를 풀고 사람보다 빠르게 코드를 쓰는 수준에 이르렀다. 그러나 사진에서 물체의 개수와 위치, 거리, 앞뒤 관계를 파악하는 능력은 그 수준에 한참 못 미친다. 올해 국제 머신러닝 학회 ICLR에서 노스웨스턴대와 스탠퍼드대, 워싱턴대, 코넬대 공동 연구팀이 발표한 ‘시어리 오브 스페이스(Theory of Space)’ 실험은 주어진 이미지를 해석할 때 뛰어났던 주요 AI 모델들이 가상 공간을 능동적으로 탐색할 때 성능이 떨어지는 모습을 여과 없이 보여줬다. 환경이 바뀐 뒤에도 모델들은 앞서 내린 판단을 바로잡지 못했다.

원인은 모델이 추론하는 방식에 있었다. 앤드루 다이 CEO는 오늘날 AI가 이미지를 입력받더라도, 답을 찾아가는 명시적 추론은 여전히 텍스트와 코드로만 하기 때문이라고 판단했다. 도면의 치수나 부품이 맞물리는 구조처럼 말로 다 표현되지 않는 정보는 이 과정에서 사라진다. 설계와 제조, 로봇 산업에 AI가 아직 깊이 들어가지 못한 이유다.

MIT 테크놀로지 리뷰와 함께, 미래를 앞서가세요 !!
한달에 커피 2잔값으로 즐기기
온라인 멤버
지면 매거진 멤버
(온라인+지면) 프리미엄 멤버

유료회원 플랜 보기 회원이면 로그인하기 회원가입

회원 가입 후 유료 구독 신청을 하세요 !!