Skip to main content
  • Home
  • 글로벌 테크
  • “LLM 다음은 월드모델” 3D 세계 구현 기술 확보한 AMD, ‘현실 세계 학습’으로 AI 시장 판도 재편 승부수

“LLM 다음은 월드모델” 3D 세계 구현 기술 확보한 AMD, ‘현실 세계 학습’으로 AI 시장 판도 재편 승부수

Picture

Member for

1 year 11 months
Real name
김민정
Position
기자
Bio
[email protected]

오늘 꼭 알아야 할 소식을 전합니다. 빠르게 전하되, 그 전에 천천히 읽겠습니다. 핵심만을 파고들되, 그 전에 넓게 보겠습니다.

수정

월드랩스 인수로 공간 이해 기술 확보, AI 사업 기반 확대
칩에 모델·소프트웨어 결합, 로봇·자율주행용 시스템 개발 추진
로봇 훈련부터 자율주행 검증까지, 현실 세계로 넓어지는 AI 활용

미국 반도체 기업 AMD가 월드랩스를 인수하며 ‘월드모델(world model)’ 경쟁에 뛰어들었다. 사물의 움직임과 공간을 이해하고 행동의 결과를 예측하는 인공지능(AI) 기술을 확보해 로봇·자율주행 등으로 사업 기반을 넓히려는 구상이다. 월드모델은 영상과 센서 자료로 현실의 물리적 관계를 학습하고, 이를 가상 환경에 재현하는 데 쓰인다. 로봇과 차량이 실제로 움직이기 전 여러 동작을 시험하고 실패 원인을 파악해 동작을 개선할 수 있어 현장 투입에 필요한 학습과 검증의 수단으로 주목받고 있다.

AMD, 82억 달러에 월드랩스 인수

28일(현지시간) 블룸버그통신 등에 따르면 AMD와 월드랩스는 이날 82억 달러(약 11조1,290억원) 규모의 인수 계약을 체결했다고 밝혔다. 전액 주식으로 이뤄지는 이번 거래는 규제당국의 승인을 거쳐 올해 말까지 마무리될 예정이다. 이번 인수로 월드랩스 창업자이자 최고경영자(CEO)인 페이페이 리(Fei-Fei Li) 교수는 AMD의 수석부사장(EVP) 겸 수석과학자(Chief Scientist)로 합류해 리사 수 AMD CEO에게 직접 보고한다.

월드랩스는 AI가 현실 세계를 이해하고 구현할 수 있도록 하는 월드모델을 개발하는 업체다. 3차원 환경을 생성하고 재구성하는 기술을 통해 로봇 운용과 과학 연구, 공장 설비 등에 AI를 활용하는 것을 목표로 한다. 2024년 설립됐으며 현재 직원은 약 70명이다. 수 CEO는 블룸버그TV 인터뷰에서 “엔드투엔드(end-to-end)를 더 많이 이해할수록 더 나은 시스템을 만들 수 있다”며 “페이페이가 구성한 세계적 수준의 인재들과 AMD의 하드웨어·소프트웨어·시스템 역량을 결합하기 위해 월드랩스를 인수하는 것”이라고 설명했다.

이번 거래는 AMD가 엔비디아와의 경쟁 범위를 AI 가속기 자체에서 AI 시스템 전체로 확대하고 있다는 점에서 주목된다. 엔비디아는 그래픽처리장치(GPU)뿐 아니라 소프트웨어와 네트워킹, AI 모델 등을 묶어 고객이 데이터센터를 빠르게 구축할 수 있도록 하는 전략으로 AI 시장에서 압도적인 지위를 구축해 왔다. AMD 역시 데이터센터 고객에게 AI 모델과 소프트웨어를 함께 제공하는 방향으로 사업 영역을 넓히고 있다. 특히 리 교수와 연구진의 합류는 차세대 AI 하드웨어 설계에도 힘을 보탤 전망이다. AI 모델의 발전 방향과 연산 수요를 직접 파악하면 이에 맞춰 칩과 시스템을 설계하는 데 유리하다.

월드모델의 출발점, 시각·기억·제어

월드모델 개념은 2018년 데이비드 하(David Ha)와 위르겐 슈미트후버(Jürgen Schmidhuber)가 발표한 논문에서 처음 체계화됐다. 이들이 제시한 구조는 시각·기억·제어로 이뤄진 ‘V-M-C’ 모델이다. 시각 단계에서는 이미지·영상 등 입력 데이터를 그대로 저장하는 대신 핵심 특징만 추출해 압축한다. 인간이 모든 장면을 사진처럼 기억하지 않고, 중요한 정보만 추상화하는 방식과 유사하다.

월드모델의 핵심 기능은 주변 환경을 바탕으로 특정 행동 이후에 벌어질 상황을 예측하는 데 있다. 영상과 센서 자료 등에서 물체의 위치와 움직임, 상호작용을 학습해 다음 상태를 추정하는 방식이다. 로봇이 탁자 위 물건을 집는 상황을 예로 들면, 손을 어느 방향으로 뻗었을 때 물체에 닿고 이후 물체가 어떻게 움직일지를 미리 계산하는 데 쓰인다. 이때 물체 사이의 거리와 접촉에 따른 변화가 주요 판단 근거다. 예측 결과는 로봇의 행동 계획을 세우거나 여러 동작의 성공 가능성을 검토하는 데 활용할 수 있다. 로봇 학습 분야에서는 이 같은 기능을 훈련 자료 생성과 성능 평가에 접목하는 연구도 진행 중이다.

월드랩스가 선보인 ‘마블(Marble)’은 이 가운데 사람이 이동하며 살펴볼 수 있는 3차원 공간을 만드는 기능을 구체화한 제품이다. 지난해 11월 공개된 마블에는 글과 사진, 영상, 대략적인 공간 배치 등을 입력할 수 있다. 이용자가 원하는 장면을 제시하면 AI가 이를 바탕으로 공간을 구성하고, 세부 모습을 수정하거나 주변 영역을 추가하는 방식으로 작업이 이어진다. 여러 공간을 하나로 연결하고 완성된 결과물을 다른 제작 도구로 옮기는 기능도 갖췄다. 활용 사례로는 영화 촬영 전 장면 구성과 카메라 동선을 검토하거나 건축·인테리어 설계안을 입체적으로 살펴보는 작업이 꼽힌다. 리 교수는 파이낸셜타임스(FT) 인터뷰에서 시각효과 제작자와 건축·인테리어 디자이너 등이 마블을 활용하고 있다고 설명했다.

표1. 월드모델의 기능과 월드랩스의 활용 사례

구분핵심 기능활용 사례
월드모델물체의 위치·움직임·상호작용을 학습해 행동 이후의 상태 예측로봇의 행동 계획 수립과 동작별 성공 가능성 검토
마블(Marble)글·사진·영상 등을 바탕으로 이동하며 살펴볼 수 있는 3차원 공간 생성·수정영화 장면과 카메라 동선 검토, 건축·인테리어 설계안 확인
로봇 가상 훈련로봇과 사물의 상호작용을 가상 환경에 재구성하고 작업 조건 변경·반복 시험실제 장비의 반복 가동과 작업 실패에 따른 파손 부담 경감
실제 로봇 검증가상 환경에서 훈련한 제어 모델을 실제 로봇에 적용해 성능 비교물건 상자에 담기, 전선 옮기기, 시험관 배치 등
자료: 월드랩스, 파이낸셜타임스(FT)

가상 환경에서 학습한 제어 모델, 실제 로봇 성능 검증

이렇게 만든 가상 공간은 로봇의 학습과 성능 검증에도 활용된다. 실제 현장에서 로봇을 반복 가동해 데이터를 모으려면 장비와 인력이 필요하고, 작업 실패에 따른 파손 위험도 감수해야 해서다. 월드랩스가 지난 7월 공개한 연구도 로봇과 주변 사물, 센서, 작업 시범을 기록한 뒤 이를 상호작용이 가능한 가상 환경으로 재구성하는 데 초점을 맞췄다. 가상 환경을 구축한 뒤 물체의 배치와 조명, 작업 속도 등을 바꿔가며 다양한 조건에서 동작을 시험하도록 했다. 이 과정에서 로봇이 특정 작업에 실패하면 같은 상황을 반복 재현하며 동작을 보완할 수 있다는 게 회사 측 설명이다.

월드랩스는 가상 환경에서 익힌 동작을 실제 로봇에 적용한 결과도 함께 공개했다. 대표적인 사례는 두 팔로 물건을 상자에 담는 작업이다. 회사 측에 따르면 가상 환경에서만 훈련한 제어 모델을 실제 로봇에 탑재해 해당 작업을 수행하도록 했으며, 조명을 바꾼 조건에서도 동작을 시험했다. 적용 대상에는 전선을 잡아 옮기거나 시험관을 집어 정해진 위치에 놓는 정밀 작업도 포함됐다. 이 중 일부 작업에서는 로봇이 사람의 개입 없이 한 시간 동안 자율 작동하기도 했다. 아울러 월드랩스는 가상 환경과 실제 장비에서 같은 제어 모델을 시험해 성능 평가 결과를 비교했다. 그 결과 가상 시험에서 성능이 좋았던 모델이 실제 로봇에서도 우수한 성적을 보였고, 작업에 성공하거나 실패하는 조건 역시 유사한 것으로 나타났다.

거리·방향·움직임 판단, 현실 작동의 필수 조건

이 같은 공간 이해 능력은 로봇과 자율주행차를 실제 현장에 투입하기 위한 기본 요건이다. 사람이 생활하는 공간에서는 사물의 크기와 배치에 따라 기계가 움직일 수 있는 범위도 달라진다. 실제 로봇이 가구 사이를 지나 물건을 옮기는 작업만 해도 통로 폭이 몸체보다 넓은지, 목적지에 물건을 내려놓을 자리가 있는지부터 파악해야 한다. 나아가 이동 중 몸체가 회전하거나 팔을 뻗을 때 주변 사물과 부딪힐 가능성도 고려 대상이다. 사람의 지시를 수행할 때는 공간을 바라보는 위치까지 판단에 영향을 미치기 때문이다. 가령 ‘왼쪽에 놓으라’는 지시를 받았을 때 사람과 로봇이 마주 보고 있다면 누구를 기준으로 삼느냐에 따라 놓을 자리가 달라지는 식이다. 엔비디아 연구진이 개발한 ‘로보스페이셜(RoboSpatial)’에도 물체를 놓을 공간이 충분한지, 관찰 위치에 따라 사물 간 방향 관계가 어떻게 달라지는지 판단하는 과제가 포함됐다.

자율주행에서는 이러한 공간 정보에 주변 차량과 보행자의 움직임까지 더해진다. 차량 간 간격과 장애물의 위치가 시시각각 바뀌는 도로에서 안전한 경로를 확보하려면 거리와 속도, 이동 방향을 함께 판단해야 하는 만큼 연산도 복잡해질 수밖에 없다. 웨이모가 지난 2월 공개한 자체 월드모델도 이런 주행 상황을 가상 환경에서 재현하도록 설계됐다. 카메라 영상과 함께 레이저로 주변 사물까지의 거리를 측정하는 라이다 데이터도 생성하는 방식이다. 이를 통해 도로와 장애물의 입체적인 배치를 반영하고, 차량이 경로를 바꿨을 때 맞닥뜨릴 상황을 시험할 수 있다는 게 회사 측 설명이다. 실제 공개된 사례에는 역주행 차량을 피하거나 좁은 길을 통과하는 장면이 담겼다. 개발자가 도로 배치와 다른 차량의 움직임을 조정하는 기능도 갖췄으며, 눈과 안개 등 기상 조건을 바꾼 시험도 가능하다.

LLM 이후 기술 경쟁, 공간 이해·행동 계획 부상

월드모델이 주목받는 이유는 분명하다. 대규모언어모델(LLM) 중심 AI로는 인간 수준의 추론과 계획 능력에 도달하기 어렵다는 인식이 확산하고 있기 때문이다. AI 분야 세계적 석학 얀 르쿤(Yann LeCun) 뉴욕대 교수는 “앞으로 3~5년 안에 LLM은 구식 기술이 되고, 물리적 세계를 이해하는 월드모델이 주류가 될 것”이라고 단언했다. 그는 “현재 AI는 물리적 세계를 이해하는 측면에서 우리 집 고양이보다도 덜 똑똑하다”고 지적했다.

르쿤 교수의 비판은 데이터의 성격 차이에서 비롯된다. LLM은 인터넷에 존재하는 방대한 텍스트를 학습했지만, 아이가 놀이를 통해 자연스럽게 익히는 물리적 경험과는 본질적으로 다르다. 아이는 공을 굴려보며 ‘놓으면 떨어진다’는 인과관계를 체득하지만, LLM은 그 움직임을 설명하는 문장만 학습한다. 이 차이가 로봇·자율주행·제조 자동화 같은 영역에서 결정적 한계로 작용한다는 게 전문가들의 공통된 견해다.

이에 글로벌 빅테크도 월드모델의 성능 개선과 활용 확대에 속도를 내고 있다. 메타는 올해 3월 영상 기반 모델 ‘V-JEPA 2’의 후속작인 ‘V-JEPA 2.1’을 공개했다. 영상 속 사물의 세부 특징과 시간에 따른 변화를 정밀하게 학습하도록 설계를 보완한 모델이다. 연구진은 논문에서 실제 로봇의 물체 잡기 성공률이 기존 ‘V-JEPA 2-AC’보다 20%포인트 높아졌다고 밝혔다. 기존 모델의 로봇 실험도 대규모 영상과 로봇 작동 데이터를 미리 학습한 뒤, 새로 투입된 환경에서 별도 데이터를 수집하지 않고 작업을 수행한 결과다. 구글은 올해 1월 ‘지니 3’를 기반으로 가상 공간을 만들고 탐색하는 ‘프로젝트 지니’를 미국 유료 구독자에게 공개한 데 이어, 5월에는 제공 지역을 확대하고 스트리트 뷰 연동 기능을 추가했다. 실제 장소의 이미지를 토대로 사용자가 이동할 수 있는 가상 환경을 구성하는 방식으로, 현재도 세부 표현과 정확도를 개선하는 연구용 서비스로 운영 중이다.

Picture

Member for

1 year 11 months
Real name
김민정
Position
기자
Bio
[email protected]

오늘 꼭 알아야 할 소식을 전합니다. 빠르게 전하되, 그 전에 천천히 읽겠습니다. 핵심만을 파고들되, 그 전에 넓게 보겠습니다.