생성형 AI 경쟁이 언어 모델을 넘어 실제 환경을 이해하고 예측하는 ‘월드 모델’ 분야로 확장되고 있다. 최근 메타는 새로운 월드 모델 ‘V-JEPA 2’를 공개하며, 로봇과 자율주행차 등 물리적 세계와 상호작용하는 AI의 진화에 불을 지폈다. V-JEPA 2는 100만 시간 이상의 영상과 100만 개 이미지를 학습한 12억 매개변수 모델로, 물리적 직관과 미래 예측 능력을 갖췄다. 이 모델은 로봇이 처음 접하는 환경에서도 사물을 조작하고, 행동 결과를 예측하며, 단계별로 계획을 세울 수 있게 한다.

이미지: 메타
메타는 V-JEPA 2를 오픈소스로 공개하고, 연구자들이 실제 환경에서 AI의 예측 및 계획 능력을 평가할 수 있도록 3가지 벤치마크도 함께 제시했다. 얀 르쿤 메타 수석 AI 과학자는 “월드 모델이 로봇공학의 새로운 시대를 열 것”이라며, 방대한 실세계 데이터를 수집하지 않고도 현실 세계에서 AI가 물리적 작업을 수행할 수 있게 될 것이라고 밝혔다. 이 같은 월드 모델 경쟁은 구글, 엔비디아 등 빅테크 전반으로 확산되고 있다. 
이미지 출처: VentureBeat with Gemini
구글은 올해 I/O에서 ‘제미니 2.5 프로’와 ‘AI 에이전트’ 프레임워크를 선보이며, AI가 실제 세계를 시뮬레이션하고 계획을 세우는 능력을 강조했다. 제미니는 영상, 음성, 실세계 데이터 등 멀티모달 정보를 통합해 복잡한 물리 환경에서 목표를 달성할 수 있도록 설계됐다. 엔비디아도 ‘코스모스 월드 파운데이션 모델’을 통해 합성 비디오와 실제 환경 데이터를 결합, 로봇과 자율주행차의 학습 효율을 높이고 있다. 월드 모델은 제조, 물류, 자율주행, 디지털 트윈 등 산업 전반에서 AI의 활용 범위를 크게 넓힐 전망이다. 실제 환경의 움직임과 변화를 이해하고 예측하는 AI의 등장은, 단순 챗봇이나 텍스트 생성 AI를 넘어, 인간처럼 사고하고 행동하는 차세대 인공지능 시대의 서막을 알리고 있다.
|
생성형 AI 경쟁이 언어 모델을 넘어 실제 환경을 이해하고 예측하는 ‘월드 모델’ 분야로 확장되고 있다. 최근 메타는 새로운 월드 모델 ‘V-JEPA 2’를 공개하며, 로봇과 자율주행차 등 물리적 세계와 상호작용하는 AI의 진화에 불을 지폈다.
V-JEPA 2는 100만 시간 이상의 영상과 100만 개 이미지를 학습한 12억 매개변수 모델로, 물리적 직관과 미래 예측 능력을 갖췄다. 이 모델은 로봇이 처음 접하는 환경에서도 사물을 조작하고, 행동 결과를 예측하며, 단계별로 계획을 세울 수 있게 한다.
이미지: 메타
메타는 V-JEPA 2를 오픈소스로 공개하고, 연구자들이 실제 환경에서 AI의 예측 및 계획 능력을 평가할 수 있도록 3가지 벤치마크도 함께 제시했다. 얀 르쿤 메타 수석 AI 과학자는 “월드 모델이 로봇공학의 새로운 시대를 열 것”이라며, 방대한 실세계 데이터를 수집하지 않고도 현실 세계에서 AI가 물리적 작업을 수행할 수 있게 될 것이라고 밝혔다.
이 같은 월드 모델 경쟁은 구글, 엔비디아 등 빅테크 전반으로 확산되고 있다.
이미지 출처: VentureBeat with Gemini
구글은 올해 I/O에서 ‘제미니 2.5 프로’와 ‘AI 에이전트’ 프레임워크를 선보이며, AI가 실제 세계를 시뮬레이션하고 계획을 세우는 능력을 강조했다. 제미니는 영상, 음성, 실세계 데이터 등 멀티모달 정보를 통합해 복잡한 물리 환경에서 목표를 달성할 수 있도록 설계됐다. 엔비디아도 ‘코스모스 월드 파운데이션 모델’을 통해 합성 비디오와 실제 환경 데이터를 결합, 로봇과 자율주행차의 학습 효율을 높이고 있다.
월드 모델은 제조, 물류, 자율주행, 디지털 트윈 등 산업 전반에서 AI의 활용 범위를 크게 넓힐 전망이다. 실제 환경의 움직임과 변화를 이해하고 예측하는 AI의 등장은, 단순 챗봇이나 텍스트 생성 AI를 넘어, 인간처럼 사고하고 행동하는 차세대 인공지능 시대의 서막을 알리고 있다.