Genie
Genie는 Google DeepMind가 개발한 인터랙티브 월드 모델 계열입니다. 텍스트나 이미지를 받아 사용자가 실시간으로 조작하며 돌아다닐 수 있는 환경을 생성합니다. 영상을 만드는 데서 멈추지 않고 그 안에서 행동할 수 있게 한 점이 일반 비디오 생성 모델과 갈리는 지점입니다.
잠재 행동 모델
Genie 계열의 핵심 기법입니다. 인터넷 영상에는 조작 라벨이 없습니다. 어떤 입력이 어떤 장면 변화를 만들었는지 아무도 기록해 두지 않았습니다. 조작 가능한 환경을 학습하려면 행동 정보가 필요한데, 대규모 영상 데이터에는 그게 빠져 있습니다.
Genie는 연속한 두 프레임 사이의 변화에서 행동에 해당하는 잠재 변수를 비지도로 추론합니다. 라벨 없는 영상만으로 조작 가능한 세계를 만들 수 있게 한 이 접근이 생성형 월드 모델 계열을 열었습니다.
버전
버전 |
시점 |
사양 |
|---|---|---|
Genie 1 |
2024년 3월 |
2D, 초당 1프레임 |
Genie 2 |
2024년 12월 |
3D 360p, 10~20초 분량 |
Genie 3 |
2025년 8월 |
720p 24fps 실시간, 약 1분 지속성 |
Genie 3는 Google Street View 데이터를 활용한 실제 거리 환경 생성도 지원합니다. 2026년 1월 29일 Project Genie라는 이름으로 Google Labs를 통해 AI Ultra 구독자에게 웹 인터페이스가 열렸으며, 세계 탐험은 60초로 제한됩니다.
한계
지속성이 1분 수준이라는 건 그 이상에서는 일관성이 무너진다는 뜻입니다. 시야에서 벗어난 물체가 돌아왔을 때 그대로인지, 긴 시간 뒤에도 같은 공간인지가 아직 안정적이지 않습니다.
폐루프 벤치마크인 WorldRoamBench에서 Genie 3는 1인칭 종합 최고점, 3인칭 2위를 기록했습니다. 다만 이 벤치마크에 붙은 10개 이상 모델 중 행동 충실도, 시각 드리프트, 물리 타당성, 기억 네 축을 모두 만족하는 모델은 없었고 최고 성적도 중간 수준입니다.
경쟁 계열로는 World Labs의 Marble, NVIDIA의 Cosmos가 있습니다.