영상 생성 모델에 '대상 영속성' 가르치는 WROP 데이터셋 공개
서던캘리포니아대, 카네기멜런대, 존스홉킨스대 등 여러 대학 연구진이 영상 생성 모델의 '대상 영속성(object permanence)'과 '고체성(object solidity)' 문제를 다루는 WROP를 공개했습니다. 150개의 Blender 생성기로 만든 150만 개 학습 데이터와 300문항 평가 시험, 그리고 이 데이터로 학습시킨 160억 파라미터 모델 PWM-WROP를 함께 내놓았습니다.
1/가려진 물건이 순간이동하는 영상 생성 모델의 약점
Sora, Veo 3.1, Kling 2.6 같은 영상 생성 모델은 사실적이고 시간적으로 일관된 영상을 만들어내면서 세계를 시뮬레이션하는 '월드 모델' 후보로 주목받고 있습니다. 하지만 연구진은 이런 모델들이 물체가 가림막 뒤로 사라졌다가 엉뚱한 위치에서 다시 나타나거나, 단단한 장벽을 그냥 뚫고 지나가는 오류를 반복한다고 지적합니다. 사람은 생후 3.5개월이면 가려진 물체가 계속 존재한다는 것을 인식하고, 생후 6개월 안에 물체가 단단한 벽을 통과할 수 없다는 것도 알아챕니다. 연구진은 이 두 능력이 이후의 물리적 추론을 떠받치는 가장 기초적인 인지 능력이라고 설명하며, 영상 생성 모델이 이 부분에서 실패하면 그 위의 장면 구성이나 인과 추론도 함께 무너질 수 있다고 봅니다.
2/150개의 Blender 생성기로 만든 6가지 과제
WROP는 Blender로 만든 150개의 과제 생성기를 대상 영속성(OP) 3종과 고체성(OS) 3종, 총 6개 과제군으로 나눠 구성했습니다. OP 과제군은 물체가 가림막이나 용기 뒤로 사라졌다가 위치·정체성이 그대로 유지된 채 다시 나타나야 하는지를 보고, OS 과제군은 물체가 장벽을 통과할 수 있는지, 지지대가 사라지면 떨어지는지, 충돌 후 경로가 물리적으로 맞는지를 봅니다. 각 생성기는 조명·카메라 각도·속도 같은 배경 요소는 무작위로 바꾸면서도 과제의 핵심 구조는 그대로 유지해, 생성기당 1만 개씩 총 150만 개의 학습 샘플을 만들었습니다. 모든 영상은 120프레임(1280×720, 24fps)이며 핵심 사건이 일어나는 지점을 기준으로 앞 60프레임(입력)과 뒤 60프레임(정답)으로 나뉩니다.
3/PWM-WROP, 연속 생성 모델 중 1위·전체 3위
연구진은 WROP 데이터로 160억 파라미터 모델 PWM-WROP를 학습시킨 뒤, 참조 영상 기반 3종·편집 기반 7종·연속 생성 4종 등 총 14개 영상 생성 모델과 함께 300문항 시험으로 비교했습니다. 20명의 평가자가 쌍대 비교로 판정한 Bradley-Terry 방식 Elo 점수에서 PWM-WROP는 1679.5점으로 연속 생성 모델 중 1위, 전체로는 3위를 기록했습니다. 1위 자리는 상용 참조 영상 기반 모델 두 개가 1723.6점으로 통계적 동률을 이뤘습니다. 논문은 PWM-WROP가 320×192라는 낮은 해상도로 이 순위를 달성했으며, 동일 해상도 기준으로는 LPIPS와 MS-SSIM 두 자동 평가 지표에서 가장 좋은 점수를 받았다고 밝혔습니다.
4/비교 대상보다 훨씬 낮은 해상도
논문은 PWM-WROP의 출력 해상도가 320×192로, 비교 대상인 경쟁 시스템들의 720p·1080p 출력보다 훨씬 낮다는 점을 스스로 명시했습니다. 즉 순위 비교는 해상도가 다른 모델들 사이에서 이뤄졌고, 같은 조건(matched resolution)에서의 비교는 LPIPS·MS-SSIM 두 지표에 한정됩니다.
5/물리적 상식을 데이터로 가르칠 수 있다는 확인AMEET 해석
이번 공개는 영상 생성 모델이 갖춰야 할 기초적인 물리 인식 능력을 사람의 발달심리학 실험 설계를 빌려 정량적으로 재현했다는 점에서 의미가 있습니다. 아울러 대상 영속성 같은 능력을 별도 학습 데이터로 훈련시켜 개선할 수 있음을 보여준 셈이어서, 앞으로 월드 모델을 표방하는 영상 생성 모델들이 벤치마크로 삼을 만한 기준점이 될 수 있습니다.