AMEET MEDIA|AMEET SPOT|AMEET TOON
AMEET MEDIA
오피셜
Hugging Face 인기 논문논문발표 2026.09.24 09:00 (KST)

알리바바, 월드모델 통합 평가 벤치마크 HappyWorld-Bench 발표

알리바바 Token Hub 등이 참여한 연구진이 비디오·공간·임바디드(로봇) 월드모델을 하나의 기준으로 평가하는 벤치마크 HappyWorld-Bench를 공개했습니다. W1부터 W6까지 여섯 단계의 능력 체계를 정의하고, 14개 비디오 모델, 9개 공간 모델, 8개 임바디드 모델을 같은 틀 안에서 테스트했습니다.

  1. 1/흩어져 있던 월드모델 평가 기준을 하나로

    월드모델은 에이전트가 행동하기 전에 미래 상황을 내부적으로 시뮬레이션하는 표현을 뜻합니다. 논문은 기존 벤치마크들이 통제성, 물리적 타당성, 기억, 상호작용, 장기 일관성 등을 각각 따로 평가해왔다고 지적합니다. 비디오 월드모델, 공간 월드모델, 임바디드 월드모델은 서로 다른 평가 체계를 써왔기 때문에, 어떤 모델이 반복된 변화 속에서도 믿을 만한 상태를 유지하는지 비교하기 어려웠다고 설명합니다.

  2. 2/W1~W6 여섯 단계와 세 개의 평가 트랙

    연구진은 월드모델 능력을 W1(지각적 세계)부터 W6(보편적 세계)까지 여섯 단계로 정의했습니다. W1은 시각 입력을 일관된 세계 표현으로 구성하는 단계, W2는 행동에 따른 상태 변화를 시뮬레이션하는 단계, W3는 장기 상호작용에서도 공간 구조와 객체 정체성을 유지하는 단계, W4는 객체·사건·규칙에 명시적으로 개입할 수 있는 단계, W5는 여러 에이전트가 공유하는 확장 가능한 세계, W6는 생성·시뮬레이션·계획을 하나로 통합한 단계입니다. 이 틀을 비디오 월드모델, 공간 월드모델, 임바디드 월드모델 세 트랙에 각각 적용하고, HappyWorld-Arena라는 플랫폼에서 사람이 모델 출력을 A/B로 비교해 Elo 점수를 매기는 동시에 자동 지표로 세부 능력을 측정했습니다.

  3. 3/최고 모델도 상태 유지에서는 한계

    비디오 트랙은 1,138개 프롬프트로 W1~W5 능력을 평가했고, 상위 두 시스템은 Arena Elo 1263점과 1206점을 기록했습니다. 공간 트랙은 300개 장면(시각 품질·물리적 사용성·일관성·편집 평가용 266개, 공간 확장 평가용 34개)으로 9개 공간 시스템을 테스트했고, 임바디드 트랙은 단일 동작·다단계 시퀀스·동작 쌍을 아우르는 254개 테스트 케이스로 8개 후보 모델을 평가했습니다. 세 트랙을 합치면 총 1,692개의 트랙별 평가 인스턴스입니다. 논문은 가장 강한 비디오 모델조차 일관된 세계 상태를 유지하고 행동·개입에 맞는 반응을 만드는 데 한계가 있었다고 밝혔습니다.

  4. 4/공간모델의 물리적 타당성, 임바디드 모델의 다단계 상태 유지가 약점

    논문은 공간 월드모델들이 물리적 타당성, 편집, 장면 확장에서 성능이 낮았다고 밝혔습니다. 임바디드 월드모델은 여러 단계에 걸친 동작에서 상태를 유지하고, 변경된 동작 조건이나 물리 법칙에 정확히 반응하는 데 어려움을 겪었습니다. 논문은 이런 결과를 근거로 현재 월드모델들이 생성 품질은 인상적이지만 반복된 변화 속에서 믿을 만한 상태를 유지하는 데는 여전히 상당한 과제가 남아 있다고 정리했습니다.

  5. 5/벤치마크 자체가 업계 기준이 될 수 있을지가 관건AMEET 해석

    HappyWorld-Bench는 비디오·공간·임바디드로 나뉘어 있던 월드모델 평가를 하나의 능력 체계로 묶었다는 점에서, 이후 모델 발표에서 자주 인용되는 참조 기준이 될 가능성이 있습니다. 다만 논문은 벤치마크와 지표 설계 자체를 다뤘을 뿐 새로운 모델을 내놓은 것은 아니어서, 실제 영향력은 다른 연구팀들이 이 지표를 얼마나 채택하느냐에 달려 있습니다.

출처: Hugging Face 인기 논문 · 발표 2026.09.24 09:00 (KST)
원문 보기

댓글 0

첫 댓글을 남겨보세요.