VLM 공간추론, '상호작용 학습'으로 최대 25점 향상
저장드대 ZJU OmniAI 연구팀이 비전-언어모델(VLM)이 물리적 공간의 변화를 제대로 추적하지 못한다는 문제를 진단하고, 이를 해결하는 학습법 'Spatial-Interactor'와 전용 데이터셋 LSI-108K를 논문으로 내놨습니다. 여러 VLM과 공간추론 벤치마크에서 기존 모델 대비 16.4~25.0점의 성능 향상을 확인했다고 밝혔습니다.
1/VLM은 장면이 바뀌는 걸 제대로 못 따라간다
연구팀은 VSTI-Bench 영상에서 32개 프레임의 순서를 무작위로 섞어보는 실험을 했습니다. 순서를 섞어도 Qwen2.5-VL-3B와 7B 모델의 정확도는 각각 0.9점, 0.8점밖에 떨어지지 않았습니다. 이는 모델이 프레임의 시간 순서가 아니라 순서와 무관한 시각적 특징에만 의존해 답을 맞히고 있다는 뜻이라고 설명합니다. 즉 한 장면에서 다음 장면으로 무엇이 어떻게 바뀌었는지를 실제로 모델링하지 못한다는 것입니다.
2/짧은 구간은 맞혀도 긴 경로는 못 잇는다
연구팀은 SAT-Real의 짧은 상호작용 과제와, 더 긴 궤적에서 카메라 이동을 누적 추정해야 하는 VSTI-Bench 과제를 비교했습니다. Qwen2.5-VL-7B의 점수는 54.7에서 8.6으로, GPT-5.5는 88.7에서 23.9로 급락했습니다. 다만 GPT-5.5가 각 구간의 변화를 스스로 설명한 텍스트를 추가 정보로 주자 점수는 23.9에서 35.5로 다시 올랐습니다. 이는 국소적인 변화를 명시적으로 설명해주면 긴 궤적을 통합하는 데 도움이 된다는 것을 보여준다고 밝혔습니다.
3/3단계 커리큘럼과 2단계 학습법
이런 진단을 바탕으로 연구팀은 상호작용 궤적, 즉 '이전 관찰(O_t) → 행동(a_t) → 다음 관찰(O_t+1)'을 직접적인 학습 신호로 쓰는 Spatial-Interactor를 제안합니다. 학습은 L1(외부 세계의 변화를 관찰), L2(카메라 이동 등 자기 행동에 따른 시점 변화), L3(긴 궤적에서 연속된 변화들을 통합)의 3단계 커리큘럼으로 구성됩니다. 이를 위해 시뮬레이션과 실제 영상에서 뽑은 QA 쌍 10만8천 개로 구성된 LSI-108K 데이터셋을 만들었습니다. 학습은 L1·L2를 지도미세조정(SFT)으로, L3를 On-Policy Distillation(OPD)이라는 방식으로 진행합니다. OPD에서는 구간별 변화 설명을 아는 '교사' 모델이, 학생 모델이 스스로 생성한 추론 과정을 지켜보며 지도합니다.
4/여러 벤치마크에서 최대 25점 향상
논문에 따르면 Spatial-Interactor는 여러 VLM에 적용했을 때 기존 Base 모델 대비 여러 공간추론 벤치마크에서 전체적으로 16.4~25.0점의 향상을 보였습니다. VSI-Bench, MindCube, VSTI-Bench에서는 Spatial-Interactor 버전이 가장 좋은 결과를 냈다고 밝혔습니다. 학습에 쓰지 않은 벤치마크로 교차 평가했을 때도 4.3~10.6점의 향상이 있어, 특정 데이터에만 맞춰진 게 아니라 일반화가 된다고 설명합니다.
5/실제 로봇·내비게이션에 필요한 능력에 다가서는 시도
이 연구는 시각 질의응답을 잘 맞히는 것과, 실제로 3차원 공간에서 움직이며 상태를 계속 갱신하는 것이 서로 다른 능력이라는 점을 실험으로 보여줍니다. 프레임 순서를 섞어도 점수가 거의 안 변한다는 진단은, 기존 벤치마크 성적이 좋아도 실제 동적 환경에서는 취약할 수 있다는 뜻으로 읽힙니다. 로봇 내비게이션이나 물체 탐색처럼 시간에 따라 공간 상태가 계속 바뀌는 응용에서는 이런 상호작용 기반 학습이 앞으로 더 검증될 필요가 있어 보입니다.