긴 영상 생성모델의 '기억 문제', 5가지 틀로 정리한 서베이
HKUST 등 여러 기관 연구진이 자기회귀(autoregressive, AR) 영상 생성에서 과거 정보를 어떻게 유지할지 다루는 '메모리' 메커니즘을 체계적으로 정리한 서베이 논문을 냈습니다. arXiv에 2026년 9월 24일 09시(한국 시각, 00:00 UTC) 공개됐습니다.
1/왜 영상 생성 모델에 '기억'이 필요한가
자기회귀(AR) 영상 생성은 이전에 만든 프레임이나 청크를 조건으로 삼아 다음 프레임을 순차적으로 만들어내는 방식입니다. 문제는 시퀀스가 길어질수록 모델이 참고할 수 있는 context window, 저장 공간, 연산량에 한계가 있다는 점입니다. 그 결과 등장인물의 정체성, 공간 배치, 움직임 상태, 이전 개입으로 생긴 인과적 변화 같은 정보가 아직 필요한 시점인데도 활성 컨텍스트 밖으로 밀려나는 경우가 생깁니다. 저자들은 이를 저장·갱신·검색·통합을 통해 필요한 과거 정보를 선택적으로 유지하는 '메모리' 문제로 정의합니다.
2/메모리를 Forms·Functions·Operations·Learning·Evaluation 5개 관점으로 분류
논문은 메모리를 '원본 근거가 더는 로컬 컨텍스트에 없어도 이후 생성에 영향을 줄 수 있게 여러 AR 스텝에 걸쳐 유지되는 과거 정보'로 정의합니다. 이를 기준으로 기존 연구를 다섯 갈래로 나눕니다. (I) Forms는 과거 정보를 담는 표현 형태로 시각적, 암묵적, 명시적, 파라미터적 형태를 포함하고, (II) Functions는 정체성·공간·동적 상태·의미·인과적 책임 등 보존해야 할 정보의 종류를 다룹니다. (III) Operations는 메모리를 쓰고 읽고 갱신하고 관리하고 통합하는 생애주기, (IV) Learning은 폐루프 rollout 상황에서 메모리 동작을 학습시키는 방법, (V) Evaluation은 진짜 메모리 능력을 진단하는 평가 방식을 각각 정리합니다. 저자들은 메모리 저장 용량 자체보다 저장된 상태가 정확하고 접근 가능하며 실제로 생성에 인과적 영향을 줘야 한다는 점을 핵심으로 강조합니다.
3/다루는 범위와 다루지 않는 것
이 서베이는 토큰이나 프레임, 청크 단위로 과거를 조건으로 순차 생성하는 AR 영상 생성만을 대상으로 하며, discrete-token 방식과 diffusion·flow 기반의 continuous 방식을 모두 포함합니다. 장기·상호작용형 world generation은 다루지만, 메모리를 별도로 유지하지 않는 짧은 영상 생성은 범위에서 제외합니다. world-action model(WAM)의 경우 LingBot-VA처럼 메모리 메커니즘이 AR 영상 생성에 직접적으로 관련될 때만 선택적으로 다루며, WAM 문헌 전반을 포괄적으로 리뷰하지는 않는다고 논문에 명시돼 있습니다.
4/왜 지금 '메모리'가 화두인가AMEET 해석
지금까지 AR 영상 생성 연구는 로컬 윈도우 유지나 KV-cache 재사용처럼 서로 다른 이름의 개별 기법으로 흩어져 있었는데, 이 서베이는 그것들을 하나의 틀로 묶어 비교할 수 있게 했다는 점에서 정리 작업의 성격이 큽니다. 새 모델 발표는 아니지만, 장기 영상 생성이나 인터랙티브 world model을 만드는 연구자라면 어떤 메모리 설계 선택지가 있는지 참고할 수 있는 지도 역할을 할 수 있습니다.