화질보다 반응이 기준이다

영상 생성과 세계 생성을 가르는 기준은 화질이나 재생 시간이 아니다. 핵심은 사용자의 입력에 계속 반응하느냐다.

한 연구진이 2026년 8월 발표한 EchoWM은 기존 생성 모델을 ‘수동형 시스템’으로 규정한다. 기존 모델은 프롬프트를 받으면 완성된 영상을 내놓고 작동을 끝낸다. 반면 월드모델은 매 순간 사용자나 에이전트의 입력을 받아 다음 상태를 생성한다. 따라서 같은 720p 화면이라도 프롬프트의 결과로 끝나면 ‘영상’이고, 새로운 입력에 계속 반응하면 변화하는 세계의 ‘상태’다.

EchoWM은 영상뿐 아니라 환경음, 음악, 음성도 화면과 동기화해 생성한다. 사용자는 961프레임, 60초가 넘는 생성 과정에 여러 차례 개입해 명령을 이어갈 수 있다. 중요한 것은 영상의 길이가 아니라, 중간에 사용자가 개입한 뒤에도 생성이 자연스럽게 계속되는지다.

평가 결과에서도 화질과 반응성은 별개의 능력으로 나타났다. 경량 모델인 EchoWM-Flash의 종합 평균 점수는 81.0으로 본체보다 낮았다. 그러나 사용자의 조작을 얼마나 잘 따르는지를 평가한 점수에서는 87.9를 기록해 본체의 87.2를 앞섰다. 종합 품질이 낮더라도 입력에는 더 정확하게 반응할 수 있다는 뜻이다.

다만 월드모델을 조작하는 방식은 아직 표준화되지 않았다. 월드모델 벤치마크 WorldMark는 키보드 입력 토큰, 포즈 값, 카메라 궤적, 사용자 정의 액션 함수처럼 서로 다른 입력을 전진, 후진, 좌우 이동과 좌우 회전이라는 여섯 가지 명령으로 변환했다. 그런 다음 변환된 명령을 모델별 어댑터를 통해 각 모델에 전달했다.

또 다른 벤치마크 WBench도 텍스트 명령, 6자유도 포즈, 이산 액션을 하나의 체계로 통합한 뒤에야 모델 간 비교가 가능했다. 이 과정을 거쳐 289개 사례와 1,058회의 상호작용을 기준으로 20개 모델을 평가했다. 결국 월드모델을 제대로 비교하려면 생성 결과뿐 아니라, 서로 다른 조작 방식을 공통 언어로 번역하는 평가 체계도 필요하다.


카메라 의도는 하나, 시점은 둘

1인칭에서 카메라의 움직임은 관찰자의 이동과 거의 일치한다. 반면 3인칭에서는 카메라가 캐릭터와 일정한 거리를 두고 별도로 움직인다. EchoWM은 두 시점에 동일한 카메라 의도 인터페이스를 사용한다. 대신 3인칭에서는 캐릭터의 움직임과 카메라 운동의 관계를 데이터로 학습한다. 시점마다 별도의 조작기를 두는 방식은 아니다.

게임 엔진은 오래전부터 캐릭터와 카메라의 움직임을 따로 계산해 왔다. Unreal Engine의 스프링암(카메라를 캐릭터에서 일정 거리 띄워 붙잡아 주는 가상의 팔)이 대표적이다. 스프링암은 피벗과 카메라 사이의 공간을 구 형태로 검사한 뒤, 장애물이 감지되면 팔의 길이를 줄여 카메라를 앞으로 당긴다. 이때 충돌 여부는 카메라 채널을 기준으로 판단한다. 따라서 카메라 채널을 차단하지 않는 벽은 그대로 통과할 수 있다. 캐릭터의 이동 경로만으로 카메라의 위치를 결정할 수 없는 이유다.

이러한 차이는 회전 운동에서 더욱 뚜렷해진다. WorldMark에서 시점을 1인칭에서 3인칭으로 바꾸자 방향 정확도는 병진 운동에서 4.0점, 회전 운동에서 13.9점 하락했다. 1인칭의 회전은 주로 시선의 변화로 나타난다. 그러나 3인칭에서는 캐릭터의 선회와 카메라의 궤도 운동이 동시에 일어난다.

WBench 역시 이러한 시점 차이를 평가에 반영했다. 먼저 MegaSaM(영상만으로 카메라의 위치와 방향을 추정하는 기법)으로 카메라 포즈를 추정한 뒤, 이를 각 시점의 의미에 맞게 구성된 정답 궤적과 비교했다. 따라서 같은 W 입력이라도 1인칭과 3인칭에서 서로 다른 기준으로 채점된다. 한편 WorldMark가 평가한 10개의 1인칭 모델 가운데 3인칭을 자체 지원한 모델은 다음 5개뿐이었다.

  • DreamX-World
  • HY-World 1.5
  • LingBot-World
  • Matrix-Game 2.0
  • SANA-WM

키 입력도 결국 궤적이 된다

EchoWM은 키 입력처럼 순간적으로 주어지는 명령과 연속적인 카메라 움직임을 하나의 형식으로 통일한다. 바로 위치 3축과 회전 3축으로 구성된 상대적 6자유도 궤적이다. 덕분에 자체 플레이 기록, 인터넷 게임 영상, Unreal Engine 시뮬레이션, 일반 웹 영상을 모두 같은 형식의 학습 자료로 활용할 수 있다.

기존의 액션 표현은 대개 특정 조작 체계에 종속된다. 예를 들어 키 입력을 기준으로 학습하면 입력 기록이 없는 웹 영상을 활용하기 어렵다. 반면 카메라 포즈는 영상만으로도 복원할 수 있다. EchoWM은 ViPE를 기반으로, 시간에 따른 움직임의 일관성을 높이는 VGGT-Omega와 실제 미터 단위의 깊이를 추정하는 MoGe-2를 결합했다. 이를 통해 별도의 라벨이 없는 영상에서도 카메라 궤적을 역으로 추정했다.

이 과정에서는 움직임의 실제 규모를 보존하는 것도 중요하다. 각 영상 클립의 궤적을 따로 정규화하면 한 걸음과 다섯 걸음의 차이가 사라지기 때문이다. EchoWM은 먼저 클립별 최대 변위를 구한 뒤, 전체 데이터셋에서 그 값의 90퍼센타일을 공통 스케일로 사용했다. 이 범위를 벗어나는 궤적은 학습 자료에서 제외했다.

다만 한계도 있다. 학습 성능이 카메라 포즈의 복원 정확도에 크게 좌우된다. 또한 궤적이 정밀하게 복원된 영상과 시청각적 다양성이 풍부한 영상을 동시에 충분히 확보하기도 어렵다.


45밀리초의 어긋남을 감지한다

소리와 화면의 어긋남은 아주 작아도 쉽게 드러난다. 국제전기통신연합(ITU)의 방송 기준 ITU-R BT.1359-1에 따르면, 소리가 영상보다 45밀리초 빠르거나 125밀리초 늦으면 시청자가 어긋남을 감지할 수 있다. 허용 가능한 한계도 소리가 90밀리초 빠른 경우부터 약 190밀리초 늦은 경우까지에 불과하다. 발소리와 걸음이 맞지 않거나 복도에 들어선 뒤에도 잔향이 달라지지 않는다면, 화면 밖까지 포함한 공간의 상태가 제대로 이어지지 않았다는 뜻이다.

오디오, 비주얼 월드모델 연구는 이러한 일관성을 평가하기 위해 두 가지 오차를 측정했다. 하나는 좌우 귀에 들리는 소리의 크기 차이고, 다른 하나는 영상에 비해 소리가 얼마나 늦게 재생되는지다. 영상과 오디오를 함께 학습한 결합 모델은 두 오차를 각각 3.003에서 2.471로, 1.665에서 1.218로 낮췄다. EchoWM도 영상과 오디오에 동일한 노이즈 수준과 확산 단계를 적용하고, 같은 시간대의 청크를 함께 생성해 두 감각의 일치를 유도한다.

다만 현재의 평가 방식만으로는 오디오의 완성도를 충분히 확인하기 어렵다. WBench의 다섯 평가 항목은 영상 품질, 설정 준수, 조작 준수, 일관성, 물리적 타당성에 초점을 맞춘다. EchoWM 역시 오디오만을 따로 평가한 점수를 제시하지 않았다.

장기 기억에도 한계가 있다. EchoWM은 영상과 오디오별로 초기 정보를 담은 고정 ‘싱크(sink) 청크’와 가장 최근의 청크를 KV 캐시에 보관한다. 직접 참조할 수 있는 과거 정보의 양이 정해져 있기 때문에, 오래된 상태는 축출 규칙에 따라 사라진다. 명시적인 3차원 공간 기억이 없는 만큼 세션이 길어질수록 오차가 누적될 가능성도 남아 있다.

주소를 지정해 과거 정보를 불러오는 메모리는 이 문제를 일부 완화했다. LoopBench의 ABA 왕복 실험에서는 출발지로 돌아온 뒤의 위치 정렬 CLIP 점수가 0.723에서 0.864로 높아졌다. 그러나 더 긴 기억을 요구하는 과제에서는 여전히 한계가 뚜렷했다. WorldMark의 60초짜리 3구간, 360도 회전 실험에서 대부분의 모델은 다시 방문한 장소의 모습을 일관되게 유지하지 못했다.

따라서 다음 데모에서는 네 가지를 확인해야 한다. 입력 체계가 6자유도로 통일되어 있는지, 시점마다 카메라 움직임을 정확히 해석하는지, 세계의 상태에 맞춰 소리가 변하는지, 그리고 출발지로 돌아왔을 때 이전 공간이 그대로 유지되는지다. 앞의 세 조건은 이미 구현 방법이 제시됐지만, 마지막 조건은 아직 명시적인 공간 기억이 아니라 캐시에 의존한다.

성능 자체는 경쟁력이 있다. EchoWM은 WBench에서 항해 평균 81.7점, 조작 준수 87.2점, 일관성 89.8점을 기록했다. 항해 평균으로는 HiDream-O1-World의 80.9점과 LingBot-World의 79.4점을 앞선다. 다만 지원하는 조작은 항해와 시점 변경에 한정되며, 집기, 점프, 공격 같은 행동은 아직 지원하지 않는다.


출처


#에이전트#언어모델#해석가능성