105.181.0은 같은 표 안 값이야

WorldWeaver(W²)는 영상 생성 모델 안에 에이전트끼리 공유하는 상태 레지스터를 넣어서, 논문 표에서 105.1을 받았어. 같은 표에서 비교 대상인 Solaris는 81.0이고, 과거 화면을 그냥 이어 붙이는 방식은 49.1이야.

UCLA와 Adobe Research가 7월 23일 arXiv에 올린 논문이야. 두 사람이 같은 마인크래프트 세계에서 동시에 움직이는 영상 126시간으로 학습했어.

화면 기록 대신 상태를 따로 저장해

기존 방식은 지금까지 생성한 화면을 조건으로 계속 물고 가는 구조야. 사람이 둘이고 보는 방향이 갈리면, 화면 기록만으로는 “누가 어디에 무엇을 지었는지” 같은 공유 정보가 유지되지 않아.

  • 상태 레지스터 256: 세계 정보와 각 에이전트 상태를 담는 학습 가능한 토큰이고, 화면 덩어리를 하나 만들 때마다 갱신돼.
  • 감독 신호 3종: 에이전트별 상태, 위에서 내려다본 조감도, 장면 설명 텍스트를 각각 정답으로 줘서 레지스터를 학습시켜.
  • 가중치 분리: 세계 상태를 다루는 부분과 화면을 그리는 부분에 서로 다른 가중치를 쓰는 Mixture-of-Transformers 설계야.

감독 신호를 하나도 주지 않고 레지스터만 뒀을 때는 93.8이었어. 장면 설명만 주면 103.2, 조감도만 주면 102.4고, 셋을 다 주면 105.1이야. 값을 가른 건 저장 공간이 아니라 그 공간을 무엇으로 채웠는지였어.

105.1은 공개 벤치마크 점수가 아니야

논문 표의 항목은 Grounding, Building, Consistency, Movement, Memory야. 마인크래프트 과제에 맞춰 새로 짠 구성이고, 이름이 겹치는 스탠퍼드 WorldScore 벤치마크와는 평가 항목이 달라. 그쪽은 테스트 예제 3,000개를 쓰고, 모델 점수가 25에서 75 사이에 들어오도록 정규화해.

그러니까 다른 논문에 적힌 WorldScore 값과 이 105.1을 나란히 놓고 더 높다고 읽으면 안 돼. 같은 표 안에서 Solaris 81.0과 견주는 데까지가 이 숫자가 말할 수 있는 범위야.

멀티 에이전트 환경을 다루는 팀이 확인할 것

  • 비교는 표 안에서만: 논문이 평가 구성을 직접 짰으면, 인용할 때 그 표의 비교 대상까지 같이 적어야 오독이 안 생겨.
  • 감독 신호부터 설계해: 레지스터만 두면 93.8, 세 신호를 다 주면 105.1이야. 저장 공간을 늘리기 전에 무엇을 정답으로 줄지 정하는 게 순서야.
  • 아직 두 명짜리야: 실험은 에이전트 2명, 마인크래프트 한 도메인이야. 사람 수가 늘거나 도메인이 바뀔 때도 유지되는지는 이 논문에 없어.

학습에 쓴 126시간은 SolarisEngine으로 모은 합성 영상이라, 실제 게임 로그나 다른 엔진에서 같은 값이 나올지는 아직 확인된 게 없어. 코드나 가중치를 공개했는지도 논문에서 찾지 못했어. 급할 거 없어. 두 명짜리 실험이 세 명으로 늘어나는지 한 번 더 보고 판단해도 돼.