텐센트와 싱가포르국립대(NUS), 홍콩과기대(PolyU) 공동 연구진이 키보드 입력을 실시간 영상으로 변환하는 액션 제어형 월드 모델 'H3-월드'를 공개했다. 미니맥스의 330억 매개변수 영상 생성 모델 'H3'를 기반으로 하며, WASD 키로 캐릭터 이동을, IJKL 키로 카메라 시점을 제어해 832×480 해상도의 약 5.2초 영상을 생성한다. 별도의 대규모 액션 제어 네트워크 없이 방향성 주의 마스크와 LoRA 파라미터(전체의 0.199%인 6560만개)만 학습시켜 기존 언어·움직임 이해 능력을 재활용한 것이 특징이다. 학습 데이터는 약 8000개의 게임플레이 영상에 불과해 적은 자원으로 인터랙티브 월드 모델 전환이 가능함을 보여준다.
- •텐센트·NUS·PolyU, 키보드 조작에 실시간 반응하는 영상 생성 AI 'H3-월드' 공개
- •미니맥스 H3(330억 매개변수) 기반, WASD로 이동, IJKL로 카메라 제어
- •방향성 주의 마스크와 LoRA(6560만개, 전체의 0.199%)만 추가 학습해 기존 능력 재활용
- •게임플레이 영상 약 8000개, 소규모 데이터로 학습 완료
- •832×480 해상도 약 5.2초 영상 생성, 허깅페이스에 아파치 2.0 라이선스로 공개
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
"WASD 누르면 영상 생성"... 텐센트, 인터랙티브 월드모델 'H3-월드' 발표
- 1.텐센트·싱가포르국립대·홍콩공대, 키보드 입력으로 캐릭터·카메라를 제어하는 'H3-월드' 공개
- 2.미니맥스 330억 매개변수 영상모델 'H3' 기반, 전체의 0.199%인 6560만개만 LoRA로 추가 학습
- 3.WASD·IJKL 키를 짧은 영어 명령으로 변환, 방향성 주의 마스크로 시간대별 동작 제어
- 4.832×480 해상도 약 5.2초 영상 생성, 허깅페이스에 아파치 2.0 라이선스로 공개
왜 중요한가?
별도의 대규모 액션 제어 모델 없이 기존 영상 생성 모델의 언어 이해 능력만으로 인터랙티브 제어를 구현했다는 점에서, 게임형 인터랙티브 영상 AI를 훨씬 적은 학습 비용으로 구축할 수 있는 방법을 제시한다.
본문 미리보기
영상 생성 AI가 단순히 주어진 프롬프트에 따라 영상을 만드는 단계를 넘어 사용자의 조작에 실시간으로 반응하는 ‘인터랙티브 월드 모델’로 진화하고 있다. 게임처럼 키보드를 조작하면 AI가 캐릭터의 이동과 카메라 시점을 이해하고 그에 맞는 영상을 생성하는 방식이다. 텐센트와 싱가포르 국립대학교(NUS), 홍콩공과대학교(PolyU) 공동 연구진은 1일(현지시간) 키보드 입력을 실제 캐릭터와 카메라의 움직임이 반영된 영상으로 변환하는 액션 제어형 월드 모델 ‘H3-월드(H3-World)’를 온라인 아카이브를 통해 공개했다.별도의 복잡한
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 11:24AI 초안
![[AI리더의 서가] Agentic AI 구축 개발의 모든 것](https://cdn.aitimes.com/news/photo/202610/215958_219938_244.jpg)
