H3-World 开源:用 0.199% 可训练参数让 MiniMax-H3 按方向生成世界
腾讯、NUS 与香港理工大学团队公开 H3-World 论文、定向注意力补丁、推理代码和 LoRA 权重。项目把 MiniMax-H3 33B 视频生成模型改造成可接收前进、后退、左转、右转等控制指令的短时交互式世界模型,而不是重新训练整套基座。
团队从约 8000 段游戏视频构建训练集,其中 7872 段用于训练、128 段留出评估;每段包含 124 帧,按 24fps、832×480 处理。训练运行 10000 步,只更新约 0.199% 参数;定向注意力把相邻时间块的视觉状态与动作条件连接起来,使生成结果随控制信号改变运动方向。
论文的光流诊断显示,在左右转组合控制中,冻结基座的水平流变化接近零,H3-World 则分别达到约 +52.7 与 -106;这用于说明控制方向能反映到视频运动中。公开 LoRA 文件约 131 MB,需配合 MiniMax-H3 基座、项目补丁与推理代码使用。
论文:
https://arxiv.org/abs/2609.01560
权重与说明:
https://huggingface.co/DANNY621/H3-World

September 2, 2026 915 6