Runway GWM Worlds 2 研究预览:WorldPrompt 实现实时世界交互
Runway 推出 GWM Worlds 2 研究预览,引入 WorldPrompt 功能以指定世界和动作,实现实时交互视频和音频生成。文章采访 CTO Kamil Sindi 和研究科学家,探讨了 autoregressive diffusion 模型和从视频生成到世界模型的工程挑战,包括 distillation 方法。
Runway 推出 GWM Worlds 2 研究预览,引入 WorldPrompt 功能以指定世界和动作,实现实时交互视频和音频生成。文章采访 CTO Kamil Sindi 和研究科学家,探讨了 autoregressive diffusion 模型和从视频生成到世界模型的工程挑战,包括 distillation 方法。
Google DeepMind 发布 Gemini Omni 1.1 Flash,面向开发者提供场景续写、首尾帧插值、视频参考和 4K 放大等生成视频控制能力。
推荐理由:相比前代只参考最后 1 秒画面,新版本可读取 10 秒上下文并把视频续写到 40 秒,开发者可据此判断生成视频的可控程度。
Google DeepMind 发布两款生成模型,Nano Banana 2 Lite 面向高吞吐的快速出图,Gemini Omni Flash 面向高质量视频生成与对话式编辑,均已上线 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform。
推荐理由:Nano Banana 2 Lite 每张 1K 图 0.034 美元、Omni Flash 每秒视频 0.10 美元,读者可据此比较两款模型在图像与视频环节的成本取舍。