具身智能观察

形界智能:沿用两段式架构,是市场对 AI 实时视频的最大误判

产业动态

来源:极客公园发布时间待核实

作者|Cynthia 编辑|郑玄 投资人广撒网式布局,但真正的全域沉浸式生成,还少之又少。 2024 年 8 月 27 日,DOOM 里的一声枪响,在 2026 年年中的资本市场,听到了震耳欲聋的回响。 这一天,一段《DOOM》的游戏画面出现在 Google Research、Google DeepMind 和特拉维夫大学研究团队公布的演示里。 棕红色的墙壁,幽暗的走廊,像素化的枪口,玩家移动,怪物出现。然后,玩家按下键盘,枪响了。 如果不去细看,这段演示与三十年来无数次《DOOM》游戏录像没有任何本质区别。 变化发生在屏幕背后:那里没有一个传统游戏引擎,玩家扣动扳机之后,会出现什么画面,全是靠模型在毫秒内自行推演出的。 于是,过去互联网时代短视频 vs 直播的叙事,在 AI 视频生成赛道再次重演。 但很可惜,由于成本以及谷歌内部的诸多考虑,那声枪响,很快被离线生成视频带来的掌声盖住。此后一年里,行业的聚光灯逐渐集中到了 Sora、可灵、Seedance 这样的离线生成模型玩家之上。围绕分辨率、镜头语言、人物一致性和生成时长,整个行业都在研究如何把十秒钟的视频做得更像电影。 但枪声并没…