您当前位置>首页 > 新闻动态 > HiDream-O1-World初登场,开启全交互式智能世界的新时代
发表时间:2026-08-18
浏览次数:127
在过去三年间,人工智能内容生成领域经历了数轮技术革新。从生成静态图像到制作动态视频,再到能够创建数分钟长的内容,每一次更新都推动着生成作品在质量和时长上的进步。但是,仔细分析后可以发现,这些进展在本质上仍停留在一个单向的范例:用户给出提示,模型生成内容,最终用户只是简单地观看。而这种形式存在一个根本局限,即它产出的是内容而非一个真正的世界。尽管生成的视频极为真实,用户仍旧是一个旁观者,无法真正进入、改变或持续影响画面中的空间。
业界逐渐意识到这一瓶颈,世界模型的理念开始频繁出现在许多AI实验室的技术报告和产品发布中,谷歌和World Labs等公司在这一领域投入了大量资源。与此同时,行业内却伴随着许多争议:当前市场上的产品究竟是在构建一个新的世界,还是单纯在进行画面渲染?
就在此时,智象未来的HiDream.ai给出了自己的解答:推出了全球首款原生全模态的交互式世界模型HiDream-O1-World。该模型基于其自主研发的全模态UiT架构,能够支持文本、图像以及交互等多种输入,生成具备长时空一致性与物理一致性动态世界。用户不仅可以在第一人称和第三人称视角之间自由切换,还能实时编辑角色和场景的变化。无论是逼真的城市、自然风景,还是二次元幻想和3A级游戏风格,用户都可以在同一模型中生成与演绎各种角色及场景,实现更深层次的可探索与可交互体验。
更值得注意的是,HiDream-O1-World在第三方评测中取得了令人瞩目的成绩。在美团的LongCat与复旦大学联合推出的互动世界模型评测标准WBench中,HiDream-O1-World在首次参测中便位列Navi排行榜第一,超越了腾讯的混元1.5和阿里的Happy Oyster等多个模型。该模型在物理维度(Physical)上获得了73.3的满分,排名第一,而一致性维度(Consistency)则以88.0的得分位列同样的第一。物理维度主要衡量生成结果的合理性与因果逻辑,例如物体间的碰撞和表面交互是否符合现实物理规律;一致性则关注场景的记忆和空间结构能否在持续生成中保持稳定。这两项关键指标的高分表明,HiDream-O1-World在物理一致性和长时空一致性方面都具备显著优势。
一个既能探索又能掌控,并且能够持续生成的AI世界,由此展现出更为直观的生成效果。首先是漫游模式。在此模式下,用户仿佛置身于真实世界中,自由穿梭于模型生成的场景内。借助屏幕左下角的移动控制,用户可以操控角色前进、转向或驻足,并能够在第一、第三人称视角之间随意切换,体验沉浸式的探索感。例如,在HiDream-O1-World生成的雪山攀登视频中,用户通过移动控件控制角色前进,随着人物的移动,前方的路径和周围的环境也会即时更新;当人物折返时,之前生成的地形与场景依然保持一致。这一过程近似于真实登山的连续探索,视角转换流畅,整体画面稳定,几乎没有卡顿或漂移的情况。
此外,编辑模式的功能也更为强大。在此模式下,用户可对画面进行实时编辑,包括驱动角色完成各种动作,如抓取、奔跑、下蹲及跳跃,或调动环境进行动态变化,如降雨或物体掉落等。每一个动作转变和场景互动都是基于真实的物理模拟,且能保持全局的一致性,音视频同步。例如在骑行场景中,用户输入提示词“天气变化为雷雨天”,原本的晴天瞬间雷声大作,天色骤然变暗,雨滴落下,地面溅起水花;输入提示词“天气变化为太阳雨”,阴云逐渐散去,湿润的路面开始反射阳光。场景变化不仅流畅自然,而且整个画面保持协调一致。
最后,在视觉风格方面,HiDream-O1-World支持多种表现形式,包括高度写实的城市街景、自然环境及室内空间等,其中的光影与材质效果均表现得极为逼真。同时,它也能渲染幻想世界、二次元卡通以及3A级游戏等多种艺术风格。角色类型的设置更为多样化,不论是人类、动物,还是虚构生物,都能在模型中精准展现。比如,通过HiDream-O1-World生成的教堂内部,石砌拱顶、立柱、木质书架与排排古籍共同构成了一个完整的空间结构,随着用户的移动和视角变换,画面内容得到实时更新,展现出强烈的质感和空间感。
如果将以上示例汇聚在一起,我们可以更清晰地认识到,HiDream-O1-World展现出的核心能力已经非常显著,具有极强的潜力。