谷歌Gemini Omni视频创作与Gemini Robotics 2双线发布
据 blog.google 与 riskinfo.ai 报道,谷歌近期集中展示 Gemini Omni 的对话式视频创作与编辑能力,同时由 DeepMind 发布 Gemini Robotics 2 与 Gemini Robotics ER 2,在多模态生成与实体机器人两个方向同步推进。
Gemini Omni:用对话做视频
Gemini Omni 是谷歌在 I/O 大会上推出的对话式 AI 视频创作与编辑模型。最新展示中,开发者可用自然语言完成多视角镜头剪辑、语音驱动场景变换、草图转视频动画,以及实时风格迁移。该能力已通过 Gemini App、Google Flow、AI Studio、Gemini API 与 Gemini Enterprise Agent Platform 开放。
| 能力 | 说明 |
|---|---|
| 多视角镜头剪辑 | 自动重组不同机位画面 |
| 语音驱动场景变换 | 用指令实时改变场景 |
| 草图转视频动画 | 手绘草图生成动态画面 |
| 实时风格迁移 | 一键切换视觉风格 |
Gemini Robotics 2:让机器人理解世界
DeepMind 发布的 Gemini Robotics 2 旨在帮助机器人理解周围环境、完成全身动作与复杂任务;Gemini Robotics ER 2 则聚焦实时规划与推理。同期,Lyria 3.5 也进入 Google Flow Music,提升 AI 音乐在旋律、歌词与人声上的表现。
多模态 + 具身智能的协同
- 视频生成降低内容生产门槛,赋能创作者
- 机器人模型加速实体智能落地
- 音乐模型补全创意工具链
FAQ
Q1:Gemini Omni 能做什么?
A1:它支持多视角剪辑、语音驱动场景变换、草图转视频与实时风格迁移,用对话即可完成视频创作。
Q2:Gemini Robotics 2 与 ER 2 有何区别?
A2:Robotics 2 侧重让机器人理解环境并完成全身动作,ER 2 侧重实时规划与推理。
Q3:这些能力在哪里可用?
A3:Gemini Omni 已通过 Gemini App、Google Flow、AI Studio、Gemini API 与 Enterprise Agent Platform 开放。
Q4:Lyria 3.5 是什么?
A4:它是谷歌的 AI 音乐模型,已接入 Google Flow Music,在旋律、歌词与人声上获得提升。
本网站的文章部分内容来源于网络,仅供大家学习与参考,如有侵权,请联系站长 QQ:24844 进行删除处理。本站一切资源不代表本站立场,不代表本站赞同其观点和对其真实性负责。本站一律禁止以任何方式发布或转载任何违法的相关信息,访客发现请向站长举报。本站资源大多存储在云盘,如发现链接失效,请联系我们我们会第一时间更新。














![修愚分享推广计划正式上线,推广可获高额奖励[限时推广]-修愚](https://xiuyu.com/wp-content/uploads/2025/05/愚你同乐-1024x410.jpg)


暂无评论内容