谷歌Gemini Omni视频创作与Gemini Robotics 2双线发布

谷歌Gemini Omni视频创作与Gemini Robotics 2双线发布

据 blog.google 与 riskinfo.ai 报道,谷歌近期集中展示 Gemini Omni 的对话式视频创作与编辑能力,同时由 DeepMind 发布 Gemini Robotics 2 与 Gemini Robotics ER 2,在多模态生成与实体机器人两个方向同步推进。

Gemini Omni:用对话做视频

Gemini Omni 是谷歌在 I/O 大会上推出的对话式 AI 视频创作与编辑模型。最新展示中,开发者可用自然语言完成多视角镜头剪辑、语音驱动场景变换、草图转视频动画,以及实时风格迁移。该能力已通过 Gemini App、Google Flow、AI Studio、Gemini API 与 Gemini Enterprise Agent Platform 开放。

能力 说明
多视角镜头剪辑 自动重组不同机位画面
语音驱动场景变换 用指令实时改变场景
草图转视频动画 手绘草图生成动态画面
实时风格迁移 一键切换视觉风格

Gemini Robotics 2:让机器人理解世界

DeepMind 发布的 Gemini Robotics 2 旨在帮助机器人理解周围环境、完成全身动作与复杂任务;Gemini Robotics ER 2 则聚焦实时规划与推理。同期,Lyria 3.5 也进入 Google Flow Music,提升 AI 音乐在旋律、歌词与人声上的表现。

多模态 + 具身智能的协同

  • 视频生成降低内容生产门槛,赋能创作者
  • 机器人模型加速实体智能落地
  • 音乐模型补全创意工具链

FAQ

Q1:Gemini Omni 能做什么?

A1:它支持多视角剪辑、语音驱动场景变换、草图转视频与实时风格迁移,用对话即可完成视频创作。

Q2:Gemini Robotics 2 与 ER 2 有何区别?

A2:Robotics 2 侧重让机器人理解环境并完成全身动作,ER 2 侧重实时规划与推理。

Q3:这些能力在哪里可用?

A3:Gemini Omni 已通过 Gemini App、Google Flow、AI Studio、Gemini API 与 Enterprise Agent Platform 开放。

Q4:Lyria 3.5 是什么?

A4:它是谷歌的 AI 音乐模型,已接入 Google Flow Music,在旋律、歌词与人声上获得提升。

© 版权声明
THE END
喜欢就支持一下吧
点赞8 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容