不只能画图!谷歌推出Gemini Omni:只需动动嘴 AI自动帮你改大片
创始人
2026-05-20 22:10:57

快科技5月20日消息,在Google I/O 2026上,谷歌正式发布Gemini Omni模型。该模型支持文本、图像、音频、视频作为输入,实现跨模态生成与编辑。

其中在音频方面,目前该模型初期仅支持语音输入,但Google表示未来将很快扩展更多类型的音频输入能力。

首发产品Gemini Omni Flash已在Gemini应用上线,后续将向企业客户开放API。

该模型核心卖点在于深度视频编辑能力。用户通过自然语言指令即可对生成内容持续迭代,包括添加或删除对象、切换摄像机角度、修改环境与风格。

得益于模型对物理规律的理解以及对历史、科学、文化知识的整合,生成的视频在角色、场景及视觉逻辑上高度连贯,甚至能推测后续情节。用户亦可创建个人数字分身,并将其植入视频中。

谷歌在安全领域同步布局,所有通过Omni生成的视频均会自动嵌入SynthID数字水印,支持通过Google搜索及Chrome验证。

Gemini Omni Flash 现已面向拥有 Google AI Plus/Pro/Ultra 订阅的用户在 Gemini 应用和 Google Flow 中推出。此外,它还免费向希望混剪 YouTube Shorts 的用户以及 YouTube Create 应用用户推出。

Google DeepMind负责人哈萨比斯表示,该模型正推动AI从单纯的任务执行向通用人工智能(AGI)迈进。

相关内容

热门资讯

关注|面临四大瓶颈,谁能在柔性... 来源:阳光高考信息平台 从柔性存算芯片到超薄弹性介电材料,从“能感知”到“能思考”,柔性电子正在经历...
反常识的爆款:一亿注册、千万D... 一个月前,《无畏契约:源能行动》(业内及玩家习惯称之为“手瓦”)抛出一枚重磅数据:用户注册量正式突破...
手瓦一周年复盘:曾担心生不逢时... 一个月前,《无畏契约:源能行动》发了条公告:注册用户破亿了。往前推几个月,今年5月他们还公布过一个数...
重庆电力上线调控核心业务AI智... 8月25日,国网重庆江津供电公司调控中心调度班班长刘嫣然,在研发投运的“调控核心业务智能查询与辅助管...
苹果最强Mac杀到!全新Mac... 快科技8月25日消息,今日,苹果全新Mac Studio发布,可选M5 Max与全新M5 Ultra...