2026年6月30日

|

11 分钟阅读

我们正在通过 Nano Banana 2 Lite(我们最快、最具成本效益的 Gemini 图像模型)以及 Gemini Omni Flash(用于高质量视频生成和对话式编辑)让您更轻松地实验和扩展创意。


Alisa Fortin

产品经理,Google DeepMind

Anish Nangia

产品经理,Google DeepMind


今天,我们通过两大发布,让您更快速、更轻松地实验、优化和扩展创意:

使用生成式媒体进行构建通常涉及创意迭代。借助这两个模型,开发者可以构建全面的端到端多媒体体验,将快速图像生成与视频创建和编辑连接起来。无论您的工作流程需要生成数千张图像还是编辑多轮视频序列,您现在都有两个新模型来更快地构建、无缝迭代,并将您的创意愿景变为现实。

Nano Banana 2 Lite:我们最快、最具成本效益的 Gemini 图像模型

观看 Nano Banana 2 Lite 与 Nano Banana 2 在使用简单提示时的图像生成速度和质量的并排比较。

Nano Banana 2 Lite (gemini-3.1-flash-lite-image) 专为快速构思和高速开发者管道而设计,其中速度和成本是主要限制因素。对于当前使用我们第一版 Nano Banana (gemini-2.5-flash-image) 的开发者,我们推荐将其作为替代品,您可以立即替换它以在关键性能维度上获得即时收益。

Nano Banana 2 和 2 Lite 与竞争对手 AI 图像模型的性能基准比较,评估生成/编辑质量(Elo 分数)、处理延迟和每张 1K 分辨率图像成本之间的权衡。

Nano Banana 2 Lite 的亮点:

  • 延迟: 在 4 秒内提供文本到图像输出。这使其成为交互式原型设计和快速视觉草稿的理想选择。
  • 成本效益(每张 1K 图像 0.034 美元): 对于专注于草稿、构思、管理运营预算或低带宽使用的开发者来说,这是一个高成本效益的选择。

尽管优先考虑速度,Nano Banana 2 Lite 仍保留了可靠的提示遵循性、强大的角色一致性和清晰的图像内文本渲染。

了解 Nano Banana 系列

  • Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image): 专为速度而构建。针对超低延迟至关重要的近实时、高吞吐量工作流进行了优化。
  • Nano Banana 2 (Gemini 3.1 Flash Image): 通用型主力。以较低延迟提供高质量,实现性能和成本的最佳平衡。
  • Nano Banana Pro (Gemini 3 Pro Image): 针对复杂的专业用例进行了优化。它为准确性比速度更重要的任务提供最强大的控制和高级推理。
  • Nano Banana (Gemini 2.5 Flash Image): 我们的旧版模型。我们建议升级到 Nano Banana 2 Lite,以获得更好的质量、更快的速度和更低的成本。

要查看完整的功能列表以及如何集成,请查看开发者文档

除了在开发者平台上发布外,Nano Banana 2 Lite 也将登陆 Google 消费者端产品,包括搜索中的 AI 模式、Gemini 应用、NotebookLM、Google 相册、Stitch、Google Flow 和 Google Ads。

通过 Gemini Omni Flash 体验高质量、高成本效益的视频编辑和生成

观看某人使用 Gemini Omni 表演四个数字魔术,例如从手机中拉出一个 3D 气球文字,以及将屏幕中的水倒入玻璃杯。角落有一个小的“原始”视频,揭示了她在添加 Omni 生成的视觉效果之前实际拍摄这些魔术的方式。

在 Google I/O 上,我们介绍了 Gemini Omni Flash 这是一个将 Gemini 的多模态推理与视频生成和编辑相结合的模型。今天,Gemini Omni Flash (gemini-omni-flash-preview) 通过 Gemini API 和 Google AI Studio 向开发者推出,原生支持从文本、图像和视频输入的组合中进行高质量视频生成和对话式编辑。该模型定价具有竞争力,为每秒钟视频输出 0.10 美元,与 Veo 3.1 Fast 相同。

Omni Flash 的亮点:

  • 对话式视频编辑: 使用自然语言优化和编辑视频。
  • 多模态引用: 结合图像、文本和视频等输入,以保持对场景的控制和一致性。
  • 现实世界知识: Omni 利用 Gemini 的知识,如历史、生物学和叙事逻辑,来构建引人入胜的视频。
  • 文本与动作同步: 通过简单的提示,将文本和图形直接连接到视频动作。

有关全面的基准测试信息,请访问 Google DeepMind 的 Gemini Omni 网页。

限制:

  • Omni 目前提供 10 秒的视频生成,更长的时长即将推出。
  • 该模型在 Gemini API 中尚不支持上传音频参考和场景扩展。
  • API 模式接受最长 3 秒的视频参考,但模型目前无法正确处理。
  • 在更改场景或平移运动时,角色一致性存在一些限制,但我们正在努力改进。

Gemini Omni 即日起在 Google AI Studio 和 Gemini API 中公开预览。如需查看完整的模型能力列表和区域特定限制,请查阅开发者文档

立即使用两款模型进行构建

当您将这些模型串联使用时,真正的魔力才会显现。使用 Nano Banana 2 Lite 作为高速图像生成模型,然后将该图像作为参考传递给 Gemini Omni Flash,将其动画化为高质量视频。此外,通过使用 Interactions API 实现这些多轮交互体验,您可以维护会话历史和上下文,使用户能够堆叠最多三个连续编辑。

为了帮助您入门,我们创建了几个可重新混合的演示应用,让您体验如何将 Nano Banana 2 Lite 和 Gemini Omni Flash 配对到一个工作流程中。

Anywhere 是一个演示应用,旨在展示两款模型的强大能力。拍摄自拍照或上传照片,该应用使用 Nano Banana 2 Lite 瞬间将您传送到数十个标志性地标。然后,当点击图像时,Omni Flash 用于将生成的图像转换为该地点的动画片段。

Space Lift 是一个由 Nano Banana 2 Lite 和 Gemini Omni 驱动的演示室内设计应用,让您通过上传照片立即重新构想任何房间。该应用自动生成跨多种设计美学的完整概念。一旦找到您喜欢的风格,点击视频按钮,观看 Omni 以电影般的展示将设计变为现实,让您在实现之前体验新空间的动态效果。

Omni product studio 是一个演示应用,将 Nano Banana 2 Lite 创建的静态图像转换为 Gemini Omni 创建的电影级电商视频。该演示通过快速交互将多模态输入与图像到视频输出相结合,展示了交互式媒体的构建。

以安全性和透明度进行构建

基于 Google 的安全基础设施,Gemini Omni 和 Nano Banana 2 Lite 使用 SynthID 水印技术。您可以通过 Gemini 应用、Chrome 中的 Gemini 或搜索来验证 AI 内容。了解更多关于我们如何扩展验证工具,帮助您了解网络上的内容是如何创建和编辑的。

立即开始您的项目

Nano Banana 2 Lite 资源:

Gemini Omni Flash 资源:

本文内容采集自官方网站,排版和翻译可能与原页面存在差异。

阅读官方全文