四秒一张图,谷歌把生图生视频打到白菜价
今天算一笔账。生一张 1K 分辨率的图,三分四厘钱。
不是三块四,是 0.034 美元,四舍五入两毛五人民币出头。四秒钟出图。这是 Google DeepMind 昨天甩出来的新模型 Nano Banana 2 Lite 的官方定价,我盯着这个数字看了几秒,脑子里第一反应不是技术,是我去年帮一个做电商的朋友算过的一笔图片外包费。
那会儿他要给几百个 SKU 出主图,找的外包一张几十块,量大了砍到十几块,还得等两三天返稿。现在一张两毛五,四秒。你说这中间差了多少个数量级,我懒得算了,反正是那种算出来会让人沉默一下的数量级。
好家伙,图像生成这条赛道,是真的卷成白菜价了。
先把这次发布的两个东西摆清楚。Google 这回一口气放了俩,一个是图像模型 Nano Banana 2 Lite,一个是视频模型 Gemini Omni Flash,官方博客写得明明白白,核心就是把生图和生视频这两件事,都往「快」和「便宜」这个方向又推了一大步。原文在这(https://deepmind.google/blog/start-building-with-nano-banana-2-lite-and-gemini-omni-flash),感兴趣可以自己去读。
Nano Banana 这个名字,圈里人应该不陌生了。它是 Gemini 家的图像模型系列,去年那波 Nano Banana 出图效果好、又能改图,在设计师和独立开发者里刷了一大波屏。这次的 2 Lite,代号 gemini-3.1-flash-lite-image,定位很清楚,就是这个家族里跑得最快、花得最少的那个档位。
我特意去翻了它家族的分层,觉得这块对要用的人挺重要,给你捋一下别搞混。
Nano Banana 2 Lite,Gemini 3.1 Flash Lite Image,主打速度,为高并发、大批量、要求秒级出图的场景准备的。
Nano Banana 2,Gemini 3.1 Flash Image,官方叫它 generalist workhorse,通用主力马,质量和成本平衡得最好,日常大部分活儿它接。
Nano Banana Pro,Gemini 3 Pro Image,专业选手,复杂场景、要强推理、精度比速度更重要的时候上它。
还有个初代 Nano Banana,Gemini 2.5 Flash Image,现在算 legacy 了,官方直接建议你升级到 2 Lite,说换过去质量更好、速度更快、成本更低。这话翻译一下就是,老用户别恋旧了,无脑换新的就完事了。模型详情官方页在这(https://deepmind.google/models/gemini-image/flash-lite/)。

我盯着这个家族图看的时候,突然有种很熟悉的感觉。这不就是当年 CPU 分 i3 i5 i7、显卡分甜品卡旗舰卡的那套路数吗。同一个能力,切成好几个档,让你按预算和场景对号入座。AI 模型走到今天,也开始像卖硬件一样卖分层了。这本身就说明一件事,这个技术已经从「能不能做到」的阶段,滑到「怎么卖得更划算」的阶段了。
说回 2 Lite 本身的两个硬指标,我觉得是这次最值得记的。
第一个是延迟,文生图 4 秒出结果。4 秒是什么概念,差不多就是你敲完 prompt 回车,端起水杯喝一口,图就出来了。这个速度对做交互式产品的人是质变。以前你做个「输入一句话实时生成配图」的功能,用户得盯着 loading 转圈十几秒甚至几十秒,体验直接劝退。现在 4 秒,勉强够得上「即时」这条线了。
第二个是价格,0.034 美元一张 1K 图。这个数字我前面已经念叨过了。它意味着你可以放开手脚做那种「批量生成上千张图」的活儿,不用每点一次都心疼钱包。官方原话说得很实在,这是给那些做草稿、做构思、要控运营预算、或者低带宽使用场景的开发者准备的。

当然,Lite 就是 Lite,它优先保速度,肯定有取舍。但官方强调了几个没丢的东西,提示词遵循、角色一致性、图内文字渲染,这三样保住了。尤其是图内文字渲染,你要是做过 AI 生图就知道,让模型在图里写出不乱码的字,一直是老大难,这个能力保住了,做海报、做带字的卡片就有戏。
它现在能用的地方也不少,Google AI Studio、Gemini API、Gemini Enterprise Agent Platform 这些开发者入口都有,API 文档在这(https://ai.google.dev/gemini-api/docs/image-generation)。消费端也全铺了,AI Mode in Search、Gemini app、NotebookLM、Google Photos、Stitch、Google Flow、Google Ads 一整排。你日常用 Google 全家桶里冒出来的图,背后大概率就是这玩意在跑。
好,图这块聊完了,下面这个我觉得更有意思。
Gemini Omni Flash,视频模型,这次第一次开放给开发者。
它其实在 Google I/O 上就亮过相,当时是作为「Gemini 多模态推理撞上视频生成和编辑」的那个东西露的面。这次落地到 Gemini API 和 Google AI Studio,代号 gemini-omni-flash-preview,你可以拿文本、图像、视频这几种输入去喂它,让它生成视频,还能用大白话对着视频改。
价格是 0.10 美元一秒视频输出,官方特意点了一句,跟 Veo 3.1 Fast 同价。视频生成能压到一秒一毛钱这个量级,说真的,放两年前想都不敢想。
它主打的几个能力,我挑几个说人话的。
一个是对话式视频编辑,就是你可以用自然语言直接改视频,不用一帧一帧抠。一个是多模态引用,图、文、视频混着喂进去,让它保持画面里的控制感和一致性。还有一个我觉得挺妙的,叫 real-world knowledge,官方说它能调用 Gemini 本身的知识,比如历史、生物、叙事逻辑,来把视频构建得更靠谱。这个点如果真能 work,意味着生成的视频不只是画面炫,逻辑上也能立得住,而不是那种一看就乱来的拼贴。

但我得替它把丑话也说了,这版局限不少,官方自己列得很坦诚,这点我挺欣赏。
目前只能生成 10 秒的视频,更长的以后再说。API 这版暂时不支持传音频引用,也不支持场景扩展。还有个更细的坑,3 秒以内的视频引用,API 的 schema 接受,但模型现在其实处理不对,等于是个半成品接口。另外跨场景切换、镜头平移的时候,角色一致性还有毛病,官方说在改了。
我为什么专门把这些局限抄出来。因为这才是判断一个模型能不能进你生产流程的关键。发布会上人人都吹能力上限,但真正决定你能不能用的,是它的下限和边界在哪。10 秒、不支持音频、角色偶尔崩,这些约束你得提前知道,别等接进去了才发现填不了坑。视频这块的详情和分地区限制,官方文档写得比较全(https://ai.google.dev/gemini-api/docs/omni),要上生产的兄弟建议逐条读一遍。
现在聊到我觉得这次发布真正的重点,也是对独立开发者最有价值的一块,把这俩串起来用。
官方原话叫 the real magic happens when you chain these models together。翻译过来就是,单独用一个不算啥,把它俩接成一条流水线才是好玩的地方。这一手设计有点子牛逼,我第一次看到就想动手试试。
具体怎么串。用 Nano Banana 2 Lite 当高速生图的那一环,先把图快速造出来,然后把这张图作为参考丢给 Gemini Omni Flash,让它动起来,变成一段高质量的视频。生图那头快、便宜,视频那头接着把静态变动态。一条从文字到图片再到视频的完整链路,就这么搭起来了。
再往上还有个东西叫 Interactions API(https://ai.google.dev/api/interactions-api),做多轮体验用的,能保住会话历史和上下文,让用户连着改,最多叠三次连续编辑。这个对做产品的意义在于,用户不是生成一次就完事,而是能像 P 图那样一轮一轮迭代,每轮都记得前面的上下文。
为了让你少走弯路,Google 还放了几个可以直接抄的 demo app,都在 Google AI Studio 里。
一个叫 Anywhere,自拍或者传张照片进去,Nano Banana 2 Lite 秒把你 P 到几十个世界地标前面,点一下某张图,Omni Flash 就把它变成那个地点的动画短片。
一个叫 Space Lift,室内设计的,传一张房间照片,自动给你生成各种设计风格的效果图,看中哪个,点视频按钮,Omni 直接给你放一段电影感的展示,让你在动手装修前先看看动起来是什么样。
还有个叫 Omni product studio,把 Nano Banana 2 Lite 生成的静态商品图,转成电商用的电影感视频。这个对做跨境电商、做独立站的朋友,简直是精准打击,你如果正在为选品主图发愁,可以去点开看看。
我看这三个 demo 的时候,脑子里已经在过它能落地的场景了。你做个旅游 App,用户传张脸就能生成「我在马丘比丘」的短视频发朋友圈。你做个家装平台,客户拍下毛坯房,当场出效果视频。你做个电商工具,卖家上传一张产品图,批量出主图加带货短视频。以前这每一个都是一整个团队加一大笔预算的活儿,现在是俩 API 加一条 pipeline 的事。
当然,我也不是要在这儿无脑吹。理性看,这些东西离「开箱即用的成品」还有距离,10 秒视频、角色一致性的毛病,都是真实存在的墙。但方向是清楚的,图像和视频生成的边际成本正在被摁到地板上,能力则一点点往上爬。对我们这种没有大厂预算、就想快速验证一个 idea 的人来说,这种「白菜价 + 能拼装」的组合,才是真正的机会。
哦对,还有个容易被忽略但挺重要的点,安全这块。这俩模型生成的内容都带 SynthID 水印,就是那种肉眼看不见、但机器能验出来的 AI 内容标记。你可以通过 Gemini app、Chrome 里的 Gemini 或者 Search 去验证一段内容是不是 AI 生的。在这个满屏都是 AI 生成内容、真假越来越难分的当下,这层水印不是可有可无的装饰,它关系到以后整个内容生态还能不能信。生成能力狂飙的同时,能同步把「怎么标记、怎么溯源」这件事做上,我觉得是负责任的一步。
写到这儿,我想起万能青年旅店那句,是谁来自山川湖海,却囿于昼夜厨房与爱。以前我们被困在「想法有一堆,但做出来太贵太慢」这件事上,一个念头从脑子里到能给别人看的成品,中间隔着钱、隔着时间、隔着一整个专业团队。现在这堵墙,正在被一次又一次的降价和提速,凿出越来越大的口子。
四秒一张图,一毛钱一秒视频。这两个数字单看平平无奇,但它们背后是创作这件事的门槛,正在肉眼可见地往下掉。掉到什么程度呢,掉到一个周末下午,一个人,一台电脑,就能把脑子里那点不成熟的想法,先跑成一个能看的东西。
这大概就是我一直觉得这个时代最迷人的地方。工具不会替你想出那个好点子,但它正在拼命帮你,把想出来的东西,更快、更便宜地变成真的。
至于那个点子好不好,那是你的事,也永远只能是你的事。