字节把 PS 的选区,塞进了提示词里
「将 @Mark01 的沙发换成米白布艺沙发,把 @Mark02 的墙面刷成 #F5EDE3 的漆,地板换成鱼骨拼原木。」
这条提示词里的 @Mark01,不是一个人。
是图片上的一个点。
周末刷推的时候看到歸藏发的 Seedream 5.0 Pro 长测,我本来是划过去的。字节上周发的新一代图像模型,官方博客的说法是不止生成、更懂设计,三方榜单的结论是图像质量和提示词理解基本追平 GPT-Image 2.0,综合能力第一梯队。火山引擎已经全量上线 API,即梦、豆包、火山方舟都能玩,连 Runway 都第一时间接了它。
追平,第一梯队。这类词你今天大概已经在别的号刷过三遍了,参数通稿没什么可写的。
让我把推文重新往回滚的,是上面那条带 @ 的提示词。
怎么说呢,做图像编辑这件事,最难的从来不是模型改不动,是你说不清楚改哪里。
你回想一下自己上一次让 AI 改图。图里左边靠窗那个米色的、扶手有点磨损的旧沙发,这样一长串定语写出来,模型还经常给你改成右边那个。空间关系和物体指代,是文字天生的短板,你脑子里明明白白的那个位置,从嘴到手到提示词,每一层都在漏信息。
我的日常工作是给大模型搭脚手架,就是 agent 的工具链、评测、上下文管理这些让模型真正能干活的工程层。类似的问题我们那边也天天见,让模型看着屏幕直接点按钮,永远比让它用文字描述按钮在第几行第几列靠谱。位置这种东西,就不该用语言传输。
Seedream 5.0 Pro 这次做的事,是把这个思路搬到了图像编辑上。
交互长这样。上传图片,点 Draw 按钮,然后你有三种标记可用。打点,在想编辑的物体上点一下,生成一个 Mark。画框,圈出一块区域 Region,表示编辑发生在这个范围里。涂鸦和箭头,用不同颜色的画笔在图上比划位置。
关键是下一步。你打的点、画的框、传的参考图,写提示词的时候全都可以直接 @ 出来,变成句子里的一个多模态词。点、框、图、hex 色号和自然语言,混在同一句话里,模型全都看得懂。
这套设计其实就是 PS 的交互逻辑,先选区,后操作。只不过操作那半边,需要学几年的那半边,换成了说人话。
我跟你说,这个「把选区做进提示词」的抽象,比后面所有实测案例都值钱。提示词变短了,零歧义了,写提示词的门槛直接没了。过去精细化改图最难的不是想清楚要改什么,是用文字描述清楚改哪里。现在位置交给手,需求交给嘴。
理论讲完了,看歸藏是怎么一层层把它玩穿的。
第一个场景,出租屋改造。底图是他自己出租屋的实拍,白墙、旧地板、房东的置物架上堆满杂物,非常真实。他在图上打了四个点,沙发、墙面、地板、货架,然后一句话,把四个点位分别换成米白布艺沙发、#F5EDE3 的漆、鱼骨拼原木地板、宜家木质货架,顺手加了句整理脏乱的衣物和杂物。
出来的图,还是那间房。窗户位置、房间比例、视角完全没动,四个点位全部换掉,连整理杂物这种含糊要求都执行了,沙发上堆的衣服全没了。一次生成,四处编辑,互不干扰。
你以为这就到顶了。他接着把难度往上抬了一档,从换风格变成搬家具。
找六张具体家具的图,沙发、茶几、躺椅、置物柜、窗帘,在房间里打六个点,写一句提示词做一对一替换,@Mark01 的沙发替换为 @Image002,@Mark02 的茶几替换为 @Image004,一路排下去。

六件家具全部落地,透视和光影都对。那张云朵形状的木质茶几放在地板上,投影方向和窗户的光源方向是一致的。
搁以前这种复合需求,提示词要写一大坨,写完还得抽卡抽半天,文字的表达总有 gap。现在一次过。
第三步换色卡。传一张色卡图,让它给整个房间重新配色,墙面用最浅的那个色,窗帘用第二个色,柜子茶几换成对应颜色的家具,位置全部不变。它准确理解了色卡里第几个色用在哪这种映射关系,家具一件没动,颜色体系整个换掉。设计师按小时收费的配色方案,现在几十秒一套,不满意就换张色卡再来。
第二个场景更接地气,小商家最关心的那种。一张手机随手拍的 Lofree 机械键盘,能不能不请摄影师、不开 PS,直接产出整套商业物料。
先是随手拍变场景大片,清晨木质工作桌、逆光、热气腾腾的茶,键盘底部的氛围灯光晕保留,最重要的是键帽上的字符没有花。商品图最怕模型把文字改乱,这关过了。
这里有个细节我看乐了。歸藏那条提示词是从上一个测试改的,里面残留了一句蜂蜜要有透光的琥珀色质感,忘了删。
好家伙,它真的在桌上摆了一罐透光的琥珀色蜂蜜,还插着蜂蜜棒。
遵循度高到连你的废话都认真执行,这是夸它还是损它,我一时没想好。但对干活的人来说这是个实打实的提醒,这一代模型的指令遵循已经强到你得开始检查自己提示词里的每一句话了,它不再帮你过滤你自己都没意识到的噪音。
然后是爆炸拆解图。一句「加一个爆炸拆解视角展示键盘的内胆结构」,不到二十个字,它把键盘拆成了悬浮的四层,键帽、轴体加定位板、内胆棉、铝合金底座,每层结构都符合机械键盘的真实构造,场景和光线还是原来那张桌子。这种图在传统流程里得 3D 建模或者产品渲染。

再往上,画框排版。他在爆炸图上画了三个框,左上角放大标题,下面放副标题,底部一条横幅放卖点,然后给每个框分配文字任务。出来的是一张能直接投放的英文产品海报,大标题、副标题、三栏卖点卡片,全在框定的位置上,文字一字不差。他自己量了一下,位置几乎就差几个像素。

在图上画三个框就把海报排完了,这一手有点子牛逼。
服装类目还有个番外。一张卫衣上身图,直接报三个 hex 色号,要求版型、褶皱、光影、背景全部不变,连原色出一张四宫格。一次生成,褶皱和光影逐格一致,胸口的小字印花都在。一件衣服拍一次,全部色号 SKU 的图就齐了。
最后一个场景是我觉得最值得抄走的玩法,人管信息,AI 管审美。
AI 生图的老大难是文字容易写错、版式不受控。歸藏的解法是先在 PPT 里排一页最朴素的文案稿,默认字体白底黑字,只求标题、副标题、价格的位置摆对,然后连同产品图一起发过去,要求所有文字内容和位置严格遵循这张稿,一个字不能改,剩下的质感、光线、立体标题全交给模型。
成品海报里,每个元素的位置被严格遵守,价格一分没错。文字准确性由人保证,审美由模型负责,这套分工直接绕开了 AI 写错字的老毛病。而且版式定了之后还能换皮,同一张海报一句话改出毛毡缝线、金属镭射、宣纸水墨三种标题质感的四宫格,版式是你的资产,皮肤随便换。
看到这你可能已经想冲了,先等等,说几个官方公告里不会写的东西。
第一,这套最全的编辑交互,目前只在火山引擎的 Lumina 平台上有。即梦、豆包上的编辑能力不全,你要是奔着打点画框去的,得找对地方,不然会以为是我在吹牛。
第二,它没有那么神。爆炸图那个案例,键盘上半部分拆得都对,下面却把一体成型的铝合金框架拆成了两部分。结构理解还是会出错,商用之前你得自己把关,它给你的是九成品,不是成品。
第三,一些小脾气。报色号的时候 hex 字母要大写。画框排版时如果你框的空间不够,它会自己扩展位置,标题和副标题的间距处理得挺聪明,但反过来看,你框的位置是强建议,不是铁律,指望像素级锁死的场景要留个心眼。
第四,也是我觉得最需要冷静的一点。综合能力上 GPT-Image 2.0 依然是第一,Seedream 5.0 Pro 是追平,不是超越,歸藏的原话也是仅次于。但这两家的差异点很有意思,OpenAI 那边你想精细改图,还是得靠嘴,把位置揉进文字里。字节这边把交互做出来了,位置交给手。模型能力差半个身位,交互补了一个身位,对普通用户来说体验反而是反超的。
这事对不同的人分量不一样。
你要是设计师,它暂时抢不了你的活,抢的是你活里最不值钱的那部分,改色、出 SKU 图、排标准海报。你按小时收费的品味还在,只是执行层被压扁了。
你要是小商家或者自媒体,变化是实打实的。一张手机拍的商品图,一路叠出场景大片、拆解图、标注图、投放海报,全程没开 PS,没请摄影师。歸藏那条线演示的就是每张产出当下一次编辑的底图,一张原图裂变一整套物料。
你要是跟我一样写代码的,我建议你至少去玩一次,感受一下多模态提示词这个交互方向。我们这行盯文本 token 太久了,看到点、框、涂鸦、参考图和文字在同一个 context 里被消费,会有一种「哦,输入本来就该长这样」的感觉。火山引擎的 API 已经全量开放,想给自己的工具接一个图像编辑 agent 的,材料都是现成的。
反正我觉得,这次真正的更新不是榜单上那半分,是它把改哪里这个问题从写作题变成了动手题。写作题筛掉了大多数人,动手题谁都会做。
下次你想换掉家里那张旧沙发,先别急着开购物 App。
传张照片,在沙发上点一下。
@Mark01,该你了。