animated-voiceover 能自动 90%,最贵的是最后 10%
一个刚开源的仓库,把两分钟动画科普视频拆成了八个 15 秒片段。
每段旁白尽量压到 60 个汉字,一般安排 5 个镜头。先把第一段单独做出来,确认声音和画风,再从成片里剥离 48kHz 双声道 WAV,后面的片段全拿它当音色锚点。画面生成可以并行,质检却要一段一段过。
好家伙,乍看像在拍动画,仔细看全是流水线工程。
这套东西叫 animated-voiceover,作者把它做成了可以交给 Codex 或 Claude Code 执行的开源 Skill。作者在公开发布帖里说,整条流程能做到约 90% 自动化,但选题、风格和关键审批仍然得由人来定。
圈里很快有人用它做了一支 DeepSeek V4-Flash 的动画科普视频。公开演示给出的估算是,两分钟成片大约花 40 元,一个人用一个下午走完选题到成片。这个数字只是一次公开演示,不是固定报价,但它足够把悬念勾出来。

官方仓库的成片截图,画风、人物材质与字幕已经接近完整内容产品,而不是单张概念图。
这是不是又一套万能提示词,换个主题就能自动吐出大片?
不是。
我翻完仓库里的完整工作流,反而觉得它最值得抄的地方,跟视频模型能画得多漂亮没太大关系。它真正做对的,是把一个模糊的创作任务拆成了一串有输入、有产物、有验收条件、失败后知道退回哪一步的工程节点。
90% 自动化听着很猛,最后那 10% 才是整条线里最贵的部分。
它没有让 Agent 更聪明,只是让状态不再丢
很多人做 Agent 流程,第一反应是把提示词写长。角色、目标、步骤、注意事项、禁区,几千字一股脑塞进上下文,祈祷模型一次记住。
然后跑到第六步,角色脸换了,声音飘了,前一段刚确定的画风也没了。模型回头很无辜,像一个第一次进项目群的新同事。
animated-voiceover 走的是另一条路。它不指望一个超长上下文替整条生产线保存状态,而是把状态变成可以复用和检查的资产。
完整旁白是一份资产,片段计划是一份资产,风格参考图是一份资产,每个主要人物的参考图也是资产。第一段通过后剥离出来的纯音频,不再只是某段视频里的声音,而是后续所有片段共同引用的音色锚点。生成任务还有节点 ID、任务 ID 和文件路径,质检结果决定这个片段能不能进入拼接。
把它画成一条线,大概长这样。
完整旁白 → 片段计划 → 风格参考 → 人物参考
→ 片段 1 → 音色锚点 → 并行生成后续片段
→ 逐段质检 → 拼接成片
这里有个很实用的工程判断,凡是后面还要反复引用的东西,都别只留在对话里。
对话是临时内存,资产才是持久化状态。
风格为什么会漂?因为每段都让模型重新猜一次「电影感」到底长什么样。人物为什么会互相套脸?因为角色身份只写在自然语言里,没有独立参考图和明确的素材职责。声音为什么一段一个人?因为系统每次都从一句「沉稳男声」重新采样。
这套仓库的处理方式有点子牛逼,它把「一致性」拆成了几种不同的问题。画风由风格参考负责,人物身份由人物参考负责,声音由音频锚点负责,当前片段到底说什么则只由当前旁白负责。每份参考只背自己的锅,谁也别越界。
这比反复补一句「请保持一致」靠谱多了。

同一套电影感 3D 风格下,多人物、室内空间与镜头调度仍需要独立参考资产共同约束。
你如果在做代码 Agent,也能直接搬这个思路。架构约束不要只写在会话里,落成规则文件。接口约定不要靠 Agent 回忆,落成 schema 和类型。验收口径不要藏在人的脑子里,落成测试和检查脚本。模型换一轮,上下文清一次,这些资产还在。
模型能力是租来的,项目状态得是自己的。
真正的并行,前后都有闸门
这条制片线还有个细节挺妙,它并没有从第一秒就让十个 Agent 一起冲。
先写完整旁白,再拆片段。先确认风格图和人物图,再做视频。先只生成片段 1,把旁白、音色、画风、人物和实际画幅全看一遍。确认片段 1 能当锚点后,才允许后续片段并行生成。
也就是说,它的结构不是「全都并行」,而是串行定标准,并行做重复劳动,再串行验收。
很多自动化项目最容易兴奋过头的地方就在这儿。任务一拆,立刻开八路并发,进度条刷刷往前走,像极了老板来视察时突然开始疯狂敲键盘。等结果回来才发现八份产物依据了八种理解,合并时不是提速,是八倍返工。
animated-voiceover 先用片段 1 做了一块校准板。它把抽象要求变成一个已经通过人工确认的真实样品。后续节点不再猜「什么叫对」,直接对着锚点靠。
这和软件工程里的 golden sample 很像。你不必给每个执行者讲一万遍审美理论,给它一个合格样本,再把允许变化和禁止变化的边界写清楚,判断会稳定很多。
仓库对 15 秒片段的拆法也很克制。它要求先把完整论证写通,再按语义完整的位置切段,目标是每段约 60 个会被读出的汉字。字数不合适就改写,不是拿剪刀把句子从中间咔嚓一下。具体规则写在旁白讲稿指南里。
这个顺序很重要。
如果一开始就按片段写,局部很可能都顺,全片却像八条互不认识的短视频拼在一起。先把全局逻辑定下来,再把它切成可并发的小任务,局部执行才不会把主线拆散。
写代码也是一样。一个大需求不能只靠把 issue 切成八张卡就自动获得并行性。你还得先定接口、依赖顺序、验收标准和合并策略。否则每个 Agent 都写得挺快,最后一起在 git merge 里见面。
段错误。
自动化最值钱的能力,是知道从哪儿返工
生成式工作流有个很不体面的秘密,失败不是例外,是正常流量。
一段视频可能旁白少了半句,人物身份漂了,镜头运动重复,实际画面被塞进黑边,片尾又多出一截噪音。任务状态显示成功,只能证明平台交付了一个文件,证明不了这个文件能用。
视频提示词指南把这类问题拆得很细。生成前要核对参考素材职责、镜头动作、参数和画幅,生成后还要抽查开头、中段和结尾的真实画面。容器分辨率对了,不代表画面内部没黑边。片段有声音,不代表音色和锚点一致。主要人物出现了,也不代表脸没套到另一个角色身上。
这才像生产系统。
不是看接口返回 200 就开始庆功,而是检查业务结果有没有过线。
更关键的是,检查结果会告诉系统从哪里重来。旁白长度失衡,退回讲稿拆分。画风没锁住,退回参考图确认。只有某个片段的角色漂了,就重做那个片段,不把前面七段一起扔掉。音频格式被平台拒绝,按音频剥离指南转成已经验证过的 48kHz、双声道、16-bit PCM WAV,不靠换十种描述碰运气。
局部重试,听着不性感,却是成本控制的核心。
公开演示估算两分钟视频约 40 元。假设每个片段都可能重跑,真正决定成本的不是一次生成单价,而是缺陷发现得有多早、返工范围有多小。等八段全部生成完才发现人物参考错了,便宜模型也能给你跑出昂贵账单。
所以我一直觉得,Agent 工作流的监控不能只记 token 和耗时,还要记产物版本、参考来源、验收结果和重试原因。某个节点连续失败三次,到底是模型不行、输入资产错了,还是验收规则互相打架,得能追到。
日志不是事后写检讨用的,是为了下一次别从头再来。
90% 自动化之后,人没有变轻松
看到这里,可能有小伙伴会问,既然流程写得这么完整,那最后 10% 还剩什么?
剩下的是最难标准化的判断。
选题值不值得做,哪种视觉风格真的适合这段内容,参考图是「稳定但平庸」还是「有记忆点但不可控」,片段 1 的音色是不是对,某个镜头虽然没犯错但就是没劲,这些判断很难交给一张检查表彻底解决。
作者自己也没把这套东西包装成全自动魔法。他明确要求风格参考和主要人物参考先经用户确认,片段 1 通过检查后才能当锚点,最终只有过质检的片段才能拼接。仓库还写得很坦白,当前正式维护并实际验证的是 LibTV CLI 路径,Seedance 2.5 Pro 的 30 秒片段尚未做系统性优化,不能把 15 秒经验机械翻倍。
这段限制说明,反而让我更信它。
真的做过生产系统的人,文档里一定会有「目前只支持什么」和「哪里还没验证」。只有演示稿会写什么都能做,什么都丝滑,宇宙尽在掌握。
90% 自动化也不会把人从流程里拿走,它只是把人的时间从重复劳动挪到高杠杆决策上。以前人要逐段写提示词、下载文件、转音频、上传节点、盯任务和拼接。现在这些机械动作可以交给 Agent,人留下来做标准、审批、例外处理和最终取舍。
听着像少干活,其实更像换了工种。
从剪片的人,变成制片系统的设计者。
这也是我觉得 animated-voiceover 比一条炫酷成片更有价值的地方。成片今天很惊艳,三个月后模型能力一变,画质优势可能就没了。可是把复杂工作拆成资产、闸门、并行节点、验收和局部重试的办法,不只适用于视频。
做研究报告,可以把资料包、事实表、提纲、初稿和引用审查拆开。做客服自动化,可以把用户身份、订单状态、允许动作和高风险审批拆开。做代码 Agent,可以把需求、接口、实现、测试和 review 拆开。
很多朋友可能不知道,Agent 真正难的从来不是「让它开始干活」。一句 prompt 就能开始。
难的是它干到一半别丢状态,干错了知道停,重来时别把已经对的部分毁掉,最后还能有人说清楚为什么这份产物可以交付。
animated-voiceover 把这件事拍成了一条制片线。
船可以开得更快,但罗盘、锚点和靠岸检查,一个都不能省。