Codex 自己给自己出了一条视频,我看完想抄这套方案

小岛AI 2026 / 05 / 19

这两天刷到藏师傅发的一条推,愣了一下。

他让 Codex 自己做了一条视频,介绍的是他那套 AI 视频生成方案。

不是截图,不是录屏,是真的让 Codex 自己把这套工具链跑了一遍,产出一条带动效、带旁白、能在聊天界面预览的视频,内容是介绍这套视频生成方案本身。

这事有点递归的妙——工具介绍自己,用的方式就是用自己。

我寻思了一下,这玩意到底怎么运转的,值得拆一拆。


先说这套方案是什么。

藏师傅整合了四个工具,各司其职:

PPT Skill 负责视觉、版式和动效。你可以理解为一个专门做幻灯片动画的模块,它管的是页面长什么样、元素怎么进出场、整体视觉风格是什么。

HyperFrames 负责时间线和渲染。这个是把各个帧、各个片段按顺序组合起来,同时处理字幕、时序对齐的那层。你可以想成是剪辑台,不过是用代码操作的。

Listenhub Skill 负责配音。给视频配旁白音频,合成语音,把声音和画面对上。

即梦 CLI 负责补 B-roll 和演示镜头。前端生成不了的东西——比如需要真实运动画面或者特定演示场景——交给即梦来出。

四个工具,各管一段,最后在 Codex 里拼起来,输出一条完整视频。

好家伙,这套组合比我想象的要完整。


让我觉得有意思的不只是工具本身,而是藏师傅说的一句话:能在聊天界面里直接预览。

这件事比看起来更重要。

做视频这件事,传统流程里最让人崩溃的不是哪个单独环节,而是「对齐」——你改了文案,要去改配音;改了配音,要去对字幕;改了字幕,要去改时间线;改了时间线,发现 B-roll 对不上……每次修改都在一个不透明的工具链里传导,你在改,但你不知道最后出来是什么样。

现在如果能直接在聊天窗口里预览,意思是这个循环缩短了——你说「这段节奏太快了」,Codex 直接改,你直接看。

这是工具在变,但更根本的是创作流程在变。


我对这套东西特别感兴趣的另一个原因是:它涉及的不是一类内容,而是一套可以批量复用的框架。

解释视频(explainer video)这个类型,在技术圈一直是个刚需但很难批量生产的东西。你想给你的开源项目做一个介绍视频,或者给你的 API 做一个 quickstart 演示,传统路径是找外包或者自己用剪映/Premiere 一帧帧摆,两条路都不快。

如果这套方案能跑通,意味着什么?

意味着你有了一个「文本 → 解释视频」的流水线。写好 prompt,让 Codex 跑,出来的是一条有图有声有字幕的视频,内容是关于你指定的任何话题。

这不是在帮你做内容,这是在帮你做内容工厂。


当然,说实话我也不知道这套东西稳不稳定。

从藏师傅的推文里看,点赞 218、转发 27,算是在他的受众里引起了一些反响。但这是一条展示推,不是一篇教程,你不知道这中间有多少踩坑的细节被省掉了,也不知道要跑通这套组合需要哪些前置环境。

HyperFrames 我自己没用过,Listenhub Skill 也是第一次听到。PPT Skill 是藏师傅自己做的工具,应该文档比较齐全;即梦 CLI 是字节的,开放程度倒是不低。

如果你想试,从最简路径进:先跑 PPT Skill + HyperFrames 这条线,把「文字 → 带动效的幻灯片视频」这段打通,再往上加配音和 B-roll。别一上来就想复现完整四件套,容易在环境问题上卡死。

我最近有空的话准备试一下,如果跑通了写一篇实操版的。


说回那条 Codex 自己介绍自己的视频。

这件事有一种奇妙的自指感。Codex 调用了这套工具链,做了一条视频,内容是介绍这套工具链,包括 Codex 自己——工具在描述使用工具的工具的方式,同时自己也是其中的工具。

Hofstadter 在「哥德尔、艾舍尔、巴赫」(简称 GEB,你没看过的话强烈推荐)里有一个核心概念叫「奇异循环」(strange loop)——一个系统在追踪自己的层级时,绕了一圈又回到了起点。巴赫的赋格里有这个结构,艾舍尔的版画里有这个结构,哥德尔的不完备定理里也有这个结构。

现在,Codex 用这套方案给自己出了一条解释视频,也有这个结构。

有点子牛逼,这一下。


相关链接: