Fable 5 续期、Codex 解限,两家抢着送的不是模型
7 月 7 日,7 月 12 日,7 月 19 日。
这是 Anthropic 给 Fable 5 免费窗口先后划下的三条死线。第一条没执行,续了。第二条也没执行,又续了。这个周末官方口径变成,付费计划的 Fable 5 访问权,以及 Claude Code 高出平时 50% 的周限额,一起延到 7 月 19 日。一个月里画三条死线、续两回期,好家伙,比我们项目排期改得还勤。

同一个周末,太平洋另一边也没闲着。OpenAI 的 Codex 负责人 Tibo 发了条推文,两百多万人围观。三条更新,第一条就是给所有 Plus、Business、Pro 用户临时移除 5 小时使用限制。第二条,GPT-5.6 Sol 正在做全面的效率优化,同样的额度以后能跑更久,具体省多少还在测。第三条,Codex 活跃用户到了 600 万,顺手给大家把用量重置了一次。
原文第一个词就是 Temporarily。临时。Anthropic 那边同样,续到 7 月 19 日,不是永久。这两件事都不是发福利,是限时活动,先把这个钉死,后面所有讨论都建立在这个前提上。
然后我想说一个可能有点刺耳的观察。
这个周末,两家实验室没有发布任何新模型。Fable 5 还是 6 月 9 日那个 Fable 5,GPT-5.6 Sol 还是几天前那个 Sol。跑分没变,能力没变,上下文窗口没变。它们改动的只有一个变量,你能连续用多久,中间会不会被掐断。
Anthropic 的做法是把顶级模型塞进你已有的订阅里,让你最多用掉周限额的一半,同时把 Claude Code 的周限额抬高 50%。OpenAI 的做法更直接,把那个每 5 小时结算一次的滚动窗口整个摘掉,再把大家已经烧掉的用量清零。形式不同,指向同一个东西。
不被中断的时间。
两个从来不互相通气的对手,同一个周末对同一个变量下手,这不是巧合,是市场在逼供。它俩都发现了,开发者现在最痛的不是模型不够聪明,是干着干着被掐断。
怎么说呢,我对「被掐断」这件事的感受可能比一般用户要具体一些。我的日常工作是给大模型搭脚手架,就是让模型真正能干活的那层工程,工具怎么接、任务怎么调度、上下文怎么管理,圈里管这个叫 harness。在这一层待久了,你看限额的角度会变。普通用户看限额,是「我还剩多少条消息」。harness 视角看限额,是「我的任务会在哪一步被杀掉」。
这两个视角差别很大。你想想看,聊天被掐断,损失是零,下个窗口接着聊就行,反正每轮对话都是独立的。但一个跑了四十多分钟的长任务被掐断,损失的不是那四十分钟的额度,是整个任务积累起来的状态。agent 改到一半的文件,验证到一半的假设,排查到一半的调用链。等限额恢复,你重新开一个会话,模型对刚才发生的一切一无所知,它要么从头再来,要么基于一份不完整的现场继续,两条路都比不中断贵得多。
做过有状态服务的朋友对这个应该秒懂。进程被 kill 不可怕,可怕的是它没有 checkpoint。5 小时滚动窗口对长任务的杀伤就在这,它不看你的任务进行到哪一步,到点就掐。你的 agent 可能正在第 130 个文件的迁移上,可能正卡在一个马上就要复现出来的 bug 上,窗口不管这些。
所以 Tibo 那条推文里,真正值钱的不是「额度变多了」,是「结算周期消失了」。额度多 20% 你还是要规划怎么省着用,结算周期消失,你才敢把一个预计六八个小时的活整个交给模型跑。这是两种完全不同的使用方式。前者是流量包思维,后者才是把模型当同事。
Anthropic 那边的逻辑也一样。Fable 5 那 50% 的周限额配上 Claude Code 抬高的上限,鼓励的显然不是你去跟顶级模型贫嘴,是让你把它接进真实工作流里连轴转。
坦率讲,两家为什么都选「临时」而不是「永久」,答案也不复杂。Simon Willison 在他的短评里点得很透,算力不够。Anthropic 反复用一两周的短窗口试探,就是想先看清需求曲线和自己机房的承受力,再决定要不要永久放开。Willison 还补了一句挺狠的,他说 OpenAI 正在赢得用户,仅仅因为 Fable 的访问权始终笼罩着不确定性。翻译一下,确定性本身就是产品。用户可以接受模型笨一点,很难接受今天能用明天不能用。
OpenAI 这边其实也是被逼的。GPT-5.6 发布后 48 小时用量爆炸,Tibo 自己说这两天 intense,与其让 600 万用户在限额墙上排队撞头,不如趁效率优化上线,把墙先拆了当一波好人。
背景交代完了。接下来聊点实际的,这段窗口期,到底该拿来干什么。
我先讲反面。最容易的用法,是把它当成一个加大杯的聊天额度。问更多的问题,生成更多的一次性代码片段,让它写更多回头就忘的文档。这些事不是不能做,但它们有个共同点,产出和会话同生共死。会话关掉,什么都没留下。7 月 19 日窗口一关,你回头看这一周,除了「爽过」,账上是空的。
额度像水,对话像沙滩。往沙滩上倒水,倒多少渗多少。
要让水留下来,你得有容器。我自己琢磨下来,值得在这一周里认真做的容器有三种。不是什么高深的东西,但每一种都能活过 7 月 19 日。
第一种容器,你自己的评测集。
这个可能是最多人忽略、但杠杆最高的一件事。现在的情况是,顶级模型限时免费,你手上同时有强模型和平时舍不得多用的额度。这是建立「私人基准」的完美窗口。做法很朴素,接下来一周,你让模型干的每一件真实工作,写接口、改 bug、重构、写 SQL、迁移配置,都顺手存档,输入是什么,上下文给了哪些,你最后验收的标准是什么,强模型的输出长什么样。
不用搞什么评测框架,一个目录,一个任务一个文件夹,够了。
这堆东西的价值在窗口关闭之后才显现。7 月 19 日以后,你面对的问题会变成,日常任务到底用哪个档位的模型才不亏。是 Sol 还是便宜大碗的 Terra,是 Fable 还是回落到 Opus。所有公开跑分都回答不了这个问题,因为公开跑分测的不是你的任务。前几天 OpenAI 自己审计 SWE-Bench Pro 还审出三成任务有缺陷,公共基准的水位大家心里都有数。
这两天社区里还流传一段很毒的体感总结,先声明,这不是严谨跑分,也不是官方结论,听个意思就行。
GPT-5.6 Sol 开 Max,像一个卡住了的 Opus 4.8;切到 xHigh,反而像一台小一号的 Fable。更离谱的是,Grok 4.5 开 Max,像 10 倍速的小 Fable。
这段话没法当排名用,但它点出一个挺离谱的现实,同一个模型换个推理档位,性格都像换了个人。我们以前选模型,像在挑一辆车,现在得连驾驶模式一起挑,名字还是那个名字,方向盘底下已经不是同一台发动机了。连模型名字都靠不住,公开榜单还能指望到哪去。你自己的二三十个真实任务加上强模型的参考答案,比任何榜单都诚实。到时候拿候选模型往上一跑,和参考答案一比,选型就从玄学变成了查表。
我在公司里干的很大一部分活就是这个,给模型换代做回归。私人评测集这个思路完全可以缩小到个人尺度用,而且个人版反而简单,你不需要统计显著性,你只需要「这活它到底能不能干」。
第二种容器,可复用的工作流。
这一周的连续时间,最适合干的就是那些平时因为「跑不完」而不敢启动的长活。整个仓库的依赖升级,跨越几十个文件的接口迁移,把三年的祖传代码补上测试。这类任务有个特点,单点难度不高,但链条巨长,模型需要连续工作好几个小时,中间任何一次被掐断都会让前功尽弃一半。5 小时窗口在的时候,这类活你只能手动拆段,拆段就要人盯,人盯就等于没解放。现在窗口没了,正是让 agent 跑整活的时候。
但跑整活只是第一层。第二层是,跑的过程中把你重复说的话变成资产。你大概也有体会,让 agent 干长活,真正费劲的是前面那段教学,项目的目录约定,测试怎么跑,哪些文件不能碰,验收标准是什么。这些话你说第二遍的时候,就应该警觉了,它们不该活在对话里,该活在文件里。CLAUDE.md 也好,AGENTS.md 也好,自定义命令和脚本也好,形式无所谓,关键是把「每次开工前的口头交代」固化成「开工时自动加载的规则」。
这个事在窗口期做特别划算,因为你正在高频使用,素材是热的,哪句话没交代清楚 agent 立刻会用翻车提醒你。等窗口关了再回忆着写,写出来的是文档,现在边跑边写,写出来的是流程。
第三种容器,可验证的交付物。
这条听起来最像废话,但它是前两条的收口。给这一周的每个会话定一个能二元判定的目标,测试套件从红到绿,一个 PR 被 review 通过合进主干,一个性能指标从 x 到 y。判定标准在会话开始前就写下来,别在会话结束后现编。
为什么强调这个,因为强模型有一种很迷惑人的能力,它能把「没干完」说得跟「干完了」一样漂亮。你在对话里觉得收获巨大,关掉窗口一周后想捡起来用,发现手里只有一段精彩的讨论和几个跑不起来的片段。可验证的交付物是防止这种幻觉的唯一手段。测试绿了就是绿了,PR 合了就是合了,这些东西不依赖你对那次对话的美好记忆,它们自己会说话。
有个简单的自检办法。每天收工前问一句,今天这些产出,如果明天两家同时把窗口关了,哪些还在。还在的那部分,才是你真正从这次限时活动里拿走的。
三种容器讲完了。你可能注意到它们有个共同的底色,都在对抗同一件事,会话的易失性。评测集把模型的能力样本固定下来,工作流把你的调教经验固定下来,交付物把工作成果固定下来。连续时间是催化剂,让这三种固化以平时几倍的速度发生,但催化剂本身不是产物,7 月 19 日一到它就蒸发。
前几天我写过一篇聊 Fable 5 的稿子,讲的是让每个路过的强模型留下点带不走的家底。今天这篇算是它的姊妹篇,但重心不一样。那篇聊的是「留下什么」,这篇想说清楚的是「为什么是现在」。因为两家送的不是额度,是连续性,而上面三种容器恰恰都是只有在不被中断的长会话里才容易做成的事。评测集需要一口气跑完几十个任务才有可比性,长工作流需要 agent 连轴转才暴露得出规则漏洞,大交付物需要的时间本来就超过 5 小时。平时你不是不想做,是窗口不允许。
最后再泼一次冷水,把开头那个前提收回来。
Temporarily。through July 19。两个限定词都白纸黑字写着。OpenAI 的效率优化那条甚至还挂着「具体影响待量化」的尾巴,官方支持页上那套每 3 小时 160 条、触顶降级到 mini 的限额框架也原封不动躺在那,随时可以恢复营业。Anthropic 的 release notes 里,Fable 5 从 6 月 9 日发布到 6 月 12 日紧急暂停只隔了三天,这个号的老读者应该还记得那次过山车。窗口说关就关,两家都干过。
所以别把任何长期计划建立在「反正现在不限量」上。把它当成一次大潮,潮水漫上来的时候,聪明的做法不是站在水里感叹水真多,是趁水位高把船修好,把网补齐,把航道摸清。潮退了,这些东西还在岸上。
7 月 19 日之后,模型该限量限量,窗口该五小时五小时。但你的评测集在,你的工作流在,你合进主干的代码在。
这一周,祝你打捞愉快。