小米开源了个终端编程助手,我最服的是它不赌模型自觉

小岛AI 2026 / 06 / 11

小米开源了个终端编程助手,我最服的是它不赌模型自觉

事情是这样的。昨天小米大模型团队发了篇公告,正式发布并开源 MiMo Code V0.1.0,一个跑在终端里的 AI 编程助手,MIT 协议,发布原文在这

我刷到的第一反应是,又来一个。

这条赛道今年实在太挤了。Claude Code、Codex、Cursor 的 CLI、Gemini CLI,再加上各家大厂隔三差五掏出来的新货,终端编程助手已经从去年的稀罕物变成了今年的标配。每家发布文案都长得差不多,都说自己更懂开发者,都放几个 benchmark 柱状图,柱子永远是自家最高。

所以我是带着「行吧又一个」的心态点开的。

看完之后我改主意了。这篇发布文里有几个设计,戳到了我的本行,我想跟你认真唠唠。

先把基本盘交代清楚。

MiMo Code 是基于开源项目 OpenCode 二次开发的,没藏着掖着,公告里自己写了。整个项目采用 MIT 协议开源,这是开源协议里最宽松的那一档,个人随便改,企业随便集成,不用担心哪天律师函敲门。

它内置了一个限时免费的多模态模型 MiMo-V2.5,官方说性能比肩 Claude Sonnet 4.6。同时它不锁模型,DeepSeek、Kimi、GLM 这些主流模型的 API 都能接,第三方 Token Plan 也支持。

安装就一行命令,Mac 和 Linux 用户在终端里跑

curl -fsSL https://mimo.xiaomi.com/install | bash

Windows 用户走 npm 装 @mimo-ai/cli,装完输入 mimo 就能启动。设置项全中文,TUI 界面右侧常驻一个状态看板,能随时看它在干嘛。

到这里为止,还是一个标准的国产 coding agent 发布故事。免费模型引流,开源攒口碑,中文本地化拉好感。换别家发,我看完就划走了。

但接下来的东西开始有意思了。

它内置了语音输入,背后是 MiMo-V2.5-ASR 的语音识别。你可以动嘴下指令,可以口头修改说错的话,甚至「发送」「执行」这种操作命令也能直接喊出来,全程不碰键盘。官方文案管这叫君子动口不动手。

我承认我看到这看笑了。倒不是觉得多厉害,是想象了一下开放工位上一排程序员对着终端念念有词的画面,有种赛博道士做法的美感。但你冷静想一下场景,深夜在家改 bug,瘫在椅子上嘴一张活就有人干了,好像,还真有点香?

这算开胃菜。真正让我坐直的是下面两个设计。

第一个,持久记忆系统。

用过这类工具的朋友大概都有体感,长会话聊到几十轮之后,AI 开始忘事。前面定好的约定它不记得了,改过的方案它又改回去了,你得把同一句话翻来覆去交代。这不是哪家的 bug,是大模型的天性,上下文窗口就那么大,塞满了就得扔东西。

主流工具的解法,是让 AI 自己记笔记。Claude Code 有记忆文件,Codex 也有类似机制,思路都是模型觉得重要就写下来。听着挺合理对吧。

问题是,模型不会主动触发。记不记、何时记、记什么,全靠它自觉。

我平时的工作就是给大模型搭脚手架,工具链、调度、上下文管理,让模型真正能干活的那层工程。这行干久了会形成一个职业病般的信条,凡是「靠模型自觉」的设计,最后都会在生产环境里翻车。模型是个概率机器,它今天自觉,不代表它明天自觉,你没法对一个概率行为做 SLA。

所以看到 MiMo Code 的方案时,我是真的有被戳到。它的思路是,让主 agent 专心干活,记录这件事完全外包,由一个独立的 subagent 在旁边自动保存状态,项目记忆、会话检查点、任务进度,三套东西分开维护。等到上下文窗口快满的时候,这个 subagent 会重建一份干净的简报递过去,主 agent 拿着简报接着干,而不是从零开始。

公告里有句话总结得挺狠,不赌模型自觉,用工程把它兜住。

记录外包,主 agent 专心赶路

这句话我想裱起来。它背后是一个很朴素但经常被忽略的判断,可靠性不该寄希望于模型哪天开窍,该用确定性的工程手段把不确定的模型行为包起来。数据库不会指望程序员自觉不写错数据,它用事务和约束兜底。好的 agent 系统也一样。

顺着这个思路往下,还有个叫 /dream 的命令,名字起得有点文艺。每 7 天自动触发一次,由独立 agent 把历史会话和现有记忆文件翻出来,做合并、去重、验证路径有效性、压缩,把散落的记忆收敛成一份紧凑的当前状态。

像什么呢,像人睡觉时大脑做的记忆整理。白天的经历乱糟糟堆在海马体里,睡一觉,重要的进长期记忆,没用的清掉。它连名字都叫 dream,看得出设计的人是真往这个方向想的。

第二个让我坐直的设计,Compose 模式。

大多数 coding agent 的工作方式,是拿到需求就埋头写。像一个不看导航就上路的司机,看着效率很高,跑偏了才发现绕了远路。

MiMo Code 按 Tab 切到 Compose 模式之后,流程变成了设计、规划、编码、测试、审查一条龙。你给它一个想法,它先想清楚再动手。

官方给了个实测对比,给 Claude Code 和 MiMo Code 下同一条指令,用 golang 实现一个 redis,要支持 redis-cli 连接。

Claude Code 出手很快,代码很快就跑出来了,但几乎没有配套测试,功能能用,不够扎实。MiMo Code 前期花了更多时间做规划,看起来慢了一截,落到结果上,功能更全,测试完整详尽。而且官方说算总账反而是它更快,因为慢写快验,省掉了返工。

先画图再上路,慢写快验

这个叙事你听着耳熟吗。这不就是老工程师和聪明实习生的区别么。实习生十分钟给你一版能跑的,老工程师先画半小时图,但三个月后你想给系统加功能的时候,你会感谢那半小时。

当然,以上都是官方口径,demo 视频谁家不会剪。真正让我觉得这事值得写一篇的,是他们做的另一组实验。

他们让 MiMo Code 和 Claude Code 用同一个 MiMo 模型,去跑 SWE-BenchTerminal Bench 这两个面向真实编程场景的测试集。模型完全相同,只比拼 agent 系统本身。

结果是 SWE-Bench Pro 上 62% 对 57%,Terminal Bench 2 上 73% 对 68%。

两边各高 5 个点。

这组数字有意思的地方,不在于谁赢了,在于这个实验设计本身。过去两年大家比的都是模型,你 70 分我 72 分,挤牙膏一样往上拱。这组对照实验把另一个变量单独拎出来了,模型不动,只换外面那层工程,分数能差 5 个点。

5 个点是什么概念,模型这边为了涨 5 个点,可能要多烧几千万的训练费。而工程这边,是一帮工程师把调度、记忆、规划流程打磨了一遍。

这也是我今年越来越强的一个感受,模型的分数在咬得越来越紧,真正的差异化在往工程层转移。同一个模型,套不同的壳,干活能力天差地别。壳不再是壳了,壳是产品力本身。

公告里管这个叫模型 agent 协同优化,为 MiMo 系列模型量身打造专属的 Harness 系统。他们的逻辑是,不同模型有自己的性格与禀赋,跟不同框架之间存在天然的适配度高低,简单拼在一起发挥不出实力,得深度配合着调。

这个判断我举双手赞成。我自己调过不同模型接同一套工具链的兼容问题,同一个 prompt 模板,这家模型听话,那家模型就犯轴,工具调用格式差一点,成功率能差出一截。模型和框架的适配,真不是插上就能用的 USB,更像配眼镜,得验光。

好了,夸了这么多,按这个号的惯例,泼冷水环节。

第一盆,限时免费。这四个字的重音在「限时」上。MiMo-V2.5 现在免费,以后什么价没说。用免费模型引流,等你工作流养成依赖再谈钱,这套路径大家见得多了。好在它不锁模型,真到收费那天,配置里换成 DeepSeek 或者 Kimi 就是了,迁移成本不算高。

第二盆,benchmark 是自家跑的。62% 对 57% 这组数字出自小米自己的公告,对照组怎么配置的、跑了几轮、方差多大,公开细节有限。我不是说他们作假,是说所有厂商自测数据都该打个折再听。等社区有第三方复测,这个数字才算坐实。

第三盆,V0.1.0。版本号很诚实,这是个刚出生的东西。基于 OpenCode 二开意味着底子是成熟的,但小米自己加的那些,记忆系统、Compose 模式、语音输入,在真实项目里稳不稳,得让子弹飞一阵。探索性 AI 编程助手,「探索性」三个字也是官方自己写的。

冷水泼完,说说我的真实态度。

我还没把它接进日常工作流,今晚回去第一件事就是装一个。不为别的,就为亲眼看看那个记忆 subagent 是怎么在窗口快满时重建简报的,这事对我有职业意义上的吸引力。装一个的成本就一行命令加几分钟,看不顺眼 rm 掉就是,这种试错便宜得近乎免费。

如果你平时用 Claude Code 或者 Codex 用得顺手,我倒不觉得你需要换。工具的迁移成本从来不在安装,在肌肉记忆。但如果你还没用过这类终端助手,或者被 API 账单刺痛过,一个内置免费模型、全中文、MIT 开源的选项,作为入场券真的挺合适。

更何况它开源了。这件事的价值会慢慢显出来。OpenCode 的底子,加上一套被验证过能涨 5 个点的记忆和规划设计,MIT 协议摆在 GitHub 上任人翻看。就算 MiMo Code 这个产品本身没成,这些设计也会被社区拆走、抄走、改进,长到别的工具身上。开源世界的好东西从来不会浪费。

最后多说两句。

写这篇的时候我一直在想「不赌模型自觉」这六个字。这两年整个行业其实都在经历这个祛魅过程,从指望下一代模型解决一切,到老老实实承认,模型就是个很强但不可靠的伙伴,得给它配检查点、配看门狗、配记忆外挂,像给一艘性能很猛但罗盘会漂的船配领航员。

模型负责猛,工程负责稳。船才开得远。

好家伙,写完发现我一个搭脚手架的,给同行的产品发布文写了四千字读后感。但有点子牛逼的设计就值得被认真对待,这是我写这个号的初衷,也是今天看完公告最想说的话。

更多技术细节在小米的团队博客,感兴趣的可以自己翻翻。装完有什么体感,欢迎回来留言区聊。