Redis 之父一个人写了个 DS4,DeepSeek V4 在 Mac 上跑 26 tok/s

小岛AI 2026 / 05 / 10

Redis 之父一个人写了个 DS4,DeepSeek V4 在 Mac 上跑 26 tok/s

5 月 7 号 Salvatore Sanfilippo(antirez)——你可能更熟悉他另一个名字,Redis 的爹——在 自己 GitHub 上扔出了一个新项目,叫 DS4

DS4 是干嘛的?

A dedicated inference engine for DeepSeek V4 Flash on Apple Silicon, written in C and Metal.

一个专门DeepSeek V4 Flash 在 Apple Silicon 上做推理的引擎。C 语言写的核心,Metal API 调 GPU。

这件事炸的点不在 DeepSeek,也不在 Apple Silicon——这两个生态都已经热了一年了。炸的点是:antirez 一个人,3 个月,写出了一个能跟通用推理引擎抗的专用工具

一、什么叫”专用引擎”,跟 Ollama / llama.cpp 区别在哪

要看明白 DS4 的价值,先看 antirez 的设计选择:只跑一个模型

不是「支持多种模型」、不是「插件化架构」、不是「通用 inference framework」。就是给 DeepSeek V4 Flash 这一个模型——精确到这一个 MoE 架构、这一组 expert 数量、这一种 attention 实现——量身做的引擎。

对比一下生态里现有工具:

  • llama.cpp:通用 LLM C 推理引擎,支持几乎所有开源模型
  • Ollama:基于 llama.cpp 的封装,把模型管理 / 启动 / API server 都一站式做好
  • MLX:Apple 自家的 framework,给 M 系列芯片做的 ML 通用栈
  • vLLM:服务端高性能 LLM 推理,主要做 batching 和 throughput

这些都是 “支持很多模型” 的通用 runtime。每个模型来都得适配,每个新架构都要扩展。代码越长,每个具体模型上的优化就越打折扣。

DS4 走另一条路。它只服务 DeepSeek V4 Flash 一个客户。MoE 路由怎么做、哪些 expert 组合常用要 cache、attention 矩阵在 Metal 上怎么 tiling,全部按 V4 Flash 这一个模型的具体形状定制。

结果就是这个数字:

在 MacBook Pro M3 Max 128GB RAM 上,Q2 量化跑 26 tok/s,峰值功率 50W

先解释下 tok/s 这个单位——tokens per second,每秒模型能生成多少个 token(一个 token 大概对应半个汉字或一个英文单词)。

26 tok/s 是什么概念?

  • 人正常阅读速度:5-7 tok/s
  • GPT-4 在 ChatGPT 网页版:30-40 tok/s
  • DS4 在 M3 Max 上:26 tok/s

意思就是一个 284B 参数的大模型在你笔电上跑得跟 ChatGPT 网页版一样快——你打开 ChatGPT 是什么体验,跑 DS4 就是什么体验。差别是 ChatGPT 是 OpenAI 的卡在远程服务器跑,DS4 是你笔电自己跑,完全离线、不付任何云端费用

50W 是什么概念?M3 Max 满载约 100W,这个引擎跑推理只用了一半。意味着你完全可以不连充电器就跑大模型

Specialized components that do one thing very well.

这是 antirez 一贯的写代码哲学——他写 Redis 的时候就是这个思路。“Do one thing very well” 来自 Unix 哲学,但很多年没人在 LLM 推理这个新领域里认真贯彻了。

二、为什么这件事是单兵 hacker 复兴的信号

DS4 这件事更深一层的价值,不在于代码本身(虽然代码也很猛),在于它证明了一种新的开发模式

具体说就是:

一个程序员 + AI 协作 + 3 个月专注工作 = 能在专门细分领域打过通用大厂。

36kr 的英文报道 总结了这个观察:

A single programmer with AI assistance and three months of work can write an inference engine that beats the benchmarks of generalist runtimes on a specific model, and that he can do it on desktop hardware.

这句话过去 5 年是不可思议的。LLM 推理引擎这种活儿,业内默认要个 8-15 人团队、半年到一年开发周期、深度 GPU 编程经验,才有可能做出能打的产品。MLX 这种是 Apple 整个 ML 团队投入了几年才搞出来的东西。

antirez 一个人 3 个月做了个能打它的细分版本。为什么可能?两个原因。

第一,AI 把”陪练”成本降到了几乎为零

写一个 inference engine,过去最大的成本是 debug + 文档查询 + 反复试错。新框架你不熟,写 Metal kernel 的边界条件你不熟,MoE 的 expert 路由你不熟。每一处都得 google + Stack Overflow + 翻 paper + 试。

现在 Claude Code 把这一层全吃了。你只需要描述要什么,AI 把 code 生出来、解释为什么这样写、跑不动了告诉你 debug 该看哪里。所有”陪练”环节的时间成本被压到接近 0。

好家伙,3 个月做完 DS4 这种规模的项目,10 年前几乎不可能;5 年前要团队;现在一个人能干

第二,“专用胜通用” 这个老理论,在 AI 时代重新被验证

通用工具的价值在于覆盖度——MLX 能跑各种模型。代价是任一具体模型上不能做到极致优化,因为优化就要绑定具体形状,绑定了就破坏通用性。

但人类用 LLM 时大多数时候只用 1-3 个模型。绝大多数日常用户只跑 Claude / GPT / DeepSeek 一两个。“通用支持” 对这些用户的实际价值是 0。他们要的是”我天天用的那个模型,跑得越快越好”

DS4 在做的就是这个洞察——反通用化,给具体场景写专用工具。

类似的判断在前端工程也在发生:tailwindcss 反通用 CSS 框架(utility-first),bun 反通用 Node runtime(specialized speed),uv 反通用 Python tooling(一统所有 tooling 在一个二进制里)。

反通用化是这个时代的大主题,DS4 是这个主题在 LLM 推理这个细分上的代表作。

黄昏的山顶上一堆营火,旁边一个剪影身影坐在笔电前敲代码,星空在远处缓慢转动,整体氛围是一个孤独 hacker 在山里做出能跟世界对话的工具

三、antirez 的来历给了 DS4 哪些权重

要懂 DS4 为什么值得看,得懂 antirez 是谁。

Salvatore Sanfilippo (antirez) 是 90 年代末从意大利 Catania 出来的一个 self-taught hacker。早年写过一个叫 hping 的网络工具——现在网络渗透圈还在用。

2009 年他 release 了 Redis。那时候 Redis 的代码全部由他一个人维护,单线程 C 实现,几千行核心代码。后来 Redis 成了今天几乎每个大型 web 服务背后必装的组件,估值 20 亿美元的公司是基于他这几千行代码长起来的。

2020 年 antirez 从 Redis 公司退休,公开宣布 不再做 Redis 核心维护,转向”做小项目,写博客,hack things for fun”。

2024 年他出了 llama2.c 风格的小推理引擎(虽然原版 llama2.c 是 Karpathy 的,antirez 在生态里做了类似贡献)。

2026 年他回归 Redis 团队但不全职,同时继续 hack 个人项目。DS4 就是这条线上的最新作品。

这个履历有点子牛逼的地方是:antirez 一直在用同一种姿势工作——用 C 写小、专、快的工具。30 多年没变过。

很多 hacker 中年后会被生态的复杂性慢慢同化——开始用 framework、用 IDE、用 ORM、放弃手写底层。antirez 没有。他坚持「能用 C 写就用 C 写」、「能 1000 行解决就不写 5000 行」。

DS4 不是一个偶然的 side project。它是 antirez 30 年坚持的那种姿势在 AI 时代的最自然产物

这给 DS4 加了双重权重:

  • 技术层面:antirez 写过 Redis 这种 production-grade C 代码,他的代码可信
  • 哲学层面:antirez 这种 “specialized + small” 的判断,已经被 Redis 的成功验证过一次了——同一种判断在新领域可能再赢一次

四、对我们普通程序员的三个具体启发

DS4 不是给我们抄的(除非你刚好需要在 Mac 上跑 DeepSeek V4),但它的方法论值得每个程序员吃透。

启发一:找一个你天天用、但通用工具做得不够好的细分场景

通用工具最大的盲区是高频用户的极致体验。你可能每天用 ffmpeg 转一种特定格式视频,每天用 docker 跑一种特定 stack,每天用某个 API 调一种特定 endpoint。通用工具支持这些场景,但都是”够用”级别。

挑一个你最痛的场景,问自己:如果只针对这一个场景做专用工具,3 个月能做多远?

DS4 给的答案是「能做到打过大厂团队」。你的答案可能不一样,但你不试就永远不知道。

启发二:AI 协作不是写代码,是写 specification

Antirez 在 podcast 里讲过他用 Claude Code 的姿势:他不直接让 AI 写代码。他先写一份非常具体的 specification——这个数据结构长什么样、这个函数的边界条件、这个内存 layout 的对齐要求。然后让 AI 实现。

spec 写得越具体,AI 实现越精准。这跟 vibe-coding(“嗨 AI 给我写个 redis client”)完全是两条路。Vibe-coding 给你一坨能跑但不优雅的代码。Spec-driven 给你的是 antirez 级别的 production code。

3 个月写 DS4 的关键在 antirez 的 spec 写作能力,不在他的代码量。

启发三:单兵开发的复利时代正在回来

90 年代末到 00 年代初,是 hacker 单兵作战的黄金时代——Redis、SQLite、curl 这些今天的基础设施都是单人或者小团队做出来的。

10 年代之后这条路慢慢消失,因为生态复杂度爆炸,单人维护不起一个有竞争力的项目。

现在因为 AI,这条路在回来。你不再需要团队帮你处理 boilerplate,AI 把这一层吃了。剩下的就是”你想做什么 + 你能写好 spec”。

DS4 是这条路的明确证据。它不会是最后一个。下一个可能是你。

窗台特写:一台 MacBook 屏幕上跑着代码编辑器和终端,旁边一本翻开的笔记本写着架构草图,一杯咖啡冒着热气,盆栽绿叶向阳——氛围是一个安静的 hacker 在自己房间里做底层工具

五、给读者今天就能动手的事

光感慨不够,给三个能立刻动手的具体动作。

第一个:clone DS4 跑一遍

git clone https://github.com/antirez/ds4
cd ds4
make
./ds4 --help

如果你有 M 系列 Mac + 32GB+ 内存,可以跑起来体验一下。读 antirez 的 C 代码本身就是教材——他的命名、注释、内存管理姿势是行业级的范例。

第二个:找一个你的 antirez moment

问自己一个问题:「如果 AI 把 boilerplate 全吃了,我会想做什么?

不是想象的「等 AI 再强几代我能做什么」,是今天就能做的那个。

可能是一个你天天用的工具的更快版本。可能是一个你同事都抱怨过但没人写的内部 utility。可能是一个 niche 场景的专用 framework。

挑一个,开始写 spec。

第三个:换种思路看通用 vs 专用

下次你纠结「用现成的通用工具 vs 自己写一个专用」时,不要默认选通用

通用工具有它的价值,但它的成本也越来越高——学习曲线、文档复杂度、cross-version 兼容。AI 让”自己写一个专用”的成本骤降。

很多时候自己花一个周末写一个 200 行的专用工具,比用一个 200K star 的通用框架还快

写在最后

antirez 在那个发布 DS4 的 README 里 没写营销话术,没写 benchmark 对比表。他只写:

This is what I think makes for elegant inference: take one model, study its specific shape, write code that respects that shape exactly.

翻译:我觉得这才是优雅的推理——拿一个模型,研究它的具体形状,写完全符合那个形状的代码。

这句话听起来朴素到不像 2026 年。但它点透了整个 AI 工具生态接下来 5 年的最大机会——从「跑得动各种模型」走向「为我天天用的那一个模型跑得最快」。

我们这些围观的程序员,最大的价值不是赞叹 antirez 多猛,是问自己一个问题:

如果 antirez 的姿势在 AI 时代成立,那它具体在我手里能做出什么?

这个问题没有标准答案。每个人都得自己写。但这个问题值得你今晚就开始想