小岛AI
| ONLINE |

posts/endeavor1-private-deployment.md

Endeavor 能私有部署,不等于模型属于你

小岛AI 2026 / 09 / 01

同一个 Endeavor 1.0,Flower 这次给了两扇门。

一扇通向 Flower 托管的 API,部署、扩缩容和模型运维由他们负责。另一扇通向企业自己的基础设施,模型和工作负载留在自家环境里。

门上写着一句很诱人的话,前沿 AI,由你控制。

好家伙,企业买模型最想听的几个词,前沿、私有、控制,全齐了。

Flower 在 9 月 1 日发布 Endeavor 1.0,把它定位成面向推理、编码和长时运行 Agent 的通用模型。官方公布的四项成绩很亮,GPQA 92.0,HumanEval 98.2,AIME 2026 拿到 99.9,IFEval 94.1。

在 Flower 自己列出的比较里,Endeavor 的 HumanEval 高过 GPT-5.6 Sol 和 Claude Fable 5,AIME 2026 与两者持平。它还在三项里领先 Kimi K3,四项都领先 Nemotron 3 Ultra。

听着已经能坐进前沿模型那桌了。

可发布页继续往下翻,会碰到一排空格。模型参数规模没写,上下文窗口没写,推理价格没写,私有部署需要多少 GPU 没写,许可证没写,权重怎么交付也没写。现在还是限量预览,只接受少量组织申请,不是注册账号就能调用的自助服务。

我没拿到预览资格,没法给它补一份民间实测。下面的判断只基于 官方发布页模型页五页数据表。跑分是官方自报,目前也没看到独立团队复现。

先把边界摆在桌上,免得一篇分析写成替厂商验货。

Endeavor 1.0 官方主视觉

图片来自 Flower Labs 官方发布页。

私有部署只回答模型跑在哪

很多企业听见私有部署,脑子里会自动补全一整套好处。数据不出域,版本由我锁定,服务不会突然断,价格不会说涨就涨,供应商哪天换策略也不影响生产。

现实没这么省心。

私有部署最确定回答的,只有运行位置。推理发生在谁的机器上,输入和输出经过哪条网络,日志落在哪块盘里。它对数据边界很重要,尤其是金融、医疗、法务和内部知识库这类场景。

可模型控制权还有好几层。

你有没有权重,拿到的是原始文件、加密镜像,还是只能通过厂商交付的运行时启动。许可证允不允许修改、蒸馏、微调和迁移。某个版本能不能固定三年,安全补丁又由谁决定。推理栈能不能换成 vLLM 或企业自己的调度系统,还是必须一直依赖厂商组件。合同到期后,模型、适配器、评测集和运行日志能不能完整带走。

这些问题,一个「可部署在你的基础设施里」回答不了。

行业里还有几个经常被混在一起的词。

专属实例,通常只是云上资源不和别人共享。私有网络部署,往往代表服务进了企业自己的 VPC,数据路径更短,但模型运维仍由供应商掌握。机房部署,才是运行时真正落进企业控制的硬件。开放权重又是另一层,企业拿到可加载的模型文件,可以选择推理栈、备份版本,许可证允许时还能继续训练。

四种方式都可能被宣传成「更可控」,它们解决的却不是同一个问题。

只想让客户资料不离开内网,机房里的厂商镜像也许已经够用。想把模型做成公司十年后还能维护的基础资产,就得继续追问权重、许可证和退出路径。想快速上线一个低风险助手,托管 API 反而可能更便宜,也省掉一堆 GPU 利用率、驱动版本和夜间告警。

不是越私有越高级。

是你的风险在哪一层,控制权就得买到哪一层。多买会变成运维债,少买会变成供应商依赖。

举个常见的采购场景,注意,这里是行业里的假设,不是说 Flower 已经采用这种交付方式。

模型镜像放进了企业机房,网络也切断了,数据确实没有出域。可镜像只能用厂商许可证启动,升级要等厂商签名,推理优化也只能让厂商来做。企业拥有机柜、电费和告警,模型的生命周期仍然握在别人手里。

这也算私有部署。

但它和拿到可迁移权重、清晰许可证、可替换推理栈的控制程度,压根不是一回事。

Flower 自己其实碰到了这个区别。四个月前发布的 Lizzy 7B可以从 Hugging Face 下载,官方明确写着兼容 vLLM 等主流推理栈。Endeavor 当前给出的入口只有 Flower 托管和申请私有部署。两者都能在自己的环境里运行,公开程度却不在同一个档位。

厉害了,部署地点看起来只是个基础设施选项,往下挖却一路挖到了采购合同、许可证和退出方案。

四项跑分很亮,企业仍缺一张成绩单

先看 Flower 公布的数字。

Endeavor 1.0 官方四项基准对比

数据来自 Flower 官方发布页,尚无独立复现。

Endeavor 在 HumanEval 上拿到 98.2,是表里最高。AIME 2026 的 99.9 与 GPT-5.6 Sol、Claude Fable 5 持平。IFEval 94.1 排在 GPT-5.6 Sol 之后,GPQA 92.0 则低于表里的 GPT-5.6 Sol、Claude Fable 5 和 Kimi K3。

这组结果足以说明它值得继续看,不能说明它已经通过企业生产验收。

HumanEval 测的是相对短小的代码题。AIME 是数学竞赛。GPQA 看高难科学问答,IFEval 看指令遵循。它们能帮我们判断模型的基础能力,却很难回答一个 Agent 跑两小时后会不会忘记约束、工具报错后能不能恢复、权限不足时会不会乱找旁路、改完代码后会不会真的跑测试。

Flower 显然知道这个缺口。发布材料专门强调,模型表现不只来自权重,还来自推理预算、上下文维护、工具解释、检查、修订和失败恢复这一整套系统。

这句话我很认同。

一个模型在你的 Agent 里能不能干活,确实取决于模型和脚手架怎么咬合。工具 Schema 写得烂一点,重试策略莽一点,日志截断早一点,再强的模型也能给你表演一个原地打转。反过来,一个会保存状态、校验证据和合法停下的运行层,常常比多涨两分更值钱。

Flower 还有一套 FlowerBench,把真实企业任务留在参与组织自己的环境中执行,只向外汇总清洗后的指标。这个设计有点子牛逼,专有数据不需要搬出去,评测又能碰到真实工具、内部规则和交付物。

问题在于,Endeavor 的发布页没有给出它在 FlowerBench 上的具体成绩,也没有展示与 GPT-5.6 Sol、Claude Fable 5 的同条件长任务对比。

于是我们现在看见的是一个挺有希望的前沿候选,外加一份还没填完的企业验收单。

差的不是更多跑分。

差的是同样工具、同样预算、同样权限下的任务成功率,失败恢复率,人工接管次数,单任务成本和尾延迟。真要把它接进代码审查、财务分析或内部检索,这些数字比 AIME 再多零点几个百分点实在得多。

还有一张完全没出现的表,部署经济账。

一个 98 分模型如果每个会话要占八张高端卡,另一个 96 分模型只要两张,企业会买谁,答案可能跟排行榜相反。上下文窗口多大,会不会用 MoE,推理时激活多少参数,量化后掉多少分,批处理能撑多少并发,这些参数决定机房里要摆多少机器,也决定月底电费和显存告警长什么样。

Endeavor 现在连模型规模和硬件下限都没公开,所以「可私有部署」还是一种能力声明,不是一份可计算的建设方案。

这话听着有点扫兴,但采购前把扫兴的问题问完,生产事故时才不用靠运气补答案。

真想买,先把控制权写进合同

企业申请 Endeavor 预览时,我建议别只问一句「能不能私有部署」。那句话太大,销售和采购都容易点头,落到工程师手里才发现每个人理解的不是同一件事。

把问题改成一张能验收的清单。

运行位置  推理、日志、遥测分别落在哪里
权重交付  能否持有、备份、迁移和自行加载
版本策略  能否锁版本,升级与回滚由谁决定
运行时    能否替换推理栈、调度器和监控组件
经济账    硬件要求、并发、延迟和完整价格是多少
退出路径  合同结束后哪些资产可以完整带走

再加两道经常被忽略的门。

一道是评测权。企业要能拿自己的任务、数据边界和错误预算做验收,不能只看供应商挑好的四张成绩单。评测最好能重复运行,模型更新后重新对照,否则每次升级都像闭着眼换发动机。

另一道是审计权。谁能看原始工具调用,谁能导出日志,谁能证明某次回答使用了哪个模型版本、哪套系统提示和哪份知识库。生产事故真正发生时,一句「模型偶尔会这样」没有任何修复价值。

试点也别从一场漂亮 Demo 开始,直接挑一条可重复的真实任务。给 Endeavor 和现有模型同样的工具、预算、权限和输入,让它们跑多轮,再记录成功率、人工接管、单任务成本、失败类型和恢复时间。原始轨迹必须能导出,失败也要留档,不能只保存一段看起来挺聪明的最终回答。

如果私有部署是核心卖点,再做一次断网演练和版本回滚。拔掉外部依赖以后,授权、遥测、更新和监控是不是还能工作。把服务从新版本切回旧版本,Agent 的工具调用和输出格式会不会一起崩。供应商在场时能跑通不算完成,企业自己的值班同学能恢复,才叫接住了。

坦率讲,这套验收不只该用在 Endeavor 上。任何把「企业级」「主权 AI」「数据不出域」写进首页的产品,都值得过一遍。

其实吧,Flower 这次最值得关注的,不是又多了一个自称前沿的模型。模型发布已经多到订阅列表塞不下了。

更有价值的是,它把托管 API 和企业私有部署放进了同一条产品路径。团队可以先走托管服务,等敏感负载、规模或成本到了临界点,再迁到自己的环境。这个方向比一上来逼所有企业自建推理集群务实得多。

可路径能不能走通,要看中间那座桥归谁维护,也要看桥断了以后有没有另一条路。

Endeavor 目前还是预览,很多空格后面可能会补上合理答案。我甚至希望它真能把高能力、私有部署和可迁移性揉到一起。市场太需要一个不是只能租、也不是下载完就自己扛全部运维的中间选项了。

只是现在,还不能把「跑在我的机房」直接翻译成「模型属于我」。

回到开头那两扇门。

别只问门开在哪。

还要问钥匙在谁手里,锁能不能换,以及哪天想离开时,能不能把自己的东西一起带走。