小岛AI
| ONLINE |

posts/anthropic-mhs-physical-agent.md

MHS 最值钱的不是机械臂,是急停按钮

小岛AI 2026 / 08 / 28

一扇实验室的门被推开,空气温度和压力跟着晃了一下。

量子计算机的激光锁丢了。

QuEra 的专家平时要花五到十分钟把频率拉回目标。团队也不是没写过自动化脚本,激光工程师、软件工程师、算法专家和测试人员折腾了几个月,做出一套照着人工步骤执行的恢复程序。它每次要跑约 150 秒,成功率只有 58%。门一开,前面已经调好的步骤可能又失效,线性脚本只好从头再来。

后来,QuEra 把这套设备接进 Anthropic 刚公开的 Model Hardware Standard,简称 MHS。Claude 通过统一接口读取仪器、移动控制器、制造扰动、看日志,再修改脚本。几百轮无人值守迭代之后,开发阶段的恢复时间降到约 6 秒,成功率升到 96%。完成后的脚本拿去做 700 次盲测,成功了 695 次,也就是 99.3%。

更关键的一句藏在官方长文后面。最终跑进生产的,是一份确定、可检查、不需要 Agent 在线控制的脚本。

好家伙,AI Agent 终于把手伸进真实机器,最漂亮的成果却是把自己从运行现场拿掉。

这才是 MHS 研究预览 最值得聊的地方。别人会写 Claude 控制显微镜、移液器、机械臂,像一支科幻片预告。我更在意它背后的工程选择。模型负责探索和编排,驱动负责翻译和约束,代码负责高速执行,专家保留急停和接管权。

物理 Agent 真正缺的,从来不只是一个更聪明的模型。

QuEra 激光恢复脚本通宵迭代后的速度与成功率变化

图,约 760 轮实验把恢复时间从 150 秒压到 6 秒,开发成功率从 58% 提到 96%。来源,Anthropic 与 QuEra。

先让所有机器说同一种话

实验室设备的接口生态,多少有点像考古现场。

Anthropic 公布的卡内基梅隆大学案例里,机械臂靠目录监听器接收 XML 任务文件,移液器挂在老 Windows 的 ActiveX 和 COM 接口上,读板机干脆没有 API,只能看着图形界面操作。三台电脑,三套控制方式,三种报错脾气。厉害了,任何一个做过企业系统集成的人看到这里,大概都会有一种熟悉的心累。

传统做法是给每台机器写一层专用胶水,再给机器之间写一层胶水。设备换一代,供应商升级一次,胶水继续长。一个科学想法还没开始验证,工程师先去和驱动、文件夹、串口、GUI 自动化打半个月架。

MHS 想砍掉的是这笔集成税。

它给设备套上一层标准驱动,只保留一组很朴素的原语,读取温度、写入温度、查询状态、执行过程。设备再把自己能测什么、能调什么、当前处于什么状态、哪些安全上限不能越过,整理成统一的参考文件。很多只存在于纸质手册和老师傅脑子里的信息,也可以通过自然语言标签写进驱动。

于是,Agent 面对的就不再是一堆厂商方言,而是一份能发现、能理解、能校验的合同。

MHS 用统一接口编排移液器、机械臂和读板机

图,科学家描述目标,Claude 负责编排,所有设备状态与动作都穿过 MHS 驱动。来源,Anthropic 与 Genentech。

这和 Anthropic 早先推出的 Model Context Protocol 有点像,但对象从数据库、文件和软件工具,换成了有重量、有惯性、会发热、会漏液的机器。MHS 还明确支持 MCP、命令行和代码文件三种控制方式,任何模型、任何 Agent 运行框架都可以接,不要求必须用 Claude。

卡内基梅隆团队用它从头写完几台设备的驱动和编排层,大约花了八小时。过去交给供应商做,通常要几周。那套串联移液器、机械臂、读板机和摄像头的剂量反应实验,整体跑得约快三倍。

不是模型突然学会了所有实验仪器,而是接口终于不再逼它从零猜起。

六秒钟不是 Claude 在现场思考

这块需要注意一下。QuEra 那个 6 秒结果,很容易被讲成 Claude 的实时反应已经超过人类专家。

并不是。

官方描述的流程更接近一条离线优化流水线。四个新开的 Claude 实例轮流提假设、改代码、操作真实激光、读日志,再决定下一轮怎么变。它们通宵跑了几百次,把原来一条路走到底的线性脚本,逐渐改成会根据仪器状态选择分支的决策树。

Claude 提假设、改脚本、跑真实硬件并分析结果的迭代回路

图,AI 参与假设、实现和分析,真实硬件执行区由确定性脚本控制。来源,Anthropic 与 QuEra。

等脚本成熟之后,Agent 退出。真正处理激光失锁的,是那份已经验证过的确定性程序。简单扰动在 0.9 到 5.4 秒内恢复,最难的一批也只要 10 到 14 秒。

坦率讲,这个架构比「让大模型永远待在控制回路里」靠谱得多。

大模型适合处理目标含糊、搜索空间巨大、需要提出假设的阶段。它可以试不同参数,可以从失败日志里找模式,可以把专家的判断变成代码。可一旦进入毫秒级动作、精确顺序和重复执行,继续让模型每一步都在线推理,只会把延迟、成本和随机性一起带进现场。

Anthropic 在 MHS 官方说明里也写得很直白,长时间任务或速度快到在线推理跟不上的操作,应当把驱动命令串成代码文件,让设备自己执行,不必让 Agent 每一步都重新想。

如果把这套分工搬回日常的软件 Agent,画面其实很熟。

Agent 可以探索仓库、提出迁移方案、生成脚本。真正上线时,数据库迁移仍该交给经过审查的 SQL,流量切换仍该交给确定性的部署控制器,权限边界仍该由系统强制执行。不要把模型的判断力和执行器的确定性揉成一团,然后祈祷它每次都发挥稳定。

我是真的觉得,MHS 给 Agent 工程补上了一堂很朴素的课。

探索可以概率化,执行必须尽量确定。

气泡不认你的重试策略

真实世界还有一件很烦的事,错误码后面经常不是软件问题。

Genentech 用 MHS 做 BCA 蛋白测定时,需要移液器处理普通水和黏稠的蛋白样品。Claude 一开始给两种液体选了差不多的通用流速,黏稠样品被搅出气泡,移液体积和光学读数都跟着偏。

系统报错之后,Claude 的默认反应很像我们熟悉的重试中间件。换个参数,在同一个孔里再来一次。

结果越重试,泡沫越多。

这一下给我整不会了,但又非常合理。模型看见的是操作失败,实验专家看见的是液体已经被搅坏。前者会调整参数继续调用工具,后者知道必须换一个干净孔位、减少混合次数、把动作放轻。两边缺的不是同一条日志,而是对失败介质的理解。

研究人员把这层物理原因告诉 Claude 之后,团队又把处理经验写进可复用的液体操作技能。后续遇到不同黏度的液体,系统才有了更合理的默认参数。

这里的顺序很重要。不是模型凭空悟出了物理学,而是专家识别根因,系统把经验固化,下一次少踩同一块坑。

卡内基梅隆的安全测试更直接。他们人为制造了六种异常,包括托盘缺失、托盘旋转、读板机忙碌、摄像头断开、设备不可达和急停激活。系统在任何设备移动前拦住了全部六种。随后,模型发现第一轮剂量反应曲线拟合太差,主动丢弃旧板、缩小浓度范围,在新板上重跑,第二轮得到可用曲线。

后半段展示了 Agent 的判断力,前半段才是系统敢让它动手的前提。

你想想看,少了那六道确定性检查,模型就算有九成九的任务成功率,也可能在剩下那一点概率里撞机械臂、毁样本,或者让一束不该移动的激光继续移动。提示词可以提醒它谨慎,安全联锁却不能只写在提示词里。

这话听着有点刺耳,但物理世界不接受「下次注意」。

真正的产品,是那条可退回的边界

MHS 现在仍是有限研究预览,还没有正式开源,也只支持具备可编程接口的设备。Anthropic 自己承认,Claude 的空间和物理推理仍有限,复杂故障需要专家监督。QuEra 的 Agent 也会因为觉得动作有风险而等待人工确认,实验可能就这样停一整夜。

所以,先别急着喊自主工厂来了。

但对做 Agent 的工程师来说,这套雏形已经给出几条很实在的线索。

能力应该先被描述,再被调用。设备的状态、过程、参数和限制要进入同一份机器可读合同,别让模型靠看一份三百页 PDF 猜哪条指令能执行。

危险动作要在驱动层设限。速度、角度、温度、碰撞条件、急停状态,不该只是 prompt 里的温柔提醒,而该是执行器无法绕过的硬约束。

慢思考和快控制要分开。Agent 负责找方案、写代码、做验证,生产动作尽量沉淀成可审查的脚本或控制器。模型挂了、网络断了、上下文丢了,机器仍然知道怎么停下来。

失败经验还得留下。气泡为什么不能重试,某种激光漂移该先碰哪个旋钮,这些结论要变成技能、测试和保护条件,不能只躺在一次对话的上下文里。说真的,一个不会积累故障知识的物理 Agent,只是把昂贵的事故重播得更快。

MHS 最有野心的地方,不是让 Claude 多一双机械手,而是试着给模型、驱动、设备和人划出一条可以协作,也可以随时退回的边界。它从 HHMI Janelia Research Campus 一套互不相通的脑成像设备起步,现在已经延伸到药物实验、机器人和 QuEra 的量子激光系统

实验室的门以后还是会被推开,温度和气压还是会变,模型也还是会误判。

好的系统不赌这些事永远不会发生。

它只保证,门开了以后,机器知道什么时候继续,什么时候停。