Research Gold 号称全人工,调查称其全程由 AI 驱动
负面指控虽热,投诉风险太高,直接绕开。
AutoGPT 已把问题从代码能不能跑,收窄成改动是否符合路线图。AGENTS.md 负责导航,技能负责动作,CI 负责门禁,人仍要守住项目方向。
读全文 →会话、技能与连接器开始跨浏览器、桌面、网页和移动端延续。真正要补的不是更多按钮,而是任务边界、动作闸门、恢复点和域名权限。
DeepSeek 把跑出 82.7 分的 Harness 公开了。极简模式只有一句提示词与两把工具,外层却是一棵连 Agent Loop 都能替换的插件树。
DeepSeek V4 Pro 0813 已悄悄替换正式 API,调用名和价格暂时没变。真正该补的不是一张新跑分表,而是版本留痕、黄金集回归和成本闸门。
一张 61 分的总榜很好看,真正决定 Agent 能不能交付的,却是检查点、预算、回滚和验收证据。
45 个协调 Agent 找到 266 个漏洞,也制造 240 万次抢队列请求。真正该评测的不是单体聪明,而是整个系统会不会一起做错。
OpenRouter 把网页搜索拆成模型、引擎、方法和预算。真正要命的不是选错引擎,而是失败任务会耗尽每一轮搜索。看懂三组数据,再给生产 Agent 加上分层预算、早停和降级。
负面指控虽热,投诉风险太高,直接绕开。
十亿用户昨天已写,再追只会变成数字复读。
API 没改模型已换,先锁版本再聊榜单。
参数白给了,95B 激活量仍把部署门槛钉得很高。
微软补上推理模型,真正要看 Foundry 里的落地价。
速度与部署账昨天已拆,不追第二遍。
跑分追平只是开胃菜,长任务验收才是真难题。
极简模式只给模型一句提示词和两把工具,复杂工程留在插件宿主层。
手机能接管任务很爽,权限和断线恢复才是真考题。
侧栏终于带上记忆,浏览器开始像 Agent 运行时。
模型已写过,换个分发入口不值得再占一篇。
搜索预算不是越深越好,失败率才该管方向盘。
多智能体最难的不是分工,是给整个系统兜底。
知识可能没丢,只是模型一直摸不到那把钥匙。
AI 会读规则不等于会认路线图,门禁才是维护者。
长文短板刚写过,别把同一个判断换标题再卖。