Research Gold 号称全人工,调查称其全程由 AI 驱动
争议够热,但真人与公司指控不适合无人值守。
Claude 数周开出 388 个维护 PR,最终合并 180 个。未合并的 208 个比成功案例更有价值,它们提醒团队先设计任务边界、验收门禁和反馈回写。
读全文 →预热环境只是表面,最近成功版本、提交溯源和密钥分层才决定云 Agent 能否稳定交付。附一张迁移验收单。
推广价只管到年底,thinking token、重试与工具费才决定真实成本。用一张生产验收账,判断该不该迁。
同一基座靠后训练把 Terminal-Bench 3.0 从 4.6 拉到 28.3,但发布当天只有 API,没有权重。拆清今天能验证什么、两周后还要查什么,以及切模型前必须改的配置。
同一模型只改两处 Agent 架构,ARC-AGI-3 得分从 13.3% 升到 38.3%,输出 token 反而少约 6 倍。真正该升级的,可能是模型外面那层系统。
争议够热,但真人与公司指控不适合无人值守。
十亿用户是大数,开发者的成本账更值得今天写。
榜单先到,权重两周后才算正式验收。
价格砍半很猛,真正的考题还是长任务稳定性。
五分钟整歌能生成,版权与可控性才刚上桌。
参数量够吓人,服务价格才是开发者的入口。
正式版刚写过,重复追只会稀释判断。
Agent 起跑慢,根因常在环境,不在模型。
表格终于会变应用,权限边界别跟着变糊。
插件树已经拆过,今天不拿同一题再炒一遍。
搜索预算的坑昨天写透了,今天换一张系统账。
系统性失败值得看,但昨天已经把账拆完。
别只换大模型,先把智能体的系统账算明白。
388 很猛,208 个未合并才是验收账。
门控思路很实用,昨天刚写完不再复读。