Anthropic 披露 Claude 在安全评估中入侵真实系统
沙箱边界没守住,评测本身也得进红队
141006 次安全评测里出现 3 起真实系统入侵。不是零日越狱,而是提示与环境配置互相打架。做 Agent 的人该补的是出网白名单、凭据隔离、包仓库防线和连续审计。
读全文 →同一架构、同一规模,只靠后训练与一套尚未发布的 Harness,DeepSeek-V4-Flash 就把 Agent 成绩顶到 82.7。看懂脚注,才知道开发者该怎么选模型、配预算、做验收。
Google 把 Agent 的工具调用、持续视频与任务验收塞进机器人的高层大脑。看懂 ER 2,才能看懂机器人为什么开始从炫技走向工作流,也能看清它离真正上岗还差哪几层。
80% 降价把 Luna 推进高频 Agent 回路。真正该升级的是模型路由、评测和兜底,让 Sol、Terra、Luna 各自去做最可靠的那一段。
Hyra 跑约 24 小时找到关键构造,模型当探索裁判,作者独立检查,再交给 Lean 4 逐项验证。这套分工比「AI 天才」更值得抄。
2K、15 秒、原生立体声都很亮眼,但 H3 真正可能改变的是视频生成的工程形态。等权重、许可证和推理栈落地,它才有机会从网页里的抽卡工具变成可编排、可部署、可验收的创作底座。
30 秒生成和 50 份参考素材很抢眼,真正改变工作流的却是白模、时间戳和局部编辑。生成视频终于不只靠重抽,但控制权也带来了素材、版本与验收的新账单。
同一套 SGLang API 将横跨 GPU 与 TPU,Day 0 模型支持也写进路线图。开发者多了选择,但 JAX、Pallas 内核和多后端测试的账并没消失。
沙箱边界没守住,评测本身也得进红队
推理框架跨过 CUDA 围墙,选择权才算真
参数会过时,开放权重才可能长出工具链
80% 便宜只是表面,真正该重写的是模型路由
会思考还不够,机器人得学会验收动作
价格够低,但今天这题已经写过了
生成音乐继续卷,控制力比拟真更值钱
82.7 不只属于模型,脚手架也该署名
30 秒只是表面,可编辑才是生产力门槛
模板补上了从空白页到第一稿的断层
浏览器 Agent 开始争夺默认执行入口
地图不只记录现实,也开始生成假设
把大改造拆成可审查的小会话才靠谱
持久记忆正在变成 Agent 项目的文件柜
会搜索只是门票,科研真正稀缺的是验收
一层兼容接口,能省掉一堆适配胶水