OpenAI 将 Astra 列为首个关键网络安全模型
能力到了关键级,发布节奏就不能只看跑分。
跨会话摘要省掉了反复解释,却不会自动处理文件冲突、失败重试和验收。这里给出一套能直接拿去用的多会话协作边界。
读全文 →Kitesurf 用 V8 isolate 把网页任务压到 Chromium 七分之一内存,但速度更慢、兼容性更窄。真正能省钱的不是换引擎,而是给 Agent 做双引擎路由和失败回落。
Anthropic 把生物相关回退压低约 85%,真正该抄的不是数字,而是把安全拦截、误伤、降级成本和可观测性放进同一本上线账本。
48.8% 是 batch 32 下的 TPOT 降幅,不是整次请求耗时。拆开 TTFT、decode、排队与工具调用,才知道这次 HPC-Ops 对谁最值。
一条命令能省掉持久化、沙箱、身份和评测基础设施,也会把依赖从模型 API 上移到运行时。上线前先把这笔账算完整。
Critical 不是一张吓人的能力标签,而是一道会中断训练、测试和上线的发布闸门。拆开这套机制,看看普通 Agent 团队能抄走什么。
三日预报追平过去的两日水平,只是起点。更值得学的是 1000 条情景、三类指标和专业预报员如何把模型输出变成可执行判断。
能力到了关键级,发布节奏就不能只看跑分。
十亿用户之后,任务完成率比问答次数更值钱。
超过人类是 6 月的事,财报新的只是更大外推。
124B 只激活 5.1B,部署账本比总参数更诚实。
参考数暴涨后,一致性验收才是真正的硬活。
多一天不是跑分,得先接进预警行动链。
会传话只是起点,抢文件和验收还得自己管。
智能体浏览器开始从自动点击走向隔离运行时。
写 agent 越来越便宜,养 agent 仍然很贵。
安全不是一味拒答,误伤率也得进发布指标。
思考滑块把模型选择变成了用户可见的预算开关。
新文档很近,核心架构上个月已经写过了。
48.8% 是高并发长输出红利,不是聊天秒回承诺。
能生成完整基因组后,筛选边界比模型尺寸重要。
插件能搬家之后,真正的锁定会转到运行时。