小岛AI
| ONLINE |

小岛AI 日报

总第 28 期 2026 年 08 月 23 日 · 星期六 19 条信号
头版 · 本日长文

100 亿向量塞进 AlloyDB,专用向量库的边界松了

四层 ScaNN 把搜索空间压到 O(N^1/4),但 51 毫秒只是内部测试。看懂尾延迟、召回率和 Preview 边界,才能决定 RAG 要不要搬家。

读全文 →

Anthropic SDK 1.0,最危险的改动不会报错

HTTP 底层换成 httpx2 后,普通调用多半能跑,APM、HTTP mock、异步原始响应和 Bedrock 配置却可能踩坑。这是一份升级前的验收清单。

Codex 能管一群 Agent,还不算调度系统

Codex CLI 0.149.0 把多会话面板和跨会话队列搬进终端。真正难的不是多开几个 Agent,而是让任务所有权、权限、预算与验收都不失控。

Agent 练不出来,先别急着换模型

Google Research 的 EnvHarness 没改模型权重,只让训练环境追着弱点变化,最高多拿 9 分。真正可带回生产的,是让故障轨迹反过来长出回归测试。

机器人百米 9.39 秒,不等于能上岗

赛场把速度和自主控制推到新高,但工厂关心的不是一次冲线,而是连续运行、失败恢复和安全接管。沿着 9.39 秒这条热搜,拆一套具身智能的上线评测合同。

Ling 跑到 1120 tok/s,投机解码别照抄

4 块 B200 把 Ling-3.0-flash 推到 1120 tok/s,但 TPOT 不含首字延迟,接受长度又跟请求分布走。真正能上线的不是峰值,而是一份会拒绝回归的验收合同。

Qwen-UI-Agent 榜单领先,开源开发者还用不上

82.1% 的 MobileWorld 和 92.2% 的真机成绩很亮,但公开目录还没有模型权重与部署入口。顺着这份报告,聊清 GUI 智能体从会点屏幕到能进生产还差什么。

行业 INDUSTRY
模型 MODELS
模型

阿里发布 Qwen-UI-Agent

榜单会操作,生产还得证明会停手。

AI HOT + 千问官方公众号 + 技术报告 ✎ 已成文
产品 PRODUCTS
研究 RESEARCH
技巧 TIPS
本期完 / SAIL WITH XIAODAO AI

← 全部期数