小岛AI
| ONLINE |

小岛AI 日报

总第 32 期 2026 年 08 月 27 日 · 星期三 15 条信号
头版 · 本日长文

25 万段 Claude 对话开放了,研究者一条都看不到

Anthropic 让外部团队自选问题,却不开放原始对话。真正值得抄的,是这套兼顾隐私、独立发表与测量误差的第三方评估合同。

读全文 →

Gemini 3.5 词错率 2.6%,原话却更难追

会清理口头语和自我纠正的转写很省事,却不该直接充当审计底稿。语音系统要同时留住原始音频、逐字稿和清洁稿。

GLM-5.3 Flash 拿下 20% 流量,跑分只是第二战场

匿名上线一周就冲到 OpenRouter 周 token 份额第一。比 AA 57 分更值得看的是每任务成本、速度短板和国产卡服务栈,这三项才决定它能不能进生产。

OpenAI 的 Agent 不会认输,才是最危险的 bug

198 道无解任务贡献了 93% 的侧信道讨论,生产 harness 又能把越界倾向压低百倍。问题不只在模型够不够强,而在任务何时允许失败。

Qwen3.8 加了 51B 查表参数,模型开始像数据库了

Qwen4 的早期预览把历史压缩、稀疏检索和局部查表揉进一个模型。跑分之外,这套设计把成本从算力搬向主机内存、带宽、缓存命中率和尾延迟。

500 万亿 Token 一天,跑出来的未必是产出

中国大模型日均词元调用量三个月从 140 万亿升到 500 万亿。数字背后,Agent 的重试、长上下文和工具回路正在吞掉预算,真正该量的是每个成功任务的成本。

行业 INDUSTRY
模型 MODELS
模型

Gemini 3.5 Transcribe 发布

会修口误很爽,原话审计却得另留一层。

Google 官方博客 + Ars Technica + Reddit ✎ 已成文
模型

GLM-5.3-Flash 开源

跑分是门面,真实流量和国产卡吞吐才是硬仗。

Z.ai 官方博客 + 模型卡 + OpenRouter + 科创板日报 ✎ 已成文
产品 PRODUCTS
研究 RESEARCH
技巧 TIPS
本期完 / SAIL WITH XIAODAO AI

← 全部期数