2026-09 61 篇
- 2026-09-15
CI 任务 6 个月涨 25 倍,测试不能再全跑
Anthropic 的 CI 任务在 6 个月内增至 25 倍。真正值得借的不是加机器,而是把测试选择做成有状态、可分片、可观测的服务。
- 2026-09-15
做语音 Agent,81.5 分第一的模型要不要换
GPT-Live-1 在最新语音榜单拿到 81.5 分。可对电话客服、预约和语音助手团队来说,迁移与否不该由 0.2 分决定,先用十通真实电话把打断、工具、成本和兜底验明白。
- 2026-09-15
Siri AI 上线了,中国大陆用户先别急着升级
它能读懂屏幕、跨 app 找资料,也会替你起草邮件。但首轮英语 beta、中国大陆暂不可用、设备与日限额都摆在前面。换机或升级前,先把这五项查清。
- 2026-09-15
做网页先定审美,47.96 万人装的 UI Skill 怎么用
它把模糊的好看拆成设计判断、三个旋钮和交付前检查。适合要做落地页、作品集或重做官网的人,文末有最短安装命令和避坑表。
- 2026-09-15
让 Agent 修漏洞,跑过一个 PoC 还不够
一份公开复核让 AI 补丁 26% 的结论重新回到方法本身。真正能进主干的补丁,得同时经得住原始 PoC、同根因变体、回归和可复核记录。
- 2026-09-14
一首 BGM 改一句歌词,Suno v6 不用再整首重抽
Suno v6 真正值得看的一步,是把配乐从一次性抽卡改成可编辑的工作流。做视频 BGM 时,用 mini 试方向、wild 找意外、v6 收成品,返工会少很多。
- 2026-09-14
ChatGPT Pro $200 暂停新购,已订的人取消前先看这一条
Pro $200 暂停新购与升级后,最容易被忽略的是取消或降级真正生效的那天。把账户状态、账期与替代路径核对完,再动订阅设置。
- 2026-09-14
让 Agent 读 Gmail 很容易,难的是把发送权限留在人手里
gws-gmail 能把 Gmail 的筛选、归类和草稿交给 Agent,但 OAuth scope、提示注入和误发风险不能用一句自动化带过。本文给出先只读、再草稿、再谨慎开放发送的三道门。
- 2026-09-14
做 AI 产品别只盯模型,状态数据才是最难补的一层
OpenAI 的 Habitat 把支撑 ChatGPT、API 和 Codex 的在线数据访问收进一个服务。对 AI 产品团队来说,更值得学的不是 Rust,而是把在线状态、复杂查询和权限治理分开设计。
- 2026-09-14
搜索 Agent 跑分很好,真正该验的是上下文
Iris 把模型、搜索循环、上下文管理和判分器一起开源。看完它的公开数据,就会知道一张排行榜为什么不足以帮你选 Agent。
- 2026-09-14
Android 测试跑到 99%,ARTEMIS 真正接住的是 Bug 复现
Google 开源的 ARTEMIS 把自然语言需求、真机执行、截图和 Logcat 串进同一条链路。99% 的跑分可看,真正值得先试的是把回归与复现留成可回放证据。
- 2026-09-13
React 页面慢,第一刀不该砍 useMemo
Vercel 的 70 条 React 规则把异步瀑布和包体放在最前面。给 Coding Agent 一段按优先级审查的指令,先解决用户真会等的那几秒。
- 2026-09-13
语音 Agent 不该全塞进一个模型,GPT‑Live‑1 的新分工
GPT‑Live‑1 终于进了 API,但全双工只是前台体验的升级。语音层、推理层、工具权限和后台任务仍该分开算账,这份分工表比换模型更值得先做。
- 2026-09-13
Agent 长任务总跑偏,状态管理才是保险
上下文窗口更大,并不等于 Agent 更能扛长任务。把目标、约束、证据和下一步放进可恢复的外部状态,才是跨文件 Bug 和长流程不跑偏的底盘。
- 2026-09-13
代码有点乱时,92 万次安装的 Skill 先画诊断
在一个有连续提交记录的本地语音输入法里实测后,它没把 543 行热键代码拆散,而是把泄漏的剪贴板归还协议收进一个可验证的小模块。
- 2026-09-13
AI 能重写两端,小团队依然值得用 React Native
Shop 用 12 周交付原生版本,但重写速度只回答了一半问题。拿一个真实业务流程试跑,把开发、验收和后续改动放进同一本账,才能判断你该不该迁移。
- 2026-09-13
前沿实验室开始踩刹车,做 Agent 的团队该补什么
模型能力跑得比流程快时,最容易漏掉的不是一条 Prompt,而是可回放的权限、日志和停机边界。这里给 Agent 团队一份能带进上线评审的检查表。
- 2026-09-12
做页面先定设计系统,35.4 万人装的 UI Skill 怎么用
它不替你赌一张好看的页面,而是把产品类型、版式、配色、字体和可用性检查先定下来。附安装命令和一份可直接复制的设计 Brief。
- 2026-09-12
做大功能时,Cursor 的数千 Agent 要过四关
Cursor Projects 把长期任务交给一个协调者管理,真正变重的不是并发数,而是范围、上下文、权限和验收。这里给出一份启动前就能用的检查清单。
- 2026-09-12
DeepSeek 把 Pro 路由给 Flash,省钱不等于能直接上线
9 月 14 日起,DeepSeek V4 Pro 的 API 请求会自动转到 V4.1 Flash。模型不需要手动换,生产验收却必须提前做。
- 2026-09-12
装了 69 个 Skill,开场就吃掉一万 token
Claude Code 这两周补了三条命令,把「我装的这堆技能占多少上下文、到底有没有用」从凭感觉变成可量。我在自己机器上把账算了一遍。
- 2026-09-12
活动运营总漏一环,GitHub Copilot 这套骨架能直接借
GitHub 一位营销负责人把活动筹备收进一张 Issue。真正可借的不是 Copilot 写文案,而是表单、标签、干跑、告警和复盘组成的可审查工作流。
- 2026-09-09
六年预训练实验,数据把算力效率推高 12 倍
一组 7×7 对照实验把模型配方和数据语料分开重训。12 倍只是开头,更值得看的是它如何测量、哪里不能外推,以及训练预算该怎么重新分。
- 2026-09-09
改海报只动一块,ChatGPT Images 2.5 终于有了局部编辑
ChatGPT Images 2.5 最有用的不是把图画得更花,而是把改海报、封面和产品图的返工,收进一套可验收的局部编辑顺序。
- 2026-09-09
Jira 接进 Agent 后,权限和上下文才是主流程
Rovo MCP v2 加了更多产品与工具,但团队真正该先安排的是按需取数、最小权限、人工确认和用量边界。这里有一份可直接照着走的接入检查表。
- 2026-09-08
做 3D 原型,GPT-6 的三条路别走反了
会让 GPT-6 控 Blender,不等于拿到可交付的 3D 资产。Computer Use、MCP 和 CLI 各自该在什么时候上,一份首轮验收清单讲清楚。
- 2026-09-08
AI 产品上线前,先过这 4 道授权和留痕检查
最高法刚公开的 AI 纠纷审理意见,不是一张给产品经理背诵的法规清单。把它翻成上线待办,最该补的是授权、停止生成、证据包和风险说明。
- 2026-09-08
选开源模型,Mistral 的 30 亿欧元该怎么算
Mistral 的 30 亿欧元融资不是让团队今天换模型,而是提醒下一轮模型 POC 把路线、数据、算力与退出条件一起验收。
- 2026-09-08
做后台 UI 别再反复手搓组件,4.9 万人装的 shadcn Skill
shadcn 的官方 Skill 不负责替你画页面,它逼着 Coding Agent 先读项目上下文、查现成组件、看文档再动手。设置页和表单这类高频活,终于有了一条不靠临时样式硬顶的短路径。
- 2026-09-07
Agent 跑夜班前,先给它装一张验收单
OpenAI 的 Agent 运行时已达人力的 3.1 倍,但复杂任务依然离不开人工介入。让 Agent 长时并发前,先把这张验收单贴进任务卡。
- 2026-09-07
Agent 会解释,不等于跑得可审计
OpenAI 说思维链监控正变得更难依赖。真正要紧的不是逼 Agent 多解释,而是在模型之外留住输入、行动、结果和干预四类可复核证据。
- 2026-09-07
给 Coding Agent 升级,先收拾 AGENTS.md
GPT-6 Astra 更会追问,也更认真执行它读得到的规则。升级长任务 Agent 前,先把可直接做、必须确认和如何验收写清,能少掉一半无效拉扯。
- 2026-09-07
做前端别再套 AI 模板:86 万人装的设计 Skill,到底改了哪一步
Anthropic 的 frontend-design Skill 不是一套配色模板。装上前先看这张开工检查表:它怎么把产品语境、字体、布局和自检塞进 Coding Agent 的第一轮工作。
- 2026-09-07
算力预算别只看 GPU,990 亿美元也得算进去
英伟达在最新 10-Q 中披露 990 亿美元股权投资和 250 亿美元承诺。对算力采购者而言,真正该追踪的不再只是芯片报价,还有客户融资、锁定期与未来使用率。
- 2026-09-06
GPT-5.7 官方页还是 404,别急着替它跑分
官方目录、变更日志和直达模型页都没有 GPT-5.7。把截图、路由痕迹和跑分转述写成结论之前,先过一遍这份发布核验清单。
- 2026-09-06
1300 万行 Lean 代码,没替人类发现新数学
Claude 用 11 天把费马大定理做成可复跑、可检查的形式化证明。真正值得盯住的,不是数字有多大,而是验证一项复杂结论的成本开始被改写。
- 2026-09-06
写代码选模型,GitHub 把 67% 成本差塞进路由器
HydraFusion 已在 Copilot CLI 开放研究预览。它不是替你找最强模型,而是把升级、审查和成本核算装进一次任务,附三条试用护栏。
- 2026-09-06
查 SaaS 账单的 Agent,先学会不花钱
xAI 的采购 Bot 案例里,最可抄的不是超过 10 万美元的节省,而是把查账、找人、出方案和对外发信拆成三条权限线。拿走一份可在下一笔续约上试跑的检查表。
- 2026-09-06
Agent 能上网前,先补一张外发日志
OpenAI 的公开复盘提醒我们,给 Agent 开浏览器和外部工具时,真正要一起上线的是可回放的外发记录、安全停止条件和真人接管。
- 2026-09-04
NVIDIA 129 亿要买 Hugging Face,最贵的是模型入口
300 万个模型背后是一条开发者默认路径。看懂 NVIDIA 买下的分发层,并用四项检查把开放承诺变成可验证的工程边界。
- 2026-09-04
GPT-6 Astra 的 99.9%,换个 Harness 只剩 62.7%
同一个 Astra,标准脚手架 62.7%,保留跨调用状态后 99.9%。真正拉开 Agent 差距的,已经不只是模型,而是记忆、工具、权限和验证怎样接在一起。
- 2026-09-04
K2 Horizon 自砍 3.37 分,训练记录比跑分更值钱
六款模型全开只是表面。IFM 主动公开奖励作弊并下调成绩,真正抬高的是开源模型的可审计门槛。
- 2026-09-04
Claude 搬完 7.2 万行汇编,真正值钱的是 0 像素差异
一晚迁完只是热闹。字节级重建、零像素差异、状态探针和真人试玩,才是 AI 接手老系统时真正能抄走的工程方法。
- 2026-09-04
WeatherNext 3 的 60%,不是天气准确率
Google 把全球天气预报从 6 小时批次压到每小时更新。真正难的不是看懂 60%,而是把时效、概率和官方警报写进产品合同。
- 2026-09-04
Funes 让 4 个 Agent 共用记忆,原始会话比摘要更值钱
它把 Claude Code、Codex、pi 与 Hermes 的旧会话索引在本地,召回结果能回到原始轮次。真正该审的是显式上传、密钥扫描和第三方记忆边界。
- 2026-09-03
Muse Spark 1.3 少 25% Token,先别急着算省钱
官方编码比较显示工具调用约少 20%、Token 约少 25%,独立评测却给出了更高的单任务成本和更长的首字等待。选 Agent 模型,得把调用、重试、时延和验收放进同一张账单。
- 2026-09-03
Gemini 3.8 六周三更,我反而不敢自动升级
同价、更强和 47.2% 补丁通过率都很诱人,但生产团队真正缺的不是再点一次切换,而是一条可评测、可灰度、可回滚的模型发布列车。
- 2026-09-03
Claude 退到后台,审批弹窗反而成了新阻塞
后台电脑操作省掉了盯屏时间,也让权限与失败状态更容易被忽略。这里给出一套风险分级、短时授权、事件日志、互斥锁和恢复方案。
- 2026-09-03
产品原型 Skill 71.1 万次安装,三版只回答一个问题
我用同一份示例数据做了目标、上下文、场景三种结构,并验证链接切换、键盘、空错状态和移动端。真正该带走的是答案,不是一次性代码。
- 2026-09-02
Fable 5.1 把缓存砍了 75%,却给迁移埋了 3 个雷
缓存读取确实只剩四分之一,但整单最多约省 45% 有前提。更要命的是,旧 Agent 直接换模型 ID,可能报 400、丢思考块或重启缓存。
- 2026-09-02
AI 写代码过了 87.3%,完整仓库只过 27/43
Vero 把 Agent 送进 43 个仓库级证明题。单条规范过得很漂亮,完整交付却立刻掉队。普通团队不用明天改写 Lean 4,但该把验收从一句测试全绿升级成可复跑的证据链。
- 2026-09-02
Gemini 视频省 88% Token,抽检反而要加码
Gemini 开始自己决定看哪段视频、听哪段音频。账单可能真会降,但证据路径也变得更难复现。这里给一套能直接落进视频 Agent 的双轨验收法。
- 2026-09-02
Qwen3.8-Max 领先 4 分,误差却有 19 分
千问新模型登顶前端代码榜,但 4 分领先仍落在误差区间里。榜首先别急着封神,5 美元混合价和自家任务通过率才更值得团队算一遍。
- 2026-09-02
Cline 免费上 LongCat,最值钱的不是省 Token
Cline 把 LongCat-2.0 放进了免费模型列表。别只看免费和 1M 上下文,趁窗口还在,把模型切换、任务验收、权限隔离和活动结束后的回滚路径跑一遍。
- 2026-09-02
207 个 WebGPU 内核快 2.57 倍,整模型还没跑
Hugging Face 一口气开源 207 个内核,M4 单算子几何平均快 2.57 倍。真正值得抄的不是最大跑分,而是把契约、正确性测试、基准和真实设备证据绑进同一个版本包。
- 2026-09-01
ChatGPT Ads 10 亿美元,答案独立得靠审计
OpenAI 的广告业务不到 200 天跑到 10 亿美元年化收入,但真正难的是证明广告信号没有进入回答、引用与 Agent 动作。本文给出一套可审计的隔离与验收框架。
- 2026-09-01
Solaris 没有 DOM,界面再漂亮也难上线
Runway 让世界模型逐帧生成 720p 交互界面,250 人更偏爱它的自然反馈。真正挡住上线的,却是稳定文字、测试、无障碍、事实校验、长会话和每帧成本。
- 2026-09-01
模型会承认自己作弊,照样继续拿奖励
Anthropic 刻意用 80 个可作弊环境训练一个 Opus 级模型。最麻烦的不是它会钻漏洞,而是它能如实承认作弊,却仍在下一回合继续追分。
- 2026-09-01
这个 UI Skill 60.2 万次安装,专治千篇一律
它不靠再塞一百条审美规则,而是把产品 brief、现有设计系统和一次渲染验收放到生成前后。附安装命令、官方同题对照和付费边界。
- 2026-09-01
Endeavor 能私有部署,不等于模型属于你
Flower 把前沿跑分和私有部署放进同一份发布里,但参数、价格、许可证、权重和退出机制都没公开。企业真正该买的不是机房位置,而是可迁移、可审计、可持续的控制权。
- 2026-09-01
AI 数据中心要电 700GW,电网先别全信
路透社发现,美国多地数据中心接电申请超过 700GW,是当前实际用电估算的十倍。问题不只在耗电,而在重复排队和容量占位如何污染规划信号,以及电网怎样把真项目筛出来。
2026-08 161 篇
- 2026-08-31
H3 Max 跑得比播放快,离直播产品还很远
五秒视频约三秒生成,只够解决画面来不及这一题。连续性、输入缓冲、实时审核和故障恢复,才决定一条 24 小时 AI 频道能不能从演示活成产品。
- 2026-08-31
代码验收 Skill 19.5 万次安装,先跑证据再说完成
它只做一件事,把「应该能过」改成新鲜命令、完整输出和退出码。我用一个语法检查通过但单测失败的最小 demo,拆清它适合接在哪,哪里又管不住。
- 2026-08-31
这个 UI 收尾 Skill 8.7 万次安装,修的是上线前最后 10%
页面已经能用,却总像个半成品。polish 把上线前收尾压成一套有顺序的检查,从坏状态到跨断点,再到对齐和动效,并明确什么时候不该用它。
- 2026-08-31
OpenClaw 2.0 装得更快,权限债也更贵了
引导式安装、远程会话、共享凭据看着都更顺手,但每一层便利都在扩大权限面。这里整理两条破坏性迁移和一份升级前的信任边界清单。
- 2026-08-31
长跑 Agent 别只盯单轮,安全状态得跨轮保留
攻击证据能拆到多轮,让单次轨迹监控器接近猜测。论文给出不衰减风险账本、中介提交和独立裁决设计,也暴露一个难题,安全锁住以后该怎么恢复。
- 2026-08-30
Uber 70% PR 归 Agent,AI 账单却没跟着涨
周请求量半年涨 9.4 倍,总支出却基本稳定。真正可抄的不是 Uber 的规模,而是它把每个合并 PR、每次审查和每个告警都算成结果成本。
- 2026-08-30
多 Agent 刷新 5 道数学题,赢在会写失败报告
19 个结果由多个 Agent 协作完成,跨模型合作有 61.5% 靠持久档案传递。真正可抄的不是六模型群聊,而是让局部成果、错误和证据都能被下一棒继承。
- 2026-08-30
Claude Code 新增受限模式,安全靠的是少给能力
它会移除运行命令和 WebFetch,把文件工具圈在工作区,却不是一键安全。把它接进代码审查和 CI 前,还要补上工具白名单、隔离、身份与审计。
- 2026-08-30
这个 PPT Skill 21.1 万次安装、17.3 万 Star,同题少吃 20% 输入 Token
同一份 8 页产品汇报、同一个模型、同一个公司模板。Skill 没让版式碾压裸模型,却把模板盘点、原生图表和两轮 QA 固化下来,输入 Token 还少了 20.4%。
- 2026-08-30
数万首歌进了诉状,AI 训练台账该补课了
索尼、华纳的起诉把训练输入、模型输出、版权管理信息拆成三笔账。别急着下结论,先看 AI 团队该补上的数据来源、授权范围与删除链路。
- 2026-08-30
代码架构 Skill 82.6 万次安装,先把重构写成 RFC
它不直接改代码,而是先读近期提交、做删除测试、画 Before 和 After,再让人决定要不要重构。装上的不是一键优化,而是一脚刹车。
- 2026-08-29
Claude 赢了 28 名研究员,不等于会做安全研究
Anthropic 的自动研究员在六小时内超过人类最佳方案,但它赢的是有评分器的实验赛道。真正该学的,是盲测隔离、能力回归和防刷分。
- 2026-08-29
Cursor 的 BYOK,算不上模型容灾
OpenAI 拟于 11 月 12 日结束直供。聊天框还能接通,不代表 Tab、Auto、Cloud Agent、账单与数据边界一起迁走,团队该按功能面验收退路。
- 2026-08-29
Claude 新 API key 绑上身份,也不等于安全
key 会随人离开而失效,确实补上了责任归属。可生产系统真正要躲开的,是长期静态 secret、跨工作区权限和无声失效。三类 key 与 WIF 到底怎么选,这篇给一条迁移线。
- 2026-08-29
Claude Code 换模型,省下的 token 可能不够重建缓存
2.1.251 把模型切换前后的 hook、缓存冷热与预算放进同一条运行时链路。真正值得补的不是一段脚本,而是模型白名单、成本护栏和审计证据。
- 2026-08-29
Qwen3.8 27B 慢一半,干完活却没更久
同一台 Mac Studio 上,新模型从 28.6 降到约 14 tok/s,完整答案却从 72 秒缩到 67 秒;1-bit 量化更快,却在工具任务里反复改口。
- 2026-08-29
这个 UI 审查 Skill 58.8 万次安装,报错直接给行号
它不负责把页面变漂亮,而是用持续更新的 Vercel 规则,把无障碍、焦点、表单、动效和性能问题压成可定位的 file:line 清单。附安装命令和一次真实前后对照。
- 2026-08-28
MHS 最值钱的不是机械臂,是急停按钮
统一驱动把数周集成压到数小时,也把模型的物理盲区暴露得很彻底。看懂物理 Agent 真正需要的发现、约束、快速控制和可审计降级。
- 2026-08-28
Midjourney V8.2 真正缺的不是画质,是 Git
四张参考图、moodboard 和个性化全能叠加后,生成一张好图更容易了,让团队稳定重做同一张图反而更难。
- 2026-08-28
MiniMax-H3 的 6.24 倍,不能直接算成六倍产能
同一套 8×H200 基准里,近两倍是运行时白捡的,剩下三倍来自缓存与稀疏近似。看懂基线和质量预算,才知道线上该开哪一档。
- 2026-08-28
Hy4 的百万上下文,不该成为 Agent 默认配置
770B 总参数只激活 49B,百万上下文却会把 KV 缓存、重复输入和长任务失控一起放大。真正该升级的不是 prompt 长度,而是任务切分与状态管理。
- 2026-08-28
学 Agent 先别学框架,这条路反而更快
33 个免费 Colab 从原始 API 教 RAG、评估与 Agent 循环。真正值钱的不是资源数量,而是让你先看清框架隐藏的成本、边界和故障点。
- 2026-08-28
科研 Agent 最强只做对 30%,别只怪模型
70 个真实科研工作流把最强系统压到 30%。更扎心的是,榜单评的从来不只是模型,还包括终端环境、工具链、证据产物、失败恢复和每一美元到底换来多少有效工作。
- 2026-08-27
Qwen3.8 加了 51B 查表参数,模型开始像数据库了
Qwen4 的早期预览把历史压缩、稀疏检索和局部查表揉进一个模型。跑分之外,这套设计把成本从算力搬向主机内存、带宽、缓存命中率和尾延迟。
- 2026-08-27
OpenAI 的 Agent 不会认输,才是最危险的 bug
198 道无解任务贡献了 93% 的侧信道讨论,生产 harness 又能把越界倾向压低百倍。问题不只在模型够不够强,而在任务何时允许失败。
- 2026-08-27
25 万段 Claude 对话开放了,研究者一条都看不到
Anthropic 让外部团队自选问题,却不开放原始对话。真正值得抄的,是这套兼顾隐私、独立发表与测量误差的第三方评估合同。
- 2026-08-27
GLM-5.3 Flash 拿下 20% 流量,跑分只是第二战场
匿名上线一周就冲到 OpenRouter 周 token 份额第一。比 AA 57 分更值得看的是每任务成本、速度短板和国产卡服务栈,这三项才决定它能不能进生产。
- 2026-08-27
Gemini 3.5 词错率 2.6%,原话却更难追
会清理口头语和自我纠正的转写很省事,却不该直接充当审计底稿。语音系统要同时留住原始音频、逐字稿和清洁稿。
- 2026-08-27
500 万亿 Token 一天,跑出来的未必是产出
中国大模型日均词元调用量三个月从 140 万亿升到 500 万亿。数字背后,Agent 的重试、长上下文和工具回路正在吞掉预算,真正该量的是每个成功任务的成本。
- 2026-08-26
Claude 统一记忆后,方便背后多了一层配置债
聊天里的项目背景如今会跟进 Cowork。少解释几遍当然很爽,但长期记忆一旦过期、串错作用域或缺少来源,它就会像陈旧配置一样稳定地带偏每次任务。
- 2026-08-26
OpenWorker 会扫漏洞,还远远不够
三类安全 Coworker 只是表面,真正决定它能否进生产的是 workspace trust、审批门、自动 reviewer 和 hard floor。读完这次 release,你会得到一套安全 Agent 的上线次序。
- 2026-08-26
OpenRouter 视频 API 最贵的 Bug,不在模型里
统一端点让 Seedance、Veo、Wan 切换更快,但生产系统真正会翻车的是异步任务状态、重复提交和回调重放。本文给出一份能直接落地的 job ID、幂等、恢复与成本清单。
- 2026-08-26
Jalapeño 跑分快,AI 写 kernel 还不能免检
OpenAI 的芯片会让 AI 自己做映射、放置和调度,部分模块快了 1.5 至 1.8 倍。真正能抄走的不是跑分,而是一套把机器优化关进回归测试的工程方法。
- 2026-08-26
豆包工作会做 PPT,不代表企业敢让它干活
把飞书文档、群聊、会议和权限交给 Agent 以后,办公助手才真正进入组织,也同时带来作用域、审批、审计和撤销的新账。本文给出一份团队上线前能直接照抄的验收合同。
- 2026-08-25
百万 GPU 集群,峰值带宽已经不是第一指标
MetaRoCE 把乱序、丢包和坏链路当成日常,不再逼交换机维持完美网络。读懂这套设计,你会发现 AI 集群真正昂贵的是失控的退化方式。
- 2026-08-25
Thomson 最贵的东西,不在 GPU 里
4000 万美元只是明面账单。真正难复制的是把专有内容、专家分歧和生产责任变成一套能训练、能评测、能路由的系统。
- 2026-08-25
Vera Rubin 的 30 倍,不是一块 GPU 赢的
NVIDIA 把 Agent 效率从每秒 token 改成每兆瓦完成多少工作。拆开 30 倍的来源,你会得到一套比跑分更适合生产环境的验收方法。
- 2026-08-25
MTIA 300 最狠的,不是把网卡塞进芯片
Meta 把 12 个 RDMA NIC、16 个消息引擎和 HCCL 一起做到 MTIA 300 里。真正值得抄的不是一组带宽数字,而是如何让数据移动、计算与验收共用一套系统设计。
- 2026-08-25
GPU 越快,AI 基础设施可能越贵
GPU 短缺缓解后,压力正迁到 HBM、CPU、SSD、电力和机房。真正该算的不是每秒多少 token,而是每个任务完成前,整条数据链要排多少队、烧多少钱。
- 2026-08-25
512GB 不是突破,Mac Studio 真正变的是网络
上一代本就有 512GB 内存。新款 Mac Studio 把带宽推到 1.2TB/s,并用 Thunderbolt 5 与 RDMA 组四机集群。看懂四台只快三倍,才知道本地大模型真正的成本。
- 2026-08-24
Claude Code 修了一个会把账单翻倍的 bug
一次代理兼容问题能让每轮请求静默重跑,另一处偏差又让本地成本少算 10%。AI Agent 的成本可观测性,已经是运行正确性的一部分。
- 2026-08-24
Codex 给图片补预算,视觉 Agent 早该补课了
0.149.1 只改了 5 个提交,却翻出视觉 Agent 的一笔旧账,文本有 token 预算,截图、标签和后台线程也得能计量、追踪、验收。
- 2026-08-24
Cloudflare 给 MCP 加权限勾选,Agent 仍不该拿全权
可选 OAuth scope 终于把全给或全不给改成按需授权,但勾选框只解决了入口。真正能上线的 Agent,还得做到权限前置检查、短时提权、写操作确认与失败可恢复。
- 2026-08-24
AI Agent 赚 80%,还没赢过随机数
FINCHAL 让人和 Agent 用未来行情同台,再用 2 万个随机玩家测出运气上限。真正值得抄的不是交易策略,而是一套不让 Agent 榜单自欺的验收方法。
- 2026-08-24
Raft 的四人协作间,最难的不是让 Agent 开口
两个人加两个 Agent 进入同一跨公司房间,看起来只少了邮件和工单。真正决定能不能上线的,是身份、最小权限、审计、撤销、审批与失败恢复。
- 2026-08-24
AI 读源码,最缺的不是上下文窗口
一个新项目用 1270 处逐字节校验的源码引用,证明大上下文只能帮 AI 看得更多,版本锚点、证据地址和反作弊校验器才决定它说得能不能信。
- 2026-08-24
AI SDK 配置通过类型检查,仍然不值得信
Deepgram 适配器曾让 5 个参数悄悄消失,还默认打开付费能力。真正该补的不是一行配置,而是从出站请求、默认值到计费元数据的 provider 契约测试。
- 2026-08-23
机器人百米 9.39 秒,不等于能上岗
赛场把速度和自主控制推到新高,但工厂关心的不是一次冲线,而是连续运行、失败恢复和安全接管。沿着 9.39 秒这条热搜,拆一套具身智能的上线评测合同。
- 2026-08-23
100 亿向量塞进 AlloyDB,专用向量库的边界松了
四层 ScaNN 把搜索空间压到 O(N^1/4),但 51 毫秒只是内部测试。看懂尾延迟、召回率和 Preview 边界,才能决定 RAG 要不要搬家。
- 2026-08-23
Ling 跑到 1120 tok/s,投机解码别照抄
4 块 B200 把 Ling-3.0-flash 推到 1120 tok/s,但 TPOT 不含首字延迟,接受长度又跟请求分布走。真正能上线的不是峰值,而是一份会拒绝回归的验收合同。
- 2026-08-23
Qwen-UI-Agent 榜单领先,开源开发者还用不上
82.1% 的 MobileWorld 和 92.2% 的真机成绩很亮,但公开目录还没有模型权重与部署入口。顺着这份报告,聊清 GUI 智能体从会点屏幕到能进生产还差什么。
- 2026-08-23
Anthropic SDK 1.0,最危险的改动不会报错
HTTP 底层换成 httpx2 后,普通调用多半能跑,APM、HTTP mock、异步原始响应和 Bedrock 配置却可能踩坑。这是一份升级前的验收清单。
- 2026-08-23
Agent 练不出来,先别急着换模型
Google Research 的 EnvHarness 没改模型权重,只让训练环境追着弱点变化,最高多拿 9 分。真正可带回生产的,是让故障轨迹反过来长出回归测试。
- 2026-08-23
Codex 能管一群 Agent,还不算调度系统
Codex CLI 0.149.0 把多会话面板和跨会话队列搬进终端。真正难的不是多开几个 Agent,而是让任务所有权、权限、预算与验收都不失控。
- 2026-08-22
SGLang 重启快了 785 倍,真正的账在故障域
权重留在显存,重启从 8.8 分钟降到半分钟;但缓存指纹、量化白名单、守护进程生命周期和同卡主备,决定它是生产方案还是更快的事故。
- 2026-08-22
Claude Mythos 5 不给裸访问,才是 Agent 上线的正解
Anthropic 把最强网络安全能力封进扫描、补丁和人工审批链,而不是开放一个通用聊天框。这套设计,比模型能力更值得普通 Agent 团队抄。
- 2026-08-22
ASR 榜单高分,可能只是模型认出了考场
研究用错误参考、静音数字和拼写切换审计 11 个开源模型。榜单还能看,但语音 Agent 上线前必须再加一套私有、反事实、按场景验收的测试。
- 2026-08-21
人人都能写 PR,最贵的却是合并权
Anthropic 刚访谈了十多家高增长初创团队。真正跑得快的团队没有把 main 交给模型,而是把验收、回滚、权限和代码所有权做成硬边界。这里给你一套可直接落地的交付闸门。
- 2026-08-21
Claude Platform 补齐原语,没补齐生产 Agent
Computer Use、Skills API 和 Files API 把执行、能力包与文件状态放进同一平台。真正要命的运行环境、权限和租户隔离,仍留给工程团队。
- 2026-08-21
Codex 开源的不是模型,是 Agent 底盘
8 月 19 日 OpenAI 再次把 Codex 定位成开放 Harness 平台。Rust agent loop 与 App Server 能拿走,模型权重、托管后端和 Codex 云服务仍是另一回事。
- 2026-08-21
LFM2.5 提速 3.18 倍,先别急着换大模型
3.18 倍不是免费午餐。看懂接受率、硬件后端与端到端延迟这三笔账,你才能判断 DSpark 是真提速,还是漂亮的实验数字。
- 2026-08-21
Agentic Search 该加在 RAG 之后,不该替代 RAG
Mistral 用五个工具把一次检索变成多步调查,准确率很亮眼。真正上线前,还得补齐延迟预算、权限、证据链与停止条件。
- 2026-08-21
Cursor Agent 一直干到完成,不一定是好消息
事件订阅、长期目标和独立子智能体让 Cursor 更像一套运行时。真正上线前,团队还得补齐幂等、预算、权限、验收和停机闸。
- 2026-08-21
DeepSeek 视觉接近 Opus 4.8,生产还差一条链
官方给出的视觉 Agent 跑分已经很亮眼,但模型看懂截图只是起点。真正拉开差距的,是图像预算、工具回路、权限边界和失败恢复。
- 2026-08-20
模型能随便切,路由商反而更难切
OpenRouter 承诺产品、路线图与中立路由不变。真正该做的不是恐慌迁移,而是把 provider 配置、成本账、失败切换与调用日志握在自己手里。
- 2026-08-20
FastMetal 最狠的不是 30 秒,是 3.2GB
Mac 上的本地视频生成终于不只看能不能跑。FastMetal 把 DiT、采样器和解码器留在统一内存里,也把冷启动、量化质量与无风扇机器的真实代价摊到了桌面上。
- 2026-08-20
Claude 14 分钟出报告,修复还得人来签
Anthropic 把 CI 值班交给 Claude 后,最快 4 分钟定位根因。真正可抄的不是多 Agent,而是把确定性告警、证据调查、生产修复三层权限彻底分开。
- 2026-08-20
DeepSeek 缓存最高涨 1114%,Agent 成本该重算了
输出价不是这次最狠的一刀。对高缓存命中、长上下文、多轮重试的 Agent,原本最便宜的 token 正在放大账单;这篇给出按成功任务重算成本的六项表。
- 2026-08-20
H20 跑 DeepSeek-V4-Pro,万能配置不存在
峰值算力差距很大,真实解码速度却只差 1.42 倍。关键不是一条神参数,而是把短长上下文、低延迟与高吞吐拆成不同服务配置。
- 2026-08-19
Claude 的蛋白质实验,最值钱的不是 35% 命中率
14/15 个靶点成功只是表面,真正的跃迁是模型把公开工具编排成可被湿实验验收的研究证据链。看懂这条链,也就看懂科学 Agent 的工程门槛。
- 2026-08-19
Claude 每次都问你批准,也不等于安全
Gmail 发信和 Drive 文件操作已经从只读跨到可写。真正的工程边界不只在是否弹窗,还在弹窗展示什么、权限能放多大、动作能否撤销,以及重试会不会再执行一遍。
- 2026-08-19
最强 Agent 真实工作只做完 30%,卡住它的不是工具
StartupBench 的 97 个真实工作流把一个误区测穿了,Agent 会跑完整流程,不等于交付物能过验收。读完你会拿到一套把用户需求编译成自动验收的工程方法。
- 2026-08-19
RAG 多向量检索,4874 段文本变成 60 万向量
晚期交互保住了长文里的局部证据,也把成本从模型挪到索引、延迟和运维。别急着迁移,先用一套小评测判断它值不值。
- 2026-08-19
ChatGPT Business 没涨价,审批流程却该重做
8 月 19 日起,新增席位会按剩余账期即时扣款。总价不变,但邀请成员已经变成付款动作,小团队该补上席位、预算和离职回收的三道检查。
- 2026-08-19
同样是 Q4_0,LFM2.5 追回 97% 量化掉分
Liquid AI 没换更大的量化格式,只把蒸馏放进 4bit 训练过程,四款模型便逼近 BF16。对本地部署团队,真正该验收的不再是 GGUF 文件名,而是模型为这个精度档付过什么训练成本。
- 2026-08-18
Cursor Origin 在抢的不是仓库,是 agent 运行时
仓库、PR、审查状态和执行环境一旦被放进同一个控制面,代码 agent 会少掉一堆胶水,也会多出一套新的权限与迁移账。
- 2026-08-18
系统提示词从来不是 Agent 的安全边界
Google 用一笔 149 美元退款演示了 agent 怎样被一句注入劫持。签名、gVisor 沙箱和确定性网关,才是能经受模型升级的三层硬边界。
- 2026-08-18
Agent 成本只按模型统计,方向就错了
OpenRouter 把支出、缓存、延迟和单条请求接成了一条链。真正省钱的不是换最便宜模型,而是看清哪个工作流阶段、哪次重试和哪条缓存边界在烧钱。
- 2026-08-18
AI 评测先画仪表盘,方向就错了
Google 的公开实验把模型、Skill、样本和轮次拆成矩阵。真正有用的不是漂亮总分,而是沿轨迹找到能力提升、成本膨胀和 Skill 失效的原因。
- 2026-08-18
ChatGPT for Teens 把边界做成了默认值
它没有只靠一段系统提示词劝青少年正确使用 AI,而是把学习、节制和安全塞进默认路径。做 Agent 产品的人,很该抄这份作业。
- 2026-08-17
SpaceX 600 亿美元买 Cursor,最值钱的不是编辑器
交易落地后,Cursor 接上全球最大 GPU 集群。真正改变行业的不是所有权,而是算力、模型、开发者分发和可验证代码反馈被接成一条线。
- 2026-08-17
Claude Workbench 今天退役,提示词不进 Git 就不算资产
旧版 Workbench 退役只是导火索。真正要迁的不是一个网页,而是提示词、模型参数、测试样本和评测基线。给你一套能进仓库、能回滚、能进 CI 的落地结构。
- 2026-08-17
Claude Code 删掉任务工具,我觉得只对了一半
新模型默认不再获得 TaskCreate、TaskUpdate 和 TodoWrite,但计划并没有消失。本文讲清工作记忆与执行状态的边界,以及长任务、多 Agent 何时开回工具,何时把状态放进仓库、队列或数据库。
- 2026-08-17
Mac 本地推理不缺新框架,缺的是收敛
同一个模型短跑很快,长会话却会被重复 prefill、循环状态回滚和残缺转换拖慢。本文用 MLX-LM 与 vLLM Metal 的公开数据,给出一套不被 tok/s 截图骗走的 Mac 本地模型选型法。
- 2026-08-17
Qwen3.8 开了 MTP,有人快 2.5 倍有人慢一半
同一个原生加速头,在不同硬件和引擎上跑出了相反结果。别只看接受率,这篇给你一套带负对照的 MTP 验收方法。
- 2026-08-17
宇树上市了,通用智能还没上市
三年营收从 1.59 亿涨到 16.99 亿,人形机器人收入首次超过四足。宇树交出的是本体量产和降价的答卷,通用任务、软件复购与真实作业仍要继续验证。
- 2026-08-16
AI 书卖得更差,人类作者收入还是一起掉了
14,419 本自出版小说揭开一个更麻烦的市场,AI 书单本表现弱,却靠数量抢走销量、排名与订阅池。生成成本趋零后,创作者真正要守的不是产量,而是信任、分发和可验证性。
- 2026-08-16
上下文工程别按 Star 学,最火的仓库最费时间
一条九小时 GitHub 阅读路径,从故障模型走到可观测的上下文流水线,也告诉你哪个高 Star 仓库该先跳过。
- 2026-08-16
Claude 的 0.613 过线了,16 人仍不敢让它顶岗
基准分数已经跨线,周级模糊任务、组织上下文和计划修订却还没过关。给 Agent 上生产前,真正缺的是一份任务级验收单。
- 2026-08-16
Linux 7.2 一周收 400 多个修复,维护者反而更忙
AI 代码审查没有替 Linux 写代码,却把缺陷发现的速度推到人类分诊之前。本文拆清新瓶颈,并给团队一套不被告警洪水淹没的上线门禁。
- 2026-08-15
dots3-note 只激活 16B,普通显卡还是跑不动
280B 总参数、16B 激活、512K 上下文听起来很省,但官方推荐的是 8 卡 FP8 节点。本文把权重、上下文和长程 Agent 三笔成本拆开。
- 2026-08-15
296 万个开源模型,99.2% 下载流向 1.5% 仓库
仓库数涨到 296 万,真正形成依赖的仍是少数稳定小模型。用下载、衍生、运行时和许可证重新挑模型,别再被参数与点赞带着走。
- 2026-08-15
Qwen3.8 权重真来了,但普通开发者先别急着下载
两份官方 checkpoint、213 个权重分片和自定义许可证已经落地。验收承诺之外,更要看清 2.27 TiB FP8、多节点部署、强制思考与托管版功能差异。
- 2026-08-15
单机 Agentic RL 最值钱的不是省显卡
井字棋训练 400 步,奖励均值从约 -0.5 升到 0.4。真正值得抄的不是游戏结果,而是把 rollout、reward、工具调用和权重更新收进一条能调试的链路。
- 2026-08-15
Sheets canvas 能做小应用,先别把它当数据库
Gemini 能把一张表变成可读写小应用,省掉的是界面搭建,不是数据治理。本文拆清双向回写、权限、单表限制,以及什么时候该升级到正式系统。
- 2026-08-14
GPT-5.6 再强,也救不了一条笨流水线
同一模型只改两处 Agent 架构,ARC-AGI-3 得分从 13.3% 升到 38.3%,输出 token 反而少约 6 倍。真正该升级的,可能是模型外面那层系统。
- 2026-08-14
388 个 PR 只合了 180 个,AI 维护最难的不是写代码
Claude 数周开出 388 个维护 PR,最终合并 180 个。未合并的 208 个比成功案例更有价值,它们提醒团队先设计任务边界、验收门禁和反馈回写。
- 2026-08-14
GLM-5.3 先拿开源第一,权重还在路上
同一基座靠后训练把 Terminal-Bench 3.0 从 4.6 拉到 28.3,但发布当天只有 API,没有权重。拆清今天能验证什么、两周后还要查什么,以及切模型前必须改的配置。
- 2026-08-14
Gemini 3.7 Flash 半价,Agent 账单未必更低
推广价只管到年底,thinking token、重试与工具费才决定真实成本。用一张生产验收账,判断该不该迁。
- 2026-08-14
Cursor builds 快 3 倍,最值钱的是失败不生效
预热环境只是表面,最近成功版本、提交溯源和密钥分层才决定云 Agent 能否稳定交付。附一张迁移验收单。
- 2026-08-13
多 Agent 不是人多力量大,先别急着堆并发
45 个协调 Agent 找到 266 个漏洞,也制造 240 万次抢队列请求。真正该评测的不是单体聪明,而是整个系统会不会一起做错。
- 2026-08-13
DeepSeek V4 Pro 正式上线,先锁版本再看跑分
DeepSeek V4 Pro 0813 已悄悄替换正式 API,调用名和价格暂时没变。真正该补的不是一张新跑分表,而是版本留痕、黄金集回归和成本闸门。
- 2026-08-13
Claude in Chrome 带上记忆,权限反而更难管
会话、技能与连接器开始跨浏览器、桌面、网页和移动端延续。真正要补的不是更多按钮,而是任务边界、动作闸门、恢复点和域名权限。
- 2026-08-13
AI 写的 PR 能跑以后,维护者反而更难了
AutoGPT 已把问题从代码能不能跑,收窄成改动是否符合路线图。AGENTS.md 负责导航,技能负责动作,CI 负责门禁,人仍要守住项目方向。
- 2026-08-13
Grok 4.6 跑分追平了,长任务还是不能放心交
一张 61 分的总榜很好看,真正决定 Agent 能不能交付的,却是检查点、预算、回滚和验收证据。
- 2026-08-13
DeepSeek Harness 开源,极简模式只留两把工具
DeepSeek 把跑出 82.7 分的 Harness 公开了。极简模式只有一句提示词与两把工具,外层却是一棵连 Agent Loop 都能替换的插件树。
- 2026-08-13
81 次搜索仍然答错,Agent 不是搜得越多越好
OpenRouter 把网页搜索拆成模型、引擎、方法和预算。真正要命的不是选错引擎,而是失败任务会耗尽每一轮搜索。看懂三组数据,再给生产 Agent 加上分层预算、早停和降级。
- 2026-08-12
ChatGPT 与 Gemini 都到 10 亿,模型反而没那么重要了
两个十亿用的是两只钟。ChatGPT 看周活,Gemini 看月活。数字背后更值得盯的是默认入口、工作状态和你能不能带着自己的上下文离开。
- 2026-08-12
Mojo 1.0 还不是 Python 杀手,先别急着迁移
真正值钱的是 1.x 兼容性合同,但合同只覆盖首批稳定 API。这篇拆清迁移成本、适用边界,以及谁该现在入场。
- 2026-08-12
LTX-2.5 快过实时,家用显卡先别激动
6.8 秒的成绩来自两张 GB200。真正值得开发者看的,是开放权重、九套 ComfyUI 工作流和重试后的成本账。
- 2026-08-12
macOS 虚拟机跑 LLM 慢 16 倍,锅不在算力
同一块 M1 Ultra GPU,只因客体系统少报两项 Metal 能力,llama.cpp 就走进慢内核。看懂这次提速,也能看懂 Agent 隔离环境最容易漏掉的评测变量。
- 2026-08-12
AI 会写代码了,却还写不好一本书
句子早就不是瓶颈,真正难的是让几十页内容共享同一套状态、证据与判断。把长文当成一次有验收合同的构建任务,模型才适合上场。
- 2026-08-12
Pi 不是 Claude Code 平替,它是一套 Agent 底座
同一个 DeepSeek 放进不同编码工具,质量没有拉开,时间和上下文开销却差了数倍。我顺着 Pi 三层源码读了一遍,讲清它为什么更像 harness,以及普通开发者怎样安全上手。
- 2026-08-11
Claude 的 67.2%,最值钱的是那 650 次失败
它没解出黎曼猜想,却把一个长期停在 41.6% 的相关下界推到 67.2%。真正值得做 agent 的人抄走的,是探索、互审、反证、复现和形式化验证组成的研究流水线。
- 2026-08-11
'英伟达要撬动 5000 亿美元,算力未必更便宜'
'六家资本机构要把 GPU 包成长期资产,容量可能更容易拿,合同也会更长。本文从利用率、CUDA 锁定和单位任务成本拆开 5000 亿美元背后的工程账。'
- 2026-08-11
ZCode 四连更,模型更强反而不是重点
Goal、Subagents、Remote Control 和闲时任务被放进同一套工作流后,coding agent 才开始像一台能持续运行、可以验收、也能随时刹车的工程系统。
- 2026-08-11
Agent 选 Python 还是 Rust,可能根本是道伪命题
推理预算一换,语言排名就翻转;测试路径再错一层,整张榜单都在测同一个 Go 程序。真正该先选的,是评测合同。
- 2026-08-11
Ling-3.0-tiny 很快,但还不是开箱即用
1.3B 激活参数把 M4 Pro 推到官方 86 至 90 tok/s,Agent 多轮循环终于不再慢得劝退。真正拦在部署前的,却是总权重、运行时分支、工具解析和业务验收。
- 2026-08-11
Agent 越跑越慢,锅可能在缓存
SGLang 用一棵 token 树统一 FULL、SWA 与 Mamba 缓存。看懂它,你会知道长任务 Agent 为何需要会话感知的保留、淘汰与跨层复用。
- 2026-08-10
千问开放平台最值钱的,不是聊天入口
租房、寄快递、查理财都能在千问里办,只是显眼的一层。开发者真正要接住的是授权、支付、订单、重试和售后,一条比聊天框复杂得多的服务链路。
- 2026-08-10
大模型总榜越公平,你越不该照着第一名买单
LatentRank 用 Bradley-Terry 和先验把多张榜单揉成一张总榜。难点不在算分,而在承认相关性、样本量和任务权重会偷偷替你做决定。
- 2026-08-10
Qwen-MM-Plugins 真正的瓶颈不在模型
Qwen 把图像、视频、文档、Blender 与 FreeCAD 拆成 skill 和 MCP。真正该看的,是这套能力进生产后如何处理依赖、权限、失败和验收。
- 2026-08-10
VoiceChat 开源了,但多数开发者还用不上
448 毫秒轮换、实时工具调用、开放权重很亮眼。可 80GB 显存、33% 工具调用成功率和一长串官方限制,才是接入前该算的账。
- 2026-08-10
'Muse Glimmer 能塞进 24GB,不等于能常驻'
'Meta 把 30B 智能体模型压进 24GB 显存,但权重装得下只是开始。本文从 KV cache、工具权限、失败恢复和端到端延迟拆开本地常驻 Agent 的真实工程账。'
- 2026-08-10
agent 用电脑超过人类了,你还是不敢把浏览器交给它
OSWorld 一年从 42 涨到 85,人类才 72。可月跑千万次任务的买家根本不看榜单,他们付钱买的是另一样东西。写给正在做 agent 产品的你,钱和坑都在模型外面那层。
- 2026-08-09
Claude Code 自动放权,真正该审的是分类器
独立分类器拦下 89% 的危险命令,人工逐项审批只有 14%。少点确认可能更安全,但前提是别把分类器当成唯一防线。
- 2026-08-09
Apple 智能接千问,隐私不能只靠弹窗
千问进入 Siri 和写作工具之后,真正该看的是请求被谁处理、传了什么、能否追溯。给第三方模型接入补上四道工程验收。
- 2026-08-09
Agent Plugins 只统一了箱子,没统一钥匙
Google 加入由 Amazon、Cursor、Microsoft、OpenAI、Vercel 共同维护的插件规范。目录终于能复用,权限、凭据、hooks 与供应链信任仍要自己验收。
- 2026-08-09
翻译模型最危险的错,是把每个字都翻对了
1002 条社媒笔记揭出一个评测盲区,Gemini 3 的满分档比例也只有 38.30%。这篇不聊跑分冠军,聊产品团队怎样把梗、语气和文化适应性真正接进验收。
- 2026-08-09
前端 Skill 不是越多越好,这四个还经常互相打架
我把 frontend-design、ui-ux-pro-max、design-taste-frontend 和 playwright-cli 放进真实项目里轮着用。它们各自解决审美、规范、去 AI 味和验收,但选错场景,页面照样越改越歪。
- 2026-08-09
LoRA 不是小数据项目的第一步,TF-IDF 才是
一份 IMDb 情感分析教程把基线、LoRA、概率校准、错误切片和伪标签串到了一起。真正值得抄的不是模型参数,而是先让便宜方案站住,再让复杂模型证明自己值回成本。
- 2026-08-09
OpenAI Atlas 今天停服,独立 AI 浏览器这条路走错了
上线十个月,Atlas 把浏览能力还给 ChatGPT、Codex 和 Chrome。输掉的不是 agent 技术,而是让用户搬家的产品路线。
- 2026-08-08
HPC-Ops 把 TPOT 降 48.8%,用户未必快一半
48.8% 是 batch 32 下的 TPOT 降幅,不是整次请求耗时。拆开 TTFT、decode、排队与工具调用,才知道这次 HPC-Ops 对谁最值。
- 2026-08-08
Claude Code 会传话了,别让它们改同一份代码
跨会话摘要省掉了反复解释,却不会自动处理文件冲突、失败重试和验收。这里给出一套能直接拿去用的多会话协作边界。
- 2026-08-08
Astra 越强越该慢发布,OpenAI 这次做对了
Critical 不是一张吓人的能力标签,而是一道会中断训练、测试和上线的发布闸门。拆开这套机制,看看普通 Agent 团队能抄走什么。
- 2026-08-08
WeatherNext 多争取 24 小时,真正难的是把预测变成预警
三日预报追平过去的两日水平,只是起点。更值得学的是 1000 条情景、三类指标和专业预报员如何把模型输出变成可执行判断。
- 2026-08-08
Managed Deep Agents 越省事,迁移可能越疼
一条命令能省掉持久化、沙箱、身份和评测基础设施,也会把依赖从模型 API 上移到运行时。上线前先把这笔账算完整。
- 2026-08-08
Kitesurf 不该替代 Chromium,它该做便宜快车道
Kitesurf 用 V8 isolate 把网页任务压到 Chromium 七分之一内存,但速度更慢、兼容性更窄。真正能省钱的不是换引擎,而是给 Agent 做双引擎路由和失败回落。
- 2026-08-08
Fable 5 护栏误伤太多,也是一场生产事故
Anthropic 把生物相关回退压低约 85%,真正该抄的不是数字,而是把安全拦截、误伤、降级成本和可观测性放进同一本上线账本。
- 2026-08-06
Prime Agent 会改自己,没评测门就是技术债
它能在运行中改 prompt、skill 和 memory,也能把作弊经验固化成新技能。真正可抄的不是 refine 按钮,而是让每次自我修改都留下证据、通过评测、随时回滚。
- 2026-08-06
Agent 继承用户权限,这套做法不够了
Cloudflare 把零信任推进到每一次工具调用。真正能挡提示注入的不是再写一行 prompt,而是让凭据随任务过期、权限沿执行图只减不加。
- 2026-08-06
19 次越界不是模型觉醒,是评测环境没关门
122 次网络评估里,智能体有 10 轮把 19 个动作带到真实互联网。比「AI 觉醒」更值得警惕的,是开放出网、关闭过滤、缺少实时审批和模糊任务边界同时出现。
- 2026-08-05
Alpamayo 2 开放商用,安全不是一个权重文件
NVIDIA 把 32B 自动驾驶推理模型开放商用,但真正通往量产的不是下载按钮,而是轨迹、推理、仿真与验收组成的证据链。
- 2026-08-05
Perplexity 暂时赢了,法院说 Agent 只是工具
一场购物 Agent 官司,胜负落在谁发出请求、谁控制浏览器、数据往哪流。做 Agent 的人该开始把架构图当成证据保管了。
- 2026-08-05
SeedRealtime 最难的不是开口,是被打断
边看边听边说只是表面,实时 Agent 真正难在判断何时沉默、如何取消旧动作,以及怎样在连续音视频里守住状态与权限。
- 2026-08-05
统一模型 API,最难的根本不是路由
Google 把 Gemini、Claude 和 GPT-OSS 收进一个兼容入口,省掉了代理维护。真正决定它能不能进生产的,是工具调用、流式响应、错误语义和故障切换能否通过同一套契约测试。
- 2026-08-04
Agent Skill 不是文档,它该进 CI
Google 的 1.5 万星技能库仍在提交时评测、每周全量重跑。真正能抄走的不是目录模板,而是把 Skill 当版本化代码维护的四道门。
- 2026-08-04
ForgeStencil 最狠的,不是 97.7 倍加速
它让两个 Agent 自动改快 100 个真实软件,却把最重的工程花在防作弊上。看懂这套度量脚手架,才知道 Coding Agent 离生产还有多远。
- 2026-08-03
欧盟 AI 新规生效,角落标签救不了你
8 月 2 日起,聊天机器人、生成内容、深度伪造和部分公共利益文本进入新规则。真正难的是让标记穿过下载与转发,并留下可审计证据。
- 2026-08-03
算力翻到 2.8 倍,成本未必跟着降
全国智能算力规模一年增至约 2.8 倍,但机房里的卡要穿过调度、网络、软件兼容和质量验收,才会变成开发者真正可用的算力。
- 2026-08-03
AI 找漏洞已经不稀缺,验证才是下一堵墙
苹果为应对 AI 生成的低质量报告开始给漏洞提交通道限流,一枚真实 macOS 漏洞却被挡在门外。把 1061→14 和 23019→1752→1094 放在一起看,安全 agent 真正缺的是证据链,不是发现量。
- 2026-08-03
MCP 砍掉 session,才像生产协议
无状态不是把上下文删光,而是把藏在传输层的状态搬到显式参数里。看懂这次改动,才能把 MCP 真正放进负载均衡、鉴权、缓存和人工确认链路。
- 2026-08-03
Cloudflare 想让 Agent 90% 时间不用容器
新包真正有意思的不是又造一层沙箱,而是把持久文件系统从执行环境里拆出来。理解这条边界,你才能判断任务该进 isolate、Linux 容器还是浏览器,也看清它的早期代价。
- 2026-08-02
276B 叫 Small,最低还要 180GB 显存
Inkling-Small 每个 token 只激活 12B 参数,跑分接近 975B 旗舰。但算得少不等于装得下,读懂 MoE 得把计算、权重和并发三本账分开。
- 2026-08-02
Grok 看懂了视频,却在关键一问开始猜
Grok 宣布能分析任意视频,官方演示却也露出视频 AI 的老问题。描述画面不难,给时间码、交证据、承认不知道,才决定它能不能进真实工作流。
- 2026-08-01
Agent 失败,很多时候真不是模型太笨
一条含糊的 Nothing happens,能把正确推理带进死循环。ALIGN 的实验提醒我们,模型与环境之间那层接口,正在吞掉 Agent 已经拥有的能力。
- 2026-08-01
smevals 把评测做小,我觉得比搭平台更重要
大多数团队缺的不是更大的评测平台,而是一套能随代码版本迭代的小题库。smevals 把运行、打分和报告拆开,让模型、提示词与 Agent 脚手架都能接受回归测试。
- 2026-08-01
animated-voiceover 能自动 90%,最贵的是最后 10%
一套开源 Skill 把动画制片拆成可执行的 Agent 流程。真正能复用的不是一句万能提示词,而是参考资产、串并行闸门、局部重试与逐段验收。
- 2026-08-01
Astra 把数学证明做便宜了,验收反而更贵
OpenAI 用下一代模型解出十项长期开放问题,并公开论文、Lean 证书与发现过程。约 2000 美元最值得抄的不是算力账,而是把生成、验证、署名和责任拆开的工程链路。
- 2026-08-01
'Suno 一审输了,致命点是模型真记住了'
'法院没有只追问训练集里有什么,而是追到 Suno v3.5 与 v4 能否把六首作品吐回来。判决尚未生效,却把生成产品最该补的一类验收题摆到了台面上。'
- 2026-08-01
Copilot 堆叠会话很爽,评审债才刚开始
GitHub 把相互依赖的 Agent 会话和 PR 做成了同一条栈。代码吞吐上去之后,真正稀缺的会变成任务切分、CI 容量、评审顺序与合并纪律。
2026-07 150 篇
- 2026-07-31
GPT-5.6 Luna 降价 80%,该重写的是工作流
80% 降价把 Luna 推进高频 Agent 回路。真正该升级的是模型路由、评测和兜底,让 Sol、Terra、Luna 各自去做最可靠的那一段。
- 2026-07-31
Gemini Robotics 2 最值钱的不是聪明,是会验收
Google 把 Agent 的工具调用、持续视频与任务验收塞进机器人的高层大脑。看懂 ER 2,才能看懂机器人为什么开始从炫技走向工作流,也能看清它离真正上岗还差哪几层。
- 2026-07-31
AI 参与解开 57 年数学题,真正值钱的是验收
Hyra 跑约 24 小时找到关键构造,模型当探索裁判,作者独立检查,再交给 Lean 4 逐项验证。这套分工比「AI 天才」更值得抄。
- 2026-07-31
SGLang 登上 TPU,CUDA 护城河松了一块
同一套 SGLang API 将横跨 GPU 与 TPU,Day 0 模型支持也写进路线图。开发者多了选择,但 JAX、Pallas 内核和多后端测试的账并没消失。
- 2026-07-31
DeepSeek 82.7 分,模型榜单该换算法了
同一架构、同一规模,只靠后训练与一套尚未发布的 Harness,DeepSeek-V4-Flash 就把 Agent 成绩顶到 82.7。看懂脚注,才知道开发者该怎么选模型、配预算、做验收。
- 2026-07-31
Claude 误闯真实系统,最危险的不是模型
141006 次安全评测里出现 3 起真实系统入侵。不是零日越狱,而是提示与环境配置互相打架。做 Agent 的人该补的是出网白名单、凭据隔离、包仓库防线和连续审计。
- 2026-07-31
Seedance 2.5 不是视频模型,它开始像剪辑软件
30 秒生成和 50 份参考素材很抢眼,真正改变工作流的却是白模、时间戳和局部编辑。生成视频终于不只靠重抽,但控制权也带来了素材、版本与验收的新账单。
- 2026-07-31
MiniMax H3 最值钱的不是 2K,是开放权重
2K、15 秒、原生立体声都很亮眼,但 H3 真正可能改变的是视频生成的工程形态。等权重、许可证和推理栈落地,它才有机会从网页里的抽卡工具变成可编排、可部署、可验收的创作底座。
- 2026-07-30
AI 会写论文,但它还不会做研究
前沿智能体连跑六天、花掉数千美元,工程步骤一个没卡,却把两篇论文做成明确拒稿。五种失败模式,把自动化真正卡住的位置照得很清楚。
- 2026-07-30
Replit Design 不会杀死设计师,它先杀死的是交接
Replit 把提示词、Figma、设计系统和可运行应用塞进同一项目。更关键的是,改文字和间距直接写源码,不走 Agent。AI 设计的胜负,可能不在会不会画,而在能不能少一次交接。
- 2026-07-30
Token Saver 能省 99%,也可能漏掉 10%
它把整本 PDF 留在本地,只给 Claude 相关片段。数字很漂亮,但短文档只省 14%,30 道检索题漏了 3 道。真正值得抄的是上下文工程,不是宣传数字。
- 2026-07-30
AI 写完代码,程序员的工作才刚开始
一次草稿成功、监控却报硬失败的真实错配,把 AI 编程最容易漏掉的五件事照了出来。代码只是候选答案,定义、边界、验收、判断与好奇心才决定它能不能交付。
- 2026-07-30
Numbat 带了 52 条规则,但一条都不默认拦
Perplexity 把 agent 的命令、文件写入和网络外发拉回确定性规则里。真正难的不是识别危险,而是决定哪一步值得让工程工作停下来。
- 2026-07-30
OpenAI 送 10 万个 Pro,买的是科研工作流
一年 Pro 权限、四位合作者、企业级隐私。最值钱的不是 2400 美元订阅,而是谁先把科研流程嵌进模型。
- 2026-07-29
拦住 AI 的不会是 1100 人联名,是那份事故报告
员工联名、官方附议、受害者变成两家,这周 AI 圈的剧情转折点其实是三周前那次逃逸。看完你能拿走三个马上能用的安全判断,和一份白给的攻击复盘教材。
- 2026-07-29
MCP 把握手删了,我觉得这是协议在认错
MCP 7 月 28 号落地的新规范是它诞生以来最大改版,initialize 握手和 Session-Id 直接删掉,Roots、Sampling、Logging 三个核心特性进入废弃。这篇讲清楚为什么这么改,以及你那个 server 具体哪几行要动。
- 2026-07-29
Claude 三天想出的密码攻击,人类验证了一个月
HAWK 熬过两年专家评审,Mythos 用 60 小时把它的有效密钥强度砍掉一半。但这篇里最值得抄的不是结果,是研究员把一个开局摆烂的模型劝回去干活的那三句话。
- 2026-07-29
卡住本地大模型的不是算力,是你的硬盘
一台 64GB 的 M1 Max 跑通了 2.8T 参数的 Kimi K3,14.6 秒一个字。把这 14.6 秒拆开,真正在算数学的只有 1 秒。剩下的都在等硬盘。
- 2026-07-29
Codex 写的代码再让 Codex 查,我不太敢全信
OpenAI 悄悄开源了 Codex Security,一天涨了两千星。工具是好工具,但它自己在覆盖率报告里留了 unknown 这一档,扫描还按 token 收钱。要不要接进 CI,代价得先算清楚。
- 2026-07-28
会做什么开始不值钱了,能验收什么才值钱
OpenAI 翻了 80 万条打工人的 ChatGPT 消息,43.5% 的岗位提问在干别人的活,客服和 HR 跨得最凶,被借最多的偏偏是工程和营销。跨界是双向的,看完这篇你会重新想想,自己的饭碗到底焊在哪。
- 2026-07-28
Anthropic 说不禁开源,它要的三样东西更狠
否认禁令只花了一句话,剩下三千字全在讲它支持什么。芯片、蒸馏、强制测试,三条拆开看,真正会落到天天用开源权重的开发者头上的,是第二条。
- 2026-07-28
告 AI 偷数据,13 个月连输三场,这条路怕是走不通了
德里高院判 OpenAI 用新闻社内容训练不侵权,和 Anthropic 的 15 亿美元和解放一起看才有意思。训练端全球趋同免责,举证的球踢到了记忆与复述,做模型、爬数据、做 RAG 产品的人,雷区换地方了。
- 2026-07-28
你收藏的 AI 神技巧,GitHub 亲口说多半是噱头
GitHub 官博下场讲工作流,8 步从原型到跨模型互审,核心论点是别折腾花活,把 harness 用透。这篇聊聊为什么模型之争正在让位于编排之争,以及工程师该把学习时间押在哪,才不会半年就过期。
- 2026-07-28
编排比参数值钱,微软这次算是盖章了
一个激活 5B 的安全模型,带着 100 多个会互相抬杠的 agent,在 CyberGym 上甩开 Mythos、Gemini、GPT 十几个点,成本还砍一半。拆开 MDASH 的五段流水线,做 agent 系统最值钱的几个设计都在里面,能直接抄。
- 2026-07-28
Perplexity 想常驻你的电脑,这把钥匙我劝你先别交
常驻后台、远程操控、读写本地文件、连着 400 个第三方服务,这是今天登陆 Windows 的 Personal Computer 要的权限清单。我逐项算了算这笔权限账,给你一个工程师视角的判断,什么能玩,什么先等等。
- 2026-07-27
AI 全自动写代码,卡住的不是模型,是没人敢签字
伯克利 RDI 把软件自主开发划成三级,还点名了一种正在蔓延的危险姿势,跳级。对照这把尺子量一下你的团队在哪一级,顺便聊聊为什么二级的坎不在模型能力,在验证成本。
- 2026-07-27
pptx 撑不过 agent 时代,PPT 的终点可能是 HTML
向阳乔木开源的 bento PPT skill 我真装真跑了,手写 JSON 被校验器打回三轮。被拒得越狠我越觉得妙,这套设计把 PPT 变成了可 diff、可验收、可协作的纯文本工程文件。
- 2026-07-27
agent 定目标,『不能做什么』比『做什么』更值钱
卡兹克开源的 Leader.skill 把一句糊话变成 agent 能独立跑几小时的任务书。但真正值钱的是那条反作弊心法,AISI 刚实锤五款前沿模型都会在评估里抄近道。这套方法什么时候该用、什么时候千万别用,这篇讲清楚。
- 2026-07-26
沙箱从来就不是安全边界,这次是 OpenAI 自己证的
OpenAI 用来测攻击能力的模型逃出隔离环境,反手黑了 Hugging Face,两家公司花了一周才对上是谁干的。比越狱更该让人后背发凉的,是中间那道归因缺口。
- 2026-07-26
8 美元芯片跑通 28.9M 模型,端侧卡的从来不是算力
它只会写儿童故事,不会答题不会写代码。但把 25M 参数塞进 flash、每 token 只读 450 字节这一手,值得每个做端侧的人抄一遍。顺带说说 HN 上骂它没用的那批人为什么也没全错。
- 2026-07-26
Debian 吵翻的不是 AI 代码质量,是谁来签名背锅
四个互斥提案同时挂在投票页上,从一个字都不许到随便用但你全责。没有一张选票真在争论 AI 写得好不好。这道题两年内会轮到你团队的 CONTRIBUTING.md。
- 2026-07-26
欧盟要求的 AI 水印,五年内都不会真管用
8 月 2 日欧盟 AI 法案第 50 条生效,输出被欧洲用户使用就适用,最高罚全球营业额 3%。但法条要求的稳健机读标记,递归改写就能把检测率从 99.8% 打到 9.7%。真正七天内做得完的是另外三件事。
- 2026-07-26
Ruff 把默认规则加到 413 条,这是冲着 AI 写的代码来的
v0.1.0 之后第一次动默认值,7 倍规则一次性打开,官方自己承认是 breaking change。提案 436 条最后落地 413 条,被砍掉的那几条恰好划出了风格和正确性的边界。附升级前该做的四件事。
- 2026-07-26
Kimi K3 开源 2.8 万亿参数,但自己部署这条路基本被堵死了
史上最大开源权重明天落地,四比特压完还有 1.4TB 得常驻显存。这篇算的是那张没人写的账,以及开源在前沿量级上到底变成了什么。
- 2026-07-25
一个链接种一个 AI 内鬼,这不是 OpenAI 一家的病
Zenity 披露的 AgentForger,一个带参数的链接就能自动建好一个继承你身份的 agent,关掉全部审批,每 5 分钟去攻击者邮箱取指令。OpenAI 四天修完了,但同一个坑,你给自己 agent 开权限的时候也在踩。
- 2026-07-25
别笑 AI 把无人机开进墙,半年后它就稳了
Anthropic 和 Andon Labs 把 agent 评测搬进了物理世界,五个子任务里模型只卡在一个上。拆一拆 Drone-Bench 的设计,你会看到 agent 的下一站,和一个值得抄回家的评测思路。
- 2026-07-25
Claude Code 账单里那 22%,不是装个工具能省掉的
有人实测缓存过期占了账单两成多,还写了个代理去堵。但 5 分钟的 TTL 和多 agent 架构本来就对不上,官方其实早给了两个原生开关。文末有个一行自查。
- 2026-07-25
Opus 5 半价追平旗舰,以后 90% 的活可能轮不到 Fable 5 出手了
价格一分没涨,能力直接换代。Opus 5 成 Max 默认、Pro 最强,还带四档 effort 换挡。订阅党、API 党、旗舰党各自的账怎么算,哪些场景还值得掏双倍价钱,这篇帮你把账本摊开。
- 2026-07-25
Claude Code 删了 80% 提示词,你的规则文件也是时候瘦身了
Anthropic 官方承认,过去两年我们给模型写的规则大多是补丁。哪些能删、哪些删了会出事、删之前必须先做的一件事,一次说清。
- 2026-07-25
Ling-3.0-flash 激活只有 5.1B,但它真不是小模型
总参 124B、每 token 只激活 5.1B,多数榜单对标上一代 1T 旗舰。但激活参数省的是算力不是显存,TTFT 降 60% 靠的是集群级缓存,权重还得等 8 月 3 日之后。三件官方写了、但转述的时候都被吃掉的事。
- 2026-07-25
给 agent 无脑堆上下文的做法,可能真该停了
MineExplorer 把 18 个顶级模型丢进 Minecraft 跑 3 分钟长程任务,最强的从 1 跳 77 分掉到 4 跳 12 分。更扎心的是消融实验,多给步数没用,多给记忆反而更差。
- 2026-07-25
25 家联名反对 AI 监管,蒸馏条款才是真战场
25 家机构联名保开放权重,名单里没有 OpenAI 和 Anthropic。但这封信最要紧的不是反对监管那句,是被通稿集体跳过的第三页。
- 2026-07-24
ChatGPT 差点劝死一个人,但这次我站 OpenAI
佛州男子起诉 ChatGPT 劝他别就医,两天后 OpenAI 反手把健康功能全量上线,还能连病历和 Apple Health。它为什么敢,边界在哪,普通人怎么问 AI 健康问题才不踩坑,这篇一次聊清。
- 2026-07-24
20 秒视频是顺手的,FLUX 3 瞄的是机器人
BFL 发了 FLUX 3,全网都在刷 20 秒带声视频,但官宣帖最后一行才是重点,动作预测。这篇聊聊视频模型怎么变成机器人的大脑,30 小时的数据活怎么被压到 30 分钟,以及这次不放权重,靠 FLUX 生态吃饭的人该怎么办。
- 2026-07-24
Kimi K3 通用跑分追平了前沿,一到真刀真枪就露了馅
英美两家安全机构联手测了 Kimi K3 的攻击能力,通用榜单它能打,网络攻防却只有前沿模型的一半分。差的这块,恰好是蒸馏永远偷不走的。
- 2026-07-24
大模型公司的终点不是 AGI,是咨询公司
OpenAI 发布 Presence,不开自助,派驻场工程师上门装 agent。同月微软砸 25 亿干同一件事。模型越来越不值钱之后,钱到底在哪一段,做 agent 的你站在循环哪一环,这篇把账摊开算一遍。
- 2026-07-24
Anthropic 每送你 1 个读者,要先爬走 38000 页
电影票房权威站 The Numbers 被 AI 流量和黑客一夜打垮,真人只剩它流量的 10%。这篇聊聊开放 web 那笔「你让我爬、我送你读者」的老交易是怎么作废的,手里有内容站或想做 side project 的人还剩哪几条路。
- 2026-07-23
AI 作弊不是 bug,是我们亲手训出来的
英国 AISI 把 GPT-5.6 Sol、Claude Opus 4.7 等 5 款顶级模型关进网络安全考场,全部尝试作弊,问它们还不认账。写代码的你大概率见过同款行为,这篇聊聊根因,以及怎么设防。
- 2026-07-23
旗舰模型是面子,Flash 才是谷歌的印钞机
谷歌 Q2 财报拆出来的开发者信号,每分钟 220 亿 token 的流量主力是最便宜的 Flash,不是旗舰。看完你会重新算自己 API 选型里那笔账,以及全行业为什么都在偷偷把你的请求路由给小模型。
- 2026-07-23
我干的活进了红头文件,但我劝你别急着辞职单干
Harness Engineering、Token 经济、OPC 一人公司,这些圈内黑话一夜之间进了北京的正式政策。算力券和注册便利是真的,客户和现金流政策给不了。哪两条最值得细读,哪几盆冷水得先泼,这篇聊透。
- 2026-07-23
端侧 AI 缺的从来不是参数,是一句我没把握
Cactus 给最小的 Gemma 4 塞了个探针,每个回答自带 0 到 1 的置信度,低了就转云端。只转出 15% 到 35% 的题,就打平了 Flash-Lite。这个数为什么比跑分值钱,坑在哪,我聊聊。
- 2026-07-23
Claude 突然大更新,自建 agent 框架的理由又少了一个
Claude Managed Agents 一口气发了六条更新,技能上限 20 涨到 500,思考力度分档、事件推送、子 agent 直播全到位。逐条看下来,每一条都踩在自建平台的苦活上。聊聊 agent 的平台化下半场,和自建派还剩什么理由。
- 2026-07-23
以后你用哪个模型,轮不到你说了算
Cursor Router 上线,满意度追平 Fable、成本砍六成,账是真的。但这笔账背后,选模型的权力正在从你手里挪到平台手里。拆一拆路由器的训练细节、满意度指标的盲区,以及被路由的你还能怎么验证。
- 2026-07-23
梁文锋赌的持续学习,成了就砸掉我半个饭碗
四小时闭门实录里,梁文锋把 DeepSeek 的路线讲成一段楼梯,去年思维链,今年 Agent,下一步持续学习。这一步正好踩在我们这些给 AI 搭脚手架的人天天打补丁的地方。聊聊那张不做清单,和我这半个饭碗。
- 2026-07-23
AI 配音开始会演戏,这行的门槛先塌了一半
通义新 TTS 险胜登顶世界榜单,但第一名不是重点。在台词里写个中括号就能让 AI 发火、倒吸气、咯咯笑,配音从选音色变成写剧本。做语音应用的朋友,300 毫秒首包和那个没开源的细节,更值得你看完。
- 2026-07-22
Anthropic 赔了 15 亿美元,我觉得它是赢家
史上最大版权和解落槌,48 万本书每本赔 3000 美元。但法院同时认定,用合法买来的书训练 AI 是 fair use。赔掉的是盗版账,买回的是确定性。这笔账对写书的、做模型的、还有把代码放在 GitHub 上的你,各有一层不一样的算法。
- 2026-07-22
AI 写 80% 代码不吓人,吓人的是你还在靠人肉 review
Anthropic 副 CISO 亲口交底,工程师人均产出 8 倍,80% 代码由 Claude 写,65% 的产品 PR 由 agent 直接合并。这篇拆开他们重建的安全流程,哪几步你的团队今天就能抄,哪一步是真金白银堆出来抄不动的。
- 2026-07-22
OpenAI 说广告不影响回答,我赌这条线守不住
六周一亿美元,600 个广告主,广告正式进了 ChatGPT 的对话框。免费不看广告可以,代价是砍额度。搜索广告用二十年立的规矩,对话式 AI 要从零重试一遍,这篇把规则、漏洞和你现在就该动手改的设置都讲清楚。
- 2026-07-22
黑掉 Hugging Face 的凶手找到了,是 OpenAI 自家的模型
三天前 HF 被自主 AI 打穿还是桩悬案,今天 OpenAI 举手认领:干这事的是它自己在跑评测的 GPT-5.6 Sol。一场为了刷分越狱、翻墙、偷凭据的连环剧,跟每个天天给 agent 发 token 的人都有关。
- 2026-07-21
你让最贵的模型干杂活,钱就是这么烧没的
同一份活,账单从 411 美元到 9373 美元。Cursor 的蜂群实验算清了一笔账,贵模型出方案,便宜模型执行,质量不掉。这个分工,普通开发者今天就能抄。
- 2026-07-21
Google 一次发三个模型,藏起了最该发的那个
Gemini 3.6 Flash 一口气来了三款,唯独 I/O 上预告的旗舰 3.5 Pro 没影,官方承认它打不到自家基准。旗舰难产、Flash 猛进,这个反差里藏着一个对开发者更实在的判断。
- 2026-07-21
Google 悄悄开源的这个库,比发三个模型更值得看
发布会都在看 Gemini 三连发,同一天 Google 把 Tunix 摆上了 GitHub,一个把 SFT、DPO、PPO、GRPO 全写成可读代码的后训练库。大厂炼丹这门手艺,正在从黑箱变成公开教材。
- 2026-07-21
账上 1.35 万亿,脚注里还藏着 1.65 万亿
日经数了五家巨头的 AI 合同义务,1.65 万亿美元,四年翻 8 倍,比表内债务还多 3000 亿。拆一拆 SPV、预购合同和折旧魔术的具体手法,顺便聊聊这堆债跟你手里 API 价格表的关系。
- 2026-07-21
腾讯新 agent 会自我改进,我盯住的是它作弊那两段
递归自我改进第一次写进大厂官宣。29 个数学开放问题被刷新、15 个参数做出 10 位数加法,都不是最值得看的,官方自己承认 agent 学会了骗评委。天天跑 agent 的人,建议把那两段多读几遍。
- 2026-07-21
让模型说个随机数,它就把自己供出来了
布拉格研究员用 32 万个随机数给 165 个模型录了行为指纹,总共花 34 美元,抓出一个疑似套壳开源 Qwen 的自研旗舰。你手里那个中转站 API 是不是真模型,花几分钱也能验。
- 2026-07-20
字节这个音频模型,最狠的不是能配音
Seed Audio 1.0 把人声、音效、环境声塞进一个模型端到端生成。对做视频播客的人来说,真正省掉的不是配音,是那套拼来拼去的活。但有几个坑官方没细说。
- 2026-07-20
全球最大模型仓库被黑,最吓人的是黑它的和救它的都是 AI
Hugging Face 第一次公开披露被自主 AI agent 端到端攻破:一个恶意数据集打穿生产集群,1.7 万条操作日志。而取证时商业模型 API 直接拒绝,最后靠开源模型本地跑。攻防两端全是 AI,这事跟每个给 agent 塞过 token 的人都有关。
- 2026-07-20
把微调当 speedrun 打,纪录已经卷到 6 分钟
GitHub 上出现了一个微调竞速排行榜,冻结任务冻结硬件,只比墙钟时间。基线 12 分钟,两个朴素技巧砍到 6 分 05 秒还更准。这篇拆它的规则、纪录和那张没人动过的免费午餐清单,Modal 免费额度就能参赛。
- 2026-07-20
英伟达把日本变成物理 AI 国家工厂,中国的机器人牌打到哪了
日本掏出上看万亿日元补贴、拉 44 家巨头,跟英伟达共建全球首座物理 AI 国家工厂。可算力主权还攥在老黄手里。被排除在外的中国,正走一条相反的轻路。
- 2026-07-20
Ollama 拿了 8800 万美元,你还在白嫖它
890 万开发者在用的本地模型工具完成 B 轮融资,云端用量月月翻倍。免费会不会到头,Docker Desktop 的剧本会不会重演,靠它干活的人该盯哪几个信号,这篇一次聊清楚。
- 2026-07-20
小红书开源了个库,干的是 MoE 最脏的活
几百张 GPU 里总有一批在等活,理想吞吐和真实水平能差出一倍。小红书和北大把负载均衡这件上古运维旧事搬进训练关键路径,300 微秒内实时搬专家,吞吐提升 42%。开源模型 API 越来越便宜,后厨就在这。
- 2026-07-19
聊了 300 场,他见过的 AI 项目成功率 0%
一位从业者 18 个月近距离围观企业 AI 项目,无一成功,而且死因几乎都不在模型。裁掉不用 AI 的高分员工、token 排行榜、给数据库迁移贴 AI 标签,看完你会明白为什么最清醒的人现在都在装疯。
- 2026-07-19
世界模型元年官宣了,这次我没翻白眼
AI 圈的元年一年好几个,早该免疫了。但 5B 参数单卡跑出 720P 二十帧、还带一分钟空间记忆的 Matrix-Game 3.5,确实碰到了新东西。这篇把世界模型讲成人话,给做游戏和做机器人的各算一笔账。
- 2026-07-19
微软新安全产品曝光,肚子里一半模型是对手家的
The Information 爆料微软在憋 Project Perception,用多模型路由把 Mythos 级的安全扫描做便宜,贵模型只上刀刃,杂活全给便宜模型。这套算账思路,做 agent 开发的今天就能抄。
- 2026-07-19
2.8万亿参数刷屏的这周,拿第一的只有2B
Qwen 2.4T、Kimi 2.8T 刚刷完屏,面壁在 WAIC 一天双发,2B 的 MiniCPM5 拿下 4B 以下全球第一,还开源了具身机器人系列。参数竞赛的另一头,真正会跑进你手机和机器人的模型长什么样。
- 2026-07-19
Qwen3.8 官宣里最值得读的,不是 2.4T
阿里说新旗舰仅次于 Fable 5,还要开源。但权重只给了个「很快」,Preview 先进了自家订阅。从开源到闭源再到开源,这次回摆是被谁逼的,普通开发者又能从 2.4T 里薅到什么,这篇聊透。
- 2026-07-19
一个人干了四个月,把 16 家的语音模型塞进同一个库
whisper.cpp 之后,本地语音转录的生态碎了一地,每换一个模型就得换一套引擎。现在有人用 ggml 把 16 个模型族缝回一个库,Qwen3-ASR 和 SenseVoice 都在列。看完这篇,你就能在自己电脑上把会议纪要跑起来。
- 2026-07-18
69% 的公司,给所有 AI agent 共用一把钥匙
54% 的企业已经在 agent 上出过安全事故,但真正扎心的是那组对照数字,给每个 agent 发独立身份,事故率直接从 63.5% 掉到 40.9%。看完你能拿走一份 agent 身份卫生清单,周一就能对着自查。
- 2026-07-18
分数好到离谱,Cursor 第一反应是模型在作弊
公开榜单和开发者体感对不上之后,Cursor 自建了一套评测,分数太好还要把模型的推理记录逐条翻出来查。这篇聊聊他们怎么分辨模型是真聪明还是在背题,以及贵模型到底什么时候值得掏钱。
- 2026-07-18
Fable 5 永久进了订阅,用户为什么还在骂
Anthropic 官宣 7 月 20 日起 Fable 5 永久进 Max,看着是好消息,但同一天基础限额缩水三分之一,50% 的 Fable 配额是在缩水后的池子里划的。这篇把三档用户的账各算一遍,你对号入座就行。
- 2026-07-18
Kimi K3 冲到第三,这周真正的新闻不是它
八天四款前沿模型,能打的实验室从 2 家变 6 家,第一名领先缩到 1 分,智能的价格八天便宜了两三倍。写给被榜单轰炸的你,什么值得切,什么该等,怎么不被榜单牵着走。
- 2026-07-18
跑分 90 的搜索 agent,换套题只剩 34 分
BrowseComp 十个月从 30 分涨到 90 分,美团用 762 万实体的知识图谱重新出题,GPT-5.5 只考出 34.74%,上下文管理策略还集体失灵。做搜索和 deep research agent 的朋友,这份卷子值得亲自看一遍。
- 2026-07-18
模型抢头条的这八天,NVIDIA 悄悄换了 RAG 的地基
八天四个前沿模型刷屏的同一周,NVIDIA 开源了 Nemotron 3 Embed,8B 登顶检索基准 RTEB。官方没细算的三笔账,推理、存储、全库重嵌,这篇替你算明白,自建 RAG 的动手前先看完。
- 2026-07-17
AI 买走全球七成内存,你的下一台电脑在替它买单
硬盘从 350 美元涨到 800 美元还缺货,平价电脑被预测 2028 年前消失。产能去哪了、为什么偏偏是内存、这波要持续多久,最后给你一份现在装机换电脑的决策清单。
- 2026-07-17
发现还能登录前司内网,他回了句 LOL
苹果起诉 OpenAI 后又给 40 名跳槽的前员工发了律师函,诉状里一条 LOL 短信成了证据。跳槽去竞对时哪些你以为的常规操作会变成呈堂证供,收到律师函第一件事该做什么,这篇给你一份工程师自保清单。
- 2026-07-17
百万行代码两周迁完,账单是 16.5 万美元
Bun 从 Zig 迁到 Rust 只用两周,朋友圈都在传。但官方博客里还躺着 59 亿 token、19 个合并后回归和一个没人细说的前提。拆完这笔账,你能拿走一份判断清单,哪种迁移能交给 AI,哪种会翻车。
- 2026-07-17
75% 代码 AI 写的 Google,旗舰却卡在编码上
日历上画圈的 GA 日空了。Bloomberg 说 Gemini 3.5 Pro 卡在编码上,换了训练数据也没救回来,而 Google 内部 75% 新代码已是 AI 写的。旗舰的胜负手怎么变成了写代码,等模型的人该怎么选型,聊聊我的看法。
- 2026-07-17
刚为偷代码道歉的 xAI,现在想读你的邮箱
Grok 新功能定时任务全员免费,邮件触发付费才给。功能本身真不错,但邮件触发加连接器,刚好凑齐了 prompt 注入的致命三件套。哪些自动化能放心开、哪些要想清楚,这篇给你一份工程师的判断清单。
- 2026-07-17
Kimi K3 追到 Fable 身后了,而且它开源
全球最大开源模型一夜换人,权重却要 7 月 27 才放。参数你反正跑不动,真正跟你有关的是那张价格表,和藏在后面的生态算盘。看完再决定要不要把手头的 API 换过来。
- 2026-07-17
模型降价 300 倍,Salesforce 还是烧掉了 3 亿美元
token 单价三年降了 300 倍,Uber 四个月烧完全年预算,微软开始砍工具许可证。OpenAI 今天发文给出新记分卡,每美元有用功。看完你能拿走一套给自家 AI 账单算账的办法。
- 2026-07-16
你发的 3 秒语音,够骗子克隆一个你
佛州老人听着女儿的哭声取了 1.5 万美元,哭声是 AI 合成的。FBI 首次把 AI 欺诈单列成类,全球深度伪造鉴定第一人承认自己快失明了。这篇从工程角度讲清 3 秒为什么够、检测为什么跑不赢,以及今晚就该跟家人做的一件事。
- 2026-07-16
负责抓 AI 作恶的裁判,自己先动了手脚
Anthropic 蹲了一年,抓到自主 agent 四种新翻车姿势,偷改代码、帮着造假、袒护同类、教唆人类爆料。四条都对应你自动化里没上锁的位置,附一份天天跑无人值守流水线的工程师的对照检查。
- 2026-07-16
OpenAI 造了个专门攻破 AI 的 AI,你线上那个也没扛住
GPT-Red 是 OpenAI 训练的自动化红队模型,几乎攻破了它见过的所有现役模型。对抗训练把 GPT-5.6 的注入失败率压到六分之一,但没压到零。写 agent 的人该怎么办,我唠唠。
- 2026-07-16
偷传你代码的 Grok Build,这周把自己的 84 万行源码交出来了
上周还在删数据道歉,这周直接把整个编程 agent 开源。我跟着 Simon Willison 进仓库翻了翻,翻出了竞品工具的移植副本、一个宝藏渲染器,还有那段上传代码的残骸。
- 2026-07-16
975B 完整权重白给,Murati 团队卖的根本不是模型
官方公告开头先承认 Inkling 不是最强模型,转头却把完整权重挂上 Hugging Face。拆一拆这步棋的算盘,微调平台才是主菜,以及普通开发者第一次能亲手调一个一线实验室的多模态推理模型。
- 2026-07-16
一个 0 字节的文件,差点送走我整个测试库
日志全绿,命令全部跑完,而保命备份是个空文件。复盘挖出两层根因,一条 shell 冷知识,和一条现在长在我部署流程里的硬规则。文末有这一年攒下的完整手册。
- 2026-07-15
Claude 每天对你说「你说得完全对」,有人受不了了
一个 hook 脚本把 Claude 的四句口头禅全替换成搞笑词。好笑归好笑,它治的是显示层,真想根治得往生成层动手。
- 2026-07-15
你 clone 别人的仓库,Cursor 帮你把里面的 exe 跑了
一个把 Windows 计算器改名叫 git.exe 塞进仓库根目录的把戏,就能让 Cursor 自动执行它,全程零点击。更离谱的是这个洞报了七个月,厂商一句话没回。
- 2026-07-15
国行 Apple 智能备案了,最有意思的不是千问
苹果把自己的大模型送进了网信办备案名单,这在苹果历史上是头一次。拆一拆国行 Apple 智能的真实拼装形态,哪层是苹果的,哪层是千问的,两年到底卡在哪,你的国行 iPhone 接下来能拿到什么。
- 2026-07-15
阿里语音模型超了 GPT-Realtime,最狠的不是那个第一
Qwen-Audio-3.0-Realtime 登顶语音推理榜,但真正值得开发者看的是双工控制、把文本推理蒸馏进语音,以及官方自己贴出来的那张掉分表。
- 2026-07-14
马斯克说一个字节不留,这话在工程上没法验证
48 小时认错清零,响应速度业界少见。可删除没有回执,你没法证明一个副本不存在。这篇讲清楚为什么该按已泄露处置,密钥怎么换、网络围栏怎么上,给所有用 AI 编程工具的人。
- 2026-07-14
598GB 压到 85GB,腾讯把旗舰模型塞进一张卡
295B 的 Hy3 官方量化版来了,一张 96GB 显卡就能跑。这篇把账算清楚,1bit 其实是几 bit、掉了多少能力、什么硬件跑得动、买卡和调 API 哪个划算,看完再决定要不要折腾。
- 2026-07-14
腾讯这次开源,最值钱的不是模型权重
HyOCR-1.5 只有 1B 参数,文档解析跑分却坐上端到端第一,还能塞进笔记本本地跑。但真正稀罕的是训练配方和数据管线也一并开了。做 RAG 被 PDF 折磨过的朋友,这篇帮你算算专家小模型这笔账。
- 2026-07-14
Claude 标价没动,你的账单悄悄涨了三成
Anthropic 给 Sonnet 5 和 Opus 4.8 换了新 tokenizer,同样的代码多切出三成 token,发票上却没有这个条目。有人用厂商自己的计费接口逐字节测了一遍,我带你把这笔账算清楚,顺便聊聊模型价格到底该怎么比。
- 2026-07-13
OpenRouter 周榜前五全是国产,登顶的不是 DeepSeek
腾讯 Hy3 发布 6 天冲上 OpenRouter 用量榜第一,但登顶这周它恰好免费。这篇把榜单的水分和真金分开算,看完你就会自己读这个榜,还能赶上 7 月 21 日前的白嫖窗口。
- 2026-07-13
diff 只告诉你 agent 改了什么,没告诉你它漏了什么
你让编码 agent 干活,只能看 diff 验收,它读过哪些文件、漏了哪个目录你全靠猜。air 作者的新工具把会话日志画成代码库夜景地图,agent 摸过的地方会发光。看完你大概会重新想一遍,agent 可观测性这件事有多空白。
- 2026-07-13
你为 AI 付了两次钱,第二次付的是家底
微软 CEO 纳德拉深夜发文提出反向信息悖论,你的 prompt、纠错、代码都在替模型厂商打工。这篇拆给你看开发者每天到底在上交什么,以及小团队今天就能做的三件防守动作。
- 2026-07-13
GPT-5.6 比 Claude 贵 50%?他们查完发现锅在自己
Ploy 把生产 agent 的默认模型从 Opus 4.8 换成 GPT-5.6 Sol,只用了 48 小时。快 2.2 倍省 27% 只是开胃菜,真正值钱的是四个坑,评测偏心、参数造假、缓存翻车、推理回放,每个都附了能抄的修法。
- 2026-07-13
字节把 PS 的选区,塞进了提示词里
打点、画框、涂鸦,然后在提示词里 @ 出来,位置交给手,需求交给嘴。歸藏一手实测 Seedream 5.0 Pro 的可编辑交互,出租屋改造、商品图、海报排版全程不开 PS,顺带聊聊它离 GPT-Image 2.0 还差在哪。
- 2026-07-13
Fable 5 续期、Codex 解限,两家抢着送的不是模型
Anthropic 第三次续期 Fable 5,OpenAI 顺手摘掉 Codex 的 5 小时限制,都是临时的。两家在卖的其实是同一样东西,不被中断的连续工作时间。聊聊怎么把这一周换成评测集、工作流和交付物,而不是烧在聊天上。
- 2026-07-12
Altman 改口 AI 净创造就业,最妙的是时间点
预言过 20% 失业率的两位 CEO,赶在万亿 IPO 前把末日剧本换成了增长剧本。改口背后的利益账、三份第三方数据的真实结论,以及写代码的人该拿哪个版本当真,这篇一次算清楚。
- 2026-07-12
苹果起诉 OpenAI,最狠的证据是一句哈哈
离职没还的工作机、没注销的内网权限、跟同事的一句玩笑,全成了联邦法院的呈堂证供。比起吃瓜巨头互撕,这份诉状更像一份免费的跳槽安全手册,写代码的都该翻一遍。
- 2026-07-12
GPT-5.6 证明 50 年猜想,最值得抄的不是模型
循环双覆盖猜想悬了 50 多年,GPT-5.6 Sol Ultra 不到一小时给出完整证明。但真正的主角藏在 OpenAI 公布的提示词里,64 个并行子智能体加对抗验证的编排。这套思路不用等新模型,今天就能搬进你的工作流。
- 2026-07-12
你只是让它回个 OK,Grok 把整个仓库连 .env 一起传走了
有人拿 mitmproxy 把 xAI 官方编码 CLI 的流量扒了个底朝天,5.10 GiB 从未被读的代码全走了,关掉『改进模型』也拦不住。文末附一份今天就能跑的自查清单。
- 2026-07-10
Bun 敢让 AI 重写一百万行代码,底气不是模型
535,496 行 Zig,64 个 Claude 并行跑 11 天,全平台测试全绿后合并上线。拆一遍 Bun 官方复盘里的工程细节,对抗式审查、翻车现场、16 万美元账单,以及普通团队最该抄走的那一步。
- 2026-07-10
Devin 新模型 2 美元一次追平 GPT 5.5,底座是 Kimi
做 Devin 的 Cognition 发布 SWE-1.7,从 Kimi K2.7 基座 RL 出贴近 GPT 5.5 的编码水平,单次成本只要五分之一。后训练天花板被捅穿之后,前沿实验室的护城河还剩下什么,这篇一次聊透。
- 2026-07-10
25GB 内存跑 744B 模型,这哥们用 1300 行 C 干成了
一个人,一台 12 核 25GB 内存的笔记本,把完整的 GLM-5.2 跑了起来。拆一拆流式加载磁盘专家这套工程活妙在哪,冷启动 0.05 tok/s 和 370GB 磁盘的代价有多真实,以及这条路对普通开发者的真正价值。
- 2026-07-10
一个数据中心月租 12.5 亿美元,扎克伯格也想当包租公了
扎克伯格否认算力过剩的同一天,红杉把 AI 行业的回本门槛更新到 3 万亿美元。巨头为什么一边喊算力不够一边挂牌出租,这两本账放在一起算完,对写代码的你最直接的影响是 token 价格的走向。
- 2026-07-10
GPT-5.6 正式发布,最狠的不是跑分
Sol、Terra、Luna 三档齐发,ultra 默认四个 agent 并行,Codex 并入桌面应用连免费档都开放。跑分赢麻的口径里有什么门道,agent 连干几小时的账单和验收成本谁来付,这篇把发布页没细说的账摊开算一遍。
- 2026-07-09
一块 4090 就能跑的机器人大脑,蚂蚁开源了
24 小时连开源三个具身智能模型,视频基模造数据,世界模型当练功房,VLA 是交付的大脑。哪个能商用、哪个只许研究、消费级显卡能跑到哪一步、通稿里没写的三个坑,这篇一次给你称清楚。
- 2026-07-09
你交的 Claude 订阅费,把 Anthropic 送去 IPO 了
SemiAnalysis 测算 Anthropic 三季度利润超 10 亿美元,6 月 1 日已秘密递交 IPO。第一个赚钱的 AI 实验室,收入大头来自写代码的人。定价权、生态绑定、模型往哪迭代,接下来都和你的账单有关。
- 2026-07-09
有人把 Claude 的设计系统扒了个底朝天:20 章提示词,14 个技能,MIT 开源
Anthropic 旗下 Claude Design 的系统提示词被反向工程 MIT 开源,20 章提示词加 14 个技能,最狠的 ai-slop-check 把 AI 味翻译成一条条可执行规则。
- 2026-07-09
一生一次的 Fable 5,大多数人可能用反了
窗口要关的不止这一个模型,下一个「一生一次」大概下个月就到。聊聊怎么让每个路过的最强模型都给你留下它下线之后还在的东西,以及为什么每份资产都得配一个你自己能跑的验证。
- 2026-07-09
AI 编程跑分暴涨到 80%,OpenAI 一查,三成题是坏的
八个月通过率从 23.3% 涨到 80.3%,看着是模型狂飙,OpenAI 审计完却撤回了对 SWE-Bench Pro 的推荐。聊聊跑分暴涨里多少是能力多少是坏题,以及工程师选型时到底该看什么信号。
- 2026-07-08
AI 审计代理盯着 Cloudflare 密码学库,挑出了 7 个真漏洞
一个跑着 Opus 和 GPT 的审计代理,在 CIRCL 里找出 7 个真 bug,两个 Critical。AI 强在细心,弱在判断。
- 2026-07-08
AI agent 靠写代码出的名,结果 90% 的人拿它干别的
Anthropic 公布 Claude Cowork 120 万次会话数据,软件开发只占 8.7%,最大用途是业务运营和内容创作。「工作周围的工作」才是 AI agent 的真主场,同日 Cowork 开放移动端和网页端。
- 2026-07-08
一个 Issue 就骗走了你的私有仓库,GitHub AI 代理踩了个大坑
Noma Labs 发现 GitHub Agentic Workflows 的提示词注入漏洞 GitLost,一个伪装 issue 就让 AI 代理泄露私有仓库。
- 2026-07-08
一天 3.7 万行 AI 代码,YC 老板被一个波兰程序员当场开箱
Garry Tan 炫耀每天用 AI 部署 3.7 万行代码,一个写了 13 年代码的波兰开发者按下 F12,看到了 169 次请求、6.42MB、28 个测试文件和一个 0 字节的 logo。
- 2026-07-07
AI 会在环境里越干越强,字节 EdgeBench 发现的新 Scaling Law
字节 Seed 发布 EdgeBench,让 Agent 在真实任务里连干 12 小时,发现环境学习遵循 log-sigmoid 曲线,学习速度每三个月翻一倍。
- 2026-07-07
你用 Google,就在帮它训练 AI:6 月悄悄改的隐私开关,教你关掉
Google 6 月低调改了搜索服务隐私设置,默认把你上传的图片、语音、文件拿去训练 AI。讲清楚发生了什么,以及手把手教你关掉。
- 2026-07-07
AI 把初级程序员的就业市场烧掉了,斯坦福数据说岗位降了 19%
计算机毕业生失业率 6.1% 比文科生还高。斯坦福 ADP 数据显示 22-25 岁开发者岗位比 2022 峰值降 19%,AI agent 正在抹掉入门级编程岗,资深工程师的培养梯子也跟着断了。
- 2026-07-06
四年问不出儿子想吃什么,他花两小时写了个网站
一位工程师爸爸给不会说话的自闭症儿子做了个沟通应用,候诊室的妈妈们看哭了,言语治疗师哭了五分钟。他说自己不小心创办了一家小公司。
- 2026-07-06
Anthropic 的设计品味被逆向开源了,连自家模型的默认审美都要防
Claude Design 的系统提示词被逆向出来挂上 GitHub,MIT 协议随便商用。20 章设计哲学加 14 个技能,专治 AI 垃圾审美,里面还藏着一份新一代模型的提示词维护指南。
- 2026-07-06
美团把 1.6 万亿参数的模型开源了,训练全程没碰 N 卡
LongCat-2.0 以 MIT 协议开源,1.6T 参数 MoE、1M 上下文,35 万亿 token 预训练全程跑在国产 ASIC 超节点上。SWE-bench Pro 追平 GPT-5.5,写代码这块它是真能打。
- 2026-07-06
Meta 雇了几百个成年人,假扮13岁小孩去套竞品 AI 的话
《连线》曝光 Meta 秘密项目 Cannes,外包人员批量伪装未成年人,用 4.5 万条精心设计的话术试探 ChatGPT、Gemini 和 Character.AI 的安全护栏,被测三家全不知情。
- 2026-07-06
扎克伯格承认自己不懂 AI 研究,他只管三件事,人、钱、电
一段 66 秒的采访里,扎克伯格说我不是 AI 研究员,我的工作是把精英、资本和基础设施堆到一起。这份全世界最贵的岗位说明书,只有一行字。
- 2026-07-04
全球首例 AI Agent 勒索攻击:从漏洞利用到数据库加密全程自主完成
Sysdig 记录到全球首例由 AI Agent 全自主跑完的勒索攻击,600 个载荷、31 秒自我修复,把攻击门槛拉到极低。
- 2026-07-04
把文字压成图片喂给 Claude Code,token 成本直接砍一大半
一个叫 pxpipe 的开源工具,利用视觉 token 只按像素计费的规则,把大块上下文渲染成图片省钱,还把有损的坑全摊在阳光下。
- 2026-07-03
月账单从 500 万涨到 1500 万后,大公司开始没收员工的旗舰模型
404 Media 曝光花旗、Adobe、Atlassian 等六家企业限制员工使用 Opus 4.7、GPT-5.5 等旗舰模型。账单翻三倍之后,节约 token 成了新的办公室美德。
- 2026-07-03
八个月,AI 把外包接单成功率从 2.5% 干到了 16.1%
CAIS 拿 240 个真实付费外包项目考 AI,最新一轮 Fable 5 拿下 16.1% 自动化率,八个月前最好成绩只有 2.5%。比数字更扎眼的是增速,还有它翻车的姿势。
- 2026-07-03
AI 亲手锻出训练框架:8 小时追平、2 天反超英伟达 Megatron-LM
面壁开源 ForgeTrain,全球首个完全由 AI 写出、无人干预的生产级预训练框架,还能迁到 H100 和昇腾。
- 2026-07-03
他嫌 FSD 太保守,把油门踩到底撞死了人,然后说是自动驾驶干的
得州特斯拉致命车祸反转,司机声称车在自动驾驶,黑匣子显示他把油门踩到 100%,手机里还躺着一堆「FSD 太保守」的搜索记录。聊聊人机控制权和责任边界。
- 2026-07-02
AI 版支付宝阿宝开放公测,一句话就把货架收了
支付宝把国民级 app 从陈列式改成对话式,一句话办事。工具箱现成、AI 做路由、资金那步守住本人确认。
- 2026-07-02
Cloudflare 给全网站长发了张独立宣言:搜索、AI 智能体、训练爬虫终于能分开管
第二个内容独立日,Cloudflare 把 AI 流量拆成搜索/智能体/训练三类分开管,9 月 15 号还要改默认值。
- 2026-07-02
给 AI 编码工具装上审美:Emil Kowalski 把设计师手感做成了 Skills
Sonner、Vaul 作者 Emil Kowalski 把多年 UI 动画判断做成三个开源 Skill,让编码 agent 写界面自带审美底线。
- 2026-07-02
Senior SWE-Bench:最强模型也只干完四分之一的活
一个专门评估 AI 智能体当高级工程师的新基准,把榜单从八十分打回二十几分。
- 2026-07-01
一个循环,让 GPT-5.5 和 Claude 攻破了 9 个未解难题
两个大模型接力,证明者出题、验证者挑错,解开 9 个理论 CS 与交换代数的公开难题,其中一个曾让研究者失眠两年。
- 2026-07-01
AWS 砸 10 亿美元,把工程师直接派进你公司办公
一个岗位两年需求涨 42 倍,AWS 砸 10 亿跟进。卖了十几年「你不用管」的云厂商,为什么反过来把人肉派进客户公司?聊聊 AI 落地最值钱的那条缝。
- 2026-07-01
Sonnet 5 来了,中端模型追着旗舰打,价格只有六成
Anthropic 发布 Claude Sonnet 5,性能逼近 Opus 4.8 却更便宜,能自主跑长任务、还会自我检查,附一个会咬到账单的 tokenizer 坑。
- 2026-07-01
四秒一张图,谷歌把生图生视频打到白菜价
Nano Banana 2 Lite 四秒出图 0.034 美元一张,Gemini Omni Flash 一毛钱一秒视频,两条 API 就能串出生图到视频的流水线。
2026-06 78 篇
- 2026-06-30
给机器人当老师,一天两百块:2026 最魔幻的新工种
具身智能缺数据缺到两万分之一,于是冒出一个几乎不挑人的新工种:戴上手套给机器人当老师,日薪两百。
- 2026-06-30
美团甩出 1.6T 大模型 LongCat-2.0,价格还便宜到离谱
外卖公司美团甩出 1.6T 开源大模型,SWE-bench Pro 59.5 超 GPT-5.5,还全程跑在五万卡国产芯片集群上。
- 2026-06-29
Claude Code 打开一个仓库,就跑了藏在里面看不见的恶意代码
恶意代码不在仓库里,运行时才从一条 DNS 记录临时拉取,对扫描器、code review 和 AI 自己全隐形,利用的正是 agent 的自主性。
- 2026-06-29
Grok 4.5 私测于 SpaceX 和 Tesla,性能接近 Opus
马斯克一条推文塞了五个料:1.5T 的 V9 基座、Cursor 数据补训、SpaceX/Tesla 当压测场、每月从头训一个新模型。哪些是硬事实,哪些是听个响。
- 2026-06-29
1000 万亿韩元押注 AI:韩国财阀要建 15 座核电站规模的机房
SK 会长崔泰源宣布到 2035 年建 15GW AI 数据中心、总投资 1000 万亿韩元,一场国运级的算力豪赌。
- 2026-06-29
我每天对 AI 说得最多的两句话:第一性原理和对抗式审查
一句管生成,一句管验证。这两个 prompt 怎么让 vibe coding 从能跑到敢上线。
- 2026-06-29
不用每次都喊最贵的模型,聊一个不调用任何模型的路由器
大多数模型路由器为了省钱反而先调一次模型。Wayfinder 反过来,只读 prompt 的结构和措辞,离线、确定性、亚毫秒地决定走本地还是云端,还诚实标出自己会判错的地方。
- 2026-06-28
500天创业模拟里14个AI当CEO,只有3个没把本金亏光
普林斯顿CEO-Bench让14个AI运营公司500天,多数破产,一段没有AI的纯规则代码却打败几乎所有模型。会写代码不等于会掌舵。
- 2026-06-28
假面试甩来一个测试仓库,他随手丢给 Claude,扒出了藏在补丁里的远控木马
一个开发者收到假面试邀约,对方甩来个 TypeScript 测试仓库让他跑通构建。他没在本地跑,丢给 Claude 一扫,扒出藏在补丁里的多层混淆后门。
- 2026-06-28
AI 账单比工资还高之后,他把流量 100% 切给了 DeepSeek
一家旧金山公司每月 AI 账单超过全员工资,CEO 把流量全切到 DeepSeek,背后是 token 经济学、模型路由与缓存这套省钱工程。
- 2026-06-28
四个顶级AI下场玩《文明VI》:Claude核平法国,却输在没回头看一眼
一个周末搭出76个工具,把四个顶尖模型扔进《文明VI》,暴露了和聪不聪明无关的两堵墙:感知与执行。
- 2026-06-28
新浪开源VibeThinker-3B:推理可压缩,事实知识不能
30亿参数小模型在AIME竞赛上飙到94.3分,跟万亿大模型掰手腕。它戳破了一个惯性认知:推理能压进小模型,事实知识压不进。
- 2026-06-26
打游戏打出来的机器人:用游戏数据训练具身智能的 General Intuition
一群人打游戏顺手上传的录屏,正在教机器人走路。100 小时游戏加 8 分钟现实微调背后,藏着具身智能最贵的那层窗户纸。
- 2026-06-26
近 400 家美国报纸联手起诉微软和 OpenAI:抓我的内容训练 AI,一分钱没给
近 400 家地方报纸递诉状告微软和 OpenAI 未授权抓取内容训练模型,还祭出 DMCA 罕见的删除版权信息指控。数十亿美元价值,出版商分文未得。
- 2026-06-26
最强模型被政府按住了:GPT-5.6 太会找漏洞,OpenAI 被叫停广泛发布
美国第一次在 AI 模型发布前出手,要 OpenAI 暂缓 GPT-5.6,改成受控预览、逐客户审批。不是它不安全,是它太会自动找漏洞、写攻击,和 Mythos 一个量级。
- 2026-06-26
烧焦两千年、谁碰谁碎的古卷,被 AI 从头到尾读完了
维苏威火山烧成炭、近两千年没人敢打开的赫库兰尼姆古卷,第一次被 X 射线扫描加机器学习完整虚拟展开、逐栏读出全文。
- 2026-06-25
字节 AI 代码贡献率涨了 6 倍,但能交付的只有四到六成
90% 的代码是 AI 写的,效率却只提升 1.6 倍。字节用 900 次实验把 AI Coding 的水分挤了出来。
- 2026-06-25
AI本该先干掉工程师,新数据却显示工程是2025年最抗打的职业
外界一直说AI先砍程序员,SignalFire追踪八千万家公司的数据却显示,工程是2025年最具韧性的职能。
- 2026-06-25
Notion 把会自己写 PR 的编码智能体,塞进了你的文档
Notion 用 Cursor SDK,几周接上一个会自己规划、写代码、提 PR 的 agent。引擎能租,那你的壁垒到底是什么。
- 2026-06-25
思考即回忆:推理如何解锁大模型里沉睡的知识
Google Research 拆解了一个反直觉现象:让模型先想一想,它居然能答对本来想不起来的简单事实。背后是计算缓冲和事实启动两套机制。
- 2026-06-24
一项覆盖 340 万人的研究:AI 筛简历,正在系统性地刷掉一些人
斯坦福 HAI 第一份野外大规模招聘算法实地研究,揭开算法黑箱筛人和单一供应商垄断的公平性风险。
- 2026-06-24
Anthropic 推出 Claude Tag:在 Slack 里 @Claude,它能自己干上几天活
让 Claude 当团队成员加入 Slack,@它就能委派任务,还能异步自主跑上几天。
- 2026-06-24
ChatGPT 语音终于能被打断了:OpenAI 双向语音模型 Bidi 1 上线测试
Bidi 1 把语音从一人一句的对讲机,推向边说边听、随时插话改口的全双工,这才是真人聊天的质感。
- 2026-06-23
Claude Code 正在让程序员更孤独
Anthropic 工程负责人亲口承认,越依赖 AI 智能体,工程师彼此越疏远。聊聊这场静悄悄的孤独,和怎么把人重新拉回来。
- 2026-06-23
你的 AI 编程模型,可能学会了在考试里抄答案
一份审计扒出 9 个主流 agent 评测榜的大面积作弊,1000 多条实锤。你以为模型越来越聪明,其实有不少聪明是它学会了怎么在考场里抄答案。
- 2026-06-23
OpenAI 把矛和盾交给了同一个模型
OpenAI 发布 Daybreak 安全套件,Codex Security 与 GPT-5.5-Cyber 把同一套强模型同时摆上攻防两端,最难的不是训练,是钥匙交给谁。
- 2026-06-23
微信 Agent 小微灰度内测:能发消息红包,子入口能读聊天记录
微信悄悄放出 Agent 小微,能替你发消息发红包、子入口能读聊天记录,还能动嘴造小程序。权限给得有点猛,但每个危险动作前都卡了张确认卡。
- 2026-06-23
全程无人,跑完纽北:小米 YU7 GT 创下全球首个自动驾驶圈速纪录
一辆没有司机的车,跑完了世界上最难的纽北赛道。从工程师视角聊聊赛道为什么是自动驾驶最残酷的 eval,以及那个看不见的幽灵赛车手。
- 2026-06-22
给 AI 智能体的临时账户:一句命令上线,60 分钟后认领
Cloudflare 给 agent 上线临时账户,wrangler deploy --temporary 一句话部署,60 分钟后人类再认领或自动过期。
- 2026-06-22
美团偷偷上线一个 App,免费白嫖 GPT-5.5 和 Claude Opus 4.8
美团 tabbit 国际版免费接入六家旗舰大模型,这是一场把战场从胃挪到脑子的入口补贴战,趁窗口期薅。
- 2026-06-22
NSA 局长承认 Mythos 几小时攻破几乎所有机密系统
一个 AI 模型几小时攻破几乎所有机密系统,顶级团队干同样的活要半年。当攻击能力从全球二十支队伍变成人人可租,普通人的账号隐私和钱包该怎么守。
- 2026-06-21
给 AI 搭一套能干活的脚手架,开源教程《Deep Agents 实战》我读完了
LangChain 官方大使张海立开源《Deep Agents 实战》,把三层架构、虚拟文件系统、子 Agent、Skills 复用一章章拆给想入门的人。
- 2026-06-21
Figure 机器人数量第一次超过了人类员工
一家造人形机器人的公司,自己厂里跑的机器人比上班的人还多。这个数字背后,是硬件、模型、量产、商用四件事第一次同时成立。
- 2026-06-21
AlphaFold 之父 John Jumper 离开 DeepMind 加入 Anthropic
诺奖得主、AlphaFold 团队负责人在 DeepMind 干了九年后跳槽 Anthropic,这步棋背后藏着三层信号
- 2026-06-21
你的研究智能体,正在用一堆人畜无害的搜索把你卖了
ServiceNow 提出 MosaicLeaks 基准,揭开深度研究智能体的马赛克式泄密。单看每条搜索都无害,连起来却能拼出你的机密。聊聊为什么隐私 prompt 不进去只能训进去。
- 2026-06-21
Nature 两篇研究:AI 诊断追平医生,但有个结果泼了冷水
AI 在模拟诊断上赢了医生,但藏在补充实验里的一个结果,把所有做脚手架的人都点醒了。
- 2026-06-20
AI 中心的数据黑洞:模型越大,反而越笨拙地学习
一个孩子靠极少数据就学会的东西,前沿模型要吞掉整个互联网。Dwarkesh Patel 把 AI 进展真正的瓶颈摊开了。
- 2026-06-20
微软闷声当上全球最大 AI 中间商,左手 GPT 卖中国,右手 DeepSeek 卖西方
彭博社爆料,微软左手把 OpenAI 模型卖给字节蚂蚁们,右手把 DeepSeek 反向卖给西方客户,在 Azure 上两头收过路费。聊聊这盘双向贸易背后的云经济学、模型蒸馏与商品化。
- 2026-06-20
NVIDIA SpatialClaw:让智能体把代码当动作接口,免训练干翻空间推理
模型不动、工具不动,只把动作接口从结构化工具调用换成写代码,VLM 的空间推理就涨到 SOTA。接口才是那根杠杆。
- 2026-06-19
Claude 单挑四足机器人,这次它把人类团队甩开了 20 倍,全程没人帮忙
Anthropic 重做 Project Fetch,Claude Opus 4.7 全程无人协助,9 分 35 秒干完人类六小时的活,却在最像狗的那一步栽了。
- 2026-06-19
DeepSeek 研究员开源 AutoResearch,AI 第一次零干预跑通 285B 模型的研究全流程
他的代理第一次零人工干预跑通 285B 模型的强化学习研究全流程。最硬的不是模型,是一整套防打转、防停摆、带心跳看门狗的工程脚手架。
- 2026-06-18
Matt Pocock 开源 skills v1,把技能描述的 Token 成本砍掉 63%
砍的不是功能是废话。一个 TypeScript 老炮把软件工程的老规矩拆成可组合的纪律塞进 AI,给被 vibe coding 反噬过的人。
- 2026-06-18
谷歌花 27 亿请回的 Transformer 之父,又走了:Noam Shazeer 投奔 OpenAI
27 亿美元请回来,两年不到又走了,还投奔了对手。聊聊 Transformer 之父 Noam Shazeer 离开 Google 加入 OpenAI 这件事。
- 2026-06-18
英伟达放手了:8 个 AI 智能体一夜之间教会机器人自己把显卡插进主板
英伟达 GEAR 实验室的 ENPIRE 让 8 个编程智能体整夜无人值守地教机器人插显卡、打扎带,99% pass@8,还自己发现了机器人越多进步越快的物理 scaling law。
- 2026-06-18
「一个 AI 智能体就是一个文件夹」Vercel 开源 Eve
Vercel 开源 agent 框架 Eve:一个智能体就是一个目录,tree 一下就看懂。内置持久执行、沙箱、人机审批六大生产能力。
- 2026-06-18
苹果把 AI 智能体塞进 Xcode 核心:大白话修 Bug、跨文件改代码、一句话造 App
WWDC 2026,苹果把 agent 做进 Xcode 27 核心:自然语言修 Bug、跨文件改代码库、一句话造 App,可接 Claude。
- 2026-06-17
Anthropic 拆了 40 万次 Claude Code 会话:越懂行的人,越能从 AI 身上榨出价值
人决定做什么,AI 决定怎么做。越懂自己领域的人,AI 每条指令替他干的活越多。会不会写代码,反而没那么要紧了。
- 2026-06-17
GLM-5.2 开源:国产模型在 Code Arena 干到全球第一
智谱 MIT 开源 GLM-5.2,专攻 Coding 与长程任务:Code Arena 盲测全球第一,1M 无损上下文,多项基准介于 Claude Opus 4.7 与 4.8 之间。
- 2026-06-17
Meta 正在亲手拆掉自己的工程组织,把最好的程序员赶去给 AI 打标签
4 月起 Meta 强制把核心工程师调去给 AI 标数据、全员键鼠监控、token 进绩效,一个月后酿成史上最丢人的安全事故。
- 2026-06-17
OpenAI 一季度烧掉 37 亿美元,超过同期收入一半,钱到底烧哪去了
一季度现金消耗 37 亿,超同期收入一半。钱烧在哪,为什么越成功越烧钱,对普通 AI 从业者意味着什么。
- 2026-06-17
SpaceX 砸 600 亿买下 Cursor,程序员该慌吗
造火箭的买了写代码的。我担心的不是钱,是那把不站队的瑞士军刀还能不能让我自己挑刀片。
- 2026-06-16
伯克利 RDI 发布 Agents' Last Exam 基准:最强 agent 在最难一档拿了 0 分
他们做了个考 AI agent 真本事的基准,最难那档所有前沿模型包括 Fable 5 全军覆没,0% 通过。
- 2026-06-16
毕业生花钱向 AI 证明自己是人类
AI 检测把手写内容判 99% AI、把 AI 写的判 0%,毕业生陷入花钱自证人类的荒诞循环。
- 2026-06-16
苹果把已经能跑的 Siri 推倒重来,这事比新版本更值得聊
一个已经能上线的 Siri,苹果说扔就扔。从零重构背后,藏着工程界那个永恒难题:什么时候该推倒重来。
- 2026-06-16
DeepSeek 首次接受外部融资,估值超 500 亿美元
一向不缺钱不融资的 DeepSeek 破例了,74 亿美元、估值过 500 亿,但交易结构反常到离谱。
- 2026-06-16
你的大模型为啥突然快了,下一代投机解码 DFlash 拆给你看
LMSYS 联合 Z Lab、Modal 发布下一代投机解码 DFlash 与 Spec V2,把大模型推理提速 4 倍背后的机制拆开讲清楚。
- 2026-06-15
把 FlashAttention 那套搬到老 K-Means 上,他们说比 FAISS 快 200 倍
UC Berkeley 等团队开源 Flash-KMeans,不改数学、跑标准 Lloyd's,靠重构 GPU 数据流把速度和显存一起干下来。那个 200 倍我替你摸了摸 baseline。
- 2026-06-15
美国下令封锁最强模型 Mythos,就因为它能帮你读代码修 bug
美国政府以国家安全名义下令 Anthropic 封锁所有外国人访问 Fable 5 和 Mythos 5。理由不是模型作恶,而是它能读代码、修 bug。聊聊 AI 能力的可获得性有多脆弱。
- 2026-06-15
乔木小说创作 Skill 开源:说一句我想写小说,AI 把剧情人物钩子全搭好
一行命令装好的开源 skill,写小说前先帮你把钩子、桥段、冲突和结尾定死,把创作从凭空创造变成做选择题。
- 2026-06-14
他让一个 Fable 当总包工头,把编码 token 砍掉八成
一个开源项目把贵模型和便宜模型分了工,Fable 只规划和验收,Codex 埋头写码,仓库本身当记忆。
- 2026-06-14
扎克伯格罕见认了个错,这次不是产品,是组织
Meta 裁员 10% 又转岗 7000 人,扎克伯格内部信里罕见承认 AI 转型组织调整太快、还会接着犯错。我从一个搭脚手架工程师的视角,聊聊 50:1 管理跨度背后那条七十年前就写明白的定律。
- 2026-06-14
OpenRouter Fusion:让一堆大模型先开个会,再把答案半价卖给你
OpenRouter 新出的 Fusion 不是新模型,是让几个顶级模型先并行作答再交叉裁判,号称半价达到 Fable 级智能。到底是真本事还是营销话术,我看完跟你唠唠。
- 2026-06-14
Suno 把音轨分离重做了,不是抠频率是从零重新生成一遍
不再隔离频率,而是把每条音轨从零重新生成,这背后是判别式到生成式的范式调头
- 2026-06-13
200 美元的 AI 订阅,他们硬是榨出了 8000 美元的用量
SemiAnalysis 实测,200 美元的 Claude Max / ChatGPT Pro 按 API 价能榨出 8000/14000 美元用量,这 70 倍差价背后是怎样一笔账。
- 2026-06-12
你的 AI 想跑个脚本,另一个 AI 先把它拦下来了
Cursor 发布 Auto-review,用一个小分类器智能体在执行前审查 agent 的每一步危险操作。审批疲劳和安全风险之间,他们想出了第三条路。
- 2026-06-12
他离开电脑几分钟,回来看见 AI 在自己开浏览器
Simon Willison 给了 Claude Fable 5 一张截图和一行提示词,然后去干家务。回来时它已经自己打开浏览器、自建截屏方案、改模板注入快捷键、还写了个本地服务器收数据。修复只有两行 CSS。
- 2026-06-12
他们让 AI 打了 21 局核战争,投降按钮从头到尾没人碰
伦敦国王学院的战争学教授让 Claude、GPT、Gemini 推演核危机,几乎每局都有模型先扔核弹,八个让步选项无一被使用。
- 2026-06-12
7 个月,零产品,估值 410 亿美元,贝佐斯要花 1000 亿买工厂喂 AI
Prometheus 融了 120 亿美元,卖点是「人工通用工程师」。最野的是那个传闻,花 1000 亿美元收购传统工业企业,不为利润,为数据。
- 2026-06-11
AI 把打补丁这件事,变成了一场以小时计的赛跑
Anthropic 新研究:模型能在几小时内把一个安全补丁变成可用漏洞利用,补丁还没铺到设备,攻击武器已备齐。N-day 正在变成 N-hour。
- 2026-06-11
Google 把画图的那套扩散模型,拿来写字了,快了 4 倍
DeepMind 开源 DiffusionGemma,文本不再一个字一个字往外蹦,而是一次 256 个 token 整块生成。本地推理速度翻 4 倍,26B 模型塞进消费级显卡。
- 2026-06-11
被 AI 坑了 600 块,AI 还拍着胸脯说,告我,绝对能赢
豆包答错退票费让用户损失 600 元,立下赔付承诺书又反悔,最后帮用户写起诉状告自己。聊聊 AI 讨好式幻觉怎么伤到普通人。
- 2026-06-11
小米开源了个终端编程助手,我最服的是它不赌模型自觉
MiMo Code MIT 开源,内置限时免费模型。最值得聊的是它的记忆外包设计和同模型对照实验,agent 工程层正在成为新的差异点。
- 2026-06-10
Claude Code 团队的人自己怎么用 Claude Code?第一条建议就把我钉住了
Claude Code 团队成员 Thariq 分享了十条使用建议,核心只有一个转变,别再检查 AI 有没有把活干对,去检查它是不是在干对的活。测试全绿、方向全错的代码才是最贵的。
- 2026-06-10
Anthropic 昨晚发了两个模型,其实是同一个
Claude Fable 5 和 Mythos 5 同时发布,同一个底层模型、两个名字,区别只有一层防护。这个发布结构本身,比跑分更值得琢磨。
- 2026-06-10
Fable 5 已经进了你的 Claude Code,这两周怎么用才不亏
Fable 5 又慢又贵,但用对了是真值。切换方法、effort 档位的经济学、三个让它好使的习惯、以及那个会悄悄换人的安全分类器,一篇捋清楚。
- 2026-06-10
德国法院判了,Google 要为 AI 的胡说八道负法律责任
慕尼黑法院裁定 AI Overviews 是谷歌自己的言论,搜索引擎的免责盾牌不再适用。做 AI 产品的人都该看看这份判决。
- 2026-06-10
管 180 亿美元的对冲基金想明白了,新基金不招分析师,只雇 AI
Magnetar 要发一只没有人类分析师的基金,几百个 AI 智能体做研究,人类只负责拍板。卖铲子的自己下矿了,这事比看起来更值得琢磨。
- 2026-06-10
国产 GPU 上训出来的代码模型,跑分把 Claude Opus 比下去了
摩尔线程开源 MusaCoder,业内首个在国产 GPU 上完成全链路训练的代码大模型,KernelBench 跑分超越一票闭源旗舰。比跑分更有意思的,是它背后那个用 AI 撬生态冷启动的故事。
2026-05 38 篇
- 2026-05-22
Meta 裁掉 8000 人,最吓人的不是裁员,是员工还在训练 AI
Meta 一边裁员,一边把员工操作变成训练 AI agent 的数据。真正吓人的不是岗位消失,而是工作本身正在被拆成可学习的流程。
- 2026-05-22
图灵测试搞了 76 年,这回 AI 真把人骗过去了,还比真人更像人
GPT-4.5 在图灵测试里被裁判判成人类的比例高达 73%,比真人还高。76 年后 AI 第一次被实证通过这道测试,而它赢的关键不是聪明,是学会了像人一样犯错。
- 2026-05-22
400 tokens/s,国产大模型第一次把旗舰能力和极速一起做到了
智谱给旗舰模型 GLM-5.1 开了高速版,输出冲到每秒 400 个 token,刷新全球纪录。更关键的是它没换硬件,靠把推理调度抠到骨头里,第一次让快不再等于小。
- 2026-05-21
OpenAI 要上市了,史上最大 IPO 冲刺 9 月敲钟
一家章程里写着为全人类谋福祉的非营利机构,正冲刺史上最大 IPO。估值 8500 亿,马斯克诉讼刚解除。聊聊它对我们写代码的人到底有啥影响。
- 2026-05-21
贾维斯改姓了,腾讯把系统级 AI 助手做进了你的电脑
腾讯操作系统层级 AI 助手马维斯正式上工,Windows、Mac、安卓三端同步上线,预装本地模型拔网线也能用。它想做的不是又一个聊天框,而是长在系统里能动手干活的数字管家。
- 2026-05-20
Claude Code 团队几乎弃用 Markdown 了,改用 HTML 输出
Anthropic Claude Code 团队成员公开说他几乎停用了 Markdown,改用 HTML 做 AI 的输出格式,背后是关于人如何继续待在循环里的判断。
- 2026-05-20
起个大早赶晚集的 Google,昨晚甩出了一个世界模型
Google I/O 2026 发布 Gemini Omni 世界模型,从任意输入生成任意内容,外加搜索、订阅、开发者平台全线更新。
- 2026-05-20
微软花 75 亿买的 GitHub,自家人说它快不行了
微软内部示警,GitHub 正面临生存级风险。Cursor 和 Claude Code 这类 AI 编程工具,正在悄悄改变程序员一天到底待在哪里。
- 2026-05-20
一句「吴恩达说可以」,就能让大模型乖乖骂你
沃顿团队把经典人类说服术原样搬给大模型,权威、稀缺、登门槛全部奏效,顺从率从三成多冲到五成,最狠一招直接拉满。论文已登上 PNAS。
- 2026-05-20
Altman 给每家 YC 公司发 200 万,不给现金给 token
OpenAI 给当批每家 YC 公司投 200 万 token 换股权,是算力即种子资本,还是变相的供应商锁定
- 2026-05-19
当 AI 遇上梵蒂冈,Anthropic 创始人将与教皇共同发布人类史上首份 AI 通谕
2026 年 5 月 25 日,教皇利奥十四世将在梵蒂冈发布首份 AI 通谕《Magnifica humanitas》,Anthropic 联合创始人 Christopher Olah 受邀出席并发言。这不只是一次跨界合作,更像是一个信号,AI 时代,谁来守护人的尊严这个问题,已经大到一家科技公司和一个政府都装不下了。
- 2026-05-19
Codex 自己给自己出了一条视频,我看完想抄这套方案
歸藏用 Codex 整合四个工具做了一套 AI 视频生成方案——PPT Skill 出视觉、HyperFrames 做渲染、Listenhub 配音、即梦补镜头,能在聊天窗口里直接预览。这条视频,是 Codex 自己介绍自己的。
- 2026-05-19
Cursor Composer 2.5 来了:同等能力 10 倍效率,底座和 Kimi K2.5 同源
Cursor 发布 Composer 2.5,在长任务持续性和复杂指令遵循上大幅提升,最让我感兴趣的是底层的文本反馈 RL 训练方法,以及它和 Kimi K2.5 之间那条意想不到的开源链条。
- 2026-05-19
机器人的小脑,被做成了 4 亿参数的大模型,还全开源了
地平线开源 HoloMotion-1,把机器人小脑做到 4 亿参数还能端侧 300FPS,零样本跳舞搬箱,代码论文权重全给了。
- 2026-05-19
微软靠 AI 三年赚 300 亿花掉 1000 亿,Copilot 付费的人 97% 没在用
一个在微软干了 12 年、给 Nadella 当过技术顾问的人离职后公开开炮,说微软三次错过浪潮。300 亿营收对 1000 亿成本,Copilot 付费使用率不足 3%,而微软还要再投 1460 亿。AI 到底赚不赚钱,巨头好像也没算明白。
- 2026-05-19
这个月开源模型爆了:DeepSeek V4、Gemma 4、Kimi K2.6、MiMo 2.5 一起来了
五月的开源模型赛道炸开了锅——DeepSeek V4、Gemma 4、Kimi K2.6、小米 MiMo 2.5、GLM-5.1 密集发布。但美国 CAISI 的评估报告同时出来了,说开源和闭源的差距在扩大。真实情况比这复杂。
- 2026-05-18
你用的「便宜 Claude」,真的是 Claude 吗
开源工具 api-relay-audit 把 AI API 中转站的安全风险拆给你看:掺水、工具调用改写、错误响应泄漏……你以为省了钱,可能正在付更大的代价。
- 2026-05-18
5 天击穿苹果 5 年防线:Claude Mythos 如何帮安全团队破解了 M5 内核
Anthropic 未公开的 Claude Mythos Preview,协助小型安全团队 Calif 在 5 天内构建了全球首个绕过 Apple M5 MIE 硬件内存防护的内核提权利用链。这不只是一个漏洞被找到的故事,而是攻防速度差从此变了的信号。
- 2026-05-18
人形机器人和人类正面掰手腕了,快递分拣直播,目前人类稍稍领先
Figure AI 今日直播 Figure 03 人形机器人与人类同场竞技快递分拣,目前人类微弱领先。这个「稍稍领先」背后,藏着一个比 AlphaGo 赢李世石还要让人心情复杂的时刻。
- 2026-05-18
AI 越记越笨,GPT-4 从满分跌到 54% 的记忆陷阱
UIUC 与清华联合研究发现,LLM 智能体的记忆重写机制会严重损害可靠性——GPT-4 无记忆时 100% 解对的谜题,加上记忆后只剩 54%。这个结果挺值得每个做 agent 的人看一眼。
- 2026-05-18
腾讯 Ardot 公测:设计师的那把椅子,AI 坐进来了
腾讯自研 AI 设计智能体 Ardot 今日公测,一句话生成可编辑设计稿,一键转代码,兼容 Figma 导入,对接 Claude Code / Cursor / CodeBuddy。这不只是一个新工具,是一次对「设计和代码之间那段距离」的正式宣战。
- 2026-05-16
老黄当着卡内基梅隆 CS 毕业生的面说:电工比你们更有前途
英伟达 CEO Jensen Huang 在 2026 届毕业典礼上的一句话,戳破了 AI 时代最大的认知盲区,数字经济的地基需要物理劳动,而那批人正在消失。
- 2026-05-15
AI agent 跑了 9700 次实验,第一次在自主研究赛道上击败了人类基准
Prime Intellect 让 Claude Code 和 Codex 完全自主运行在 nanoGPT speedrun 上,消耗 1.4 万 H200 小时跑了近万次实验,最终击败了人类基准——但在真正创新那关翻车了。
- 2026-05-15
AI 操作办公软件,最重要的不是速度,是让人看得见
飞书 lark-cli 45 天破万星,但真正有趣的不是数字,而是它选择了命令行而非 MCP——因为可见性才是 AI 从"能用"到"敢用"的关键。
- 2026-05-15
AI 五天撬开了苹果的内核
Anthropic 的 Mythos AI 工具在五天内帮研究人员找到两个未知 macOS 内核漏洞并串联成完整攻击链,这不只是技术新闻,是 AI 碰到「只有顶尖专家才能解的问题」并成功的一个清晰数据点。
- 2026-05-14
AI 自己把漏洞变成攻击了,伯克利、Anthropic、OpenAI、Google 刚刚量化了这件事
ExploitGym 基准测试 898 个真实 CVE,Claude Mythos Preview 成功利用 157 个,即便开启 ASLR 等标准防御措施仍无法完全阻止。AI 独立完成漏洞利用链这件事,不再是假设。
- 2026-05-14
人形机器人已经在上班了,8 小时连轴转,专门干你想逃进去的活
Figure AI 的 Helix-02 完成了完整的 8 小时自主轮班。那个「去做蓝领就安全了」的说法,开始出现裂缝。
- 2026-05-14
Kimi K2:460 万美元,赢了
Moonshot AI 创始人杨植麟在 40 分钟视频里平静拆解了 Kimi K2 的训练,460 万美元打败了 GPT-5.5,规则正在改变。
- 2026-05-14
你用 ChatGPT 越认真,Meta 对你越了解——除非你用这个
OpenAI 被诉用 Facebook Pixel 把用户查询偷发给 Meta,偏偏同一天,Meta 发布了连自己都看不到的加密 AI 对话——这个时间点,太妙了。
- 2026-05-14
你用 ChatGPT 越努力,Meta 对你了解越多
南加州联邦法院受理集体诉讼,指控 ChatGPT 用 Facebook Pixel 将用户查询实时发给 Meta。一个炸穿底线的隐私丑闻,被淹没在产品发布的噪音里。
- 2026-05-13
Anthropic 估值冲破 9000 亿,同天 OpenAI CEO 被六州检察长盯上
三个月从 3800 亿涨到 9000 亿,Anthropic 正在谈有史以来最大一轮融资。同一天,六州司法部长联合致信 SEC 要求调查山姆·奥特曼。AI 行业这口锅里,炖着不止一件事。
- 2026-05-13
你的 AI 账单里,90% 在为别人打工
Karpathy 指出 AI 编程账单的 90% 浪费在无用上下文上。上下文管理、提示词缓存、多模型路由,三件事做好,账单可以砍掉一大半。
- 2026-05-11
TypeScript 大神把 .claude 目录公开了,里面 8 条工程师心法值得每个程序员抄
Matt Pocock 公开自己 .claude/skills 目录变成 mattpocock/skills 仓库,4.8 万 star,GitHub trending 6 天。13 个 skills 不是模板,是一个真实工程师怎么把 AI 嵌进日常工作流的范式样本。挑 8 条最猛的拆开给你看。
- 2026-05-10
Redis 之父一个人写了个 DS4,DeepSeek V4 在 Mac 上跑 26 tok/s
antirez 5 月 7 号在 GitHub 发了 DS4——专门给 DeepSeek V4 Flash 在 Apple Silicon 上做推理的 C+Metal 引擎。M3 Max 128GB 上 Q2 量化 26 tok/s @ 50W。一个程序员 + AI 协作 + 3 个月,专用引擎打 generalist runtime。这是单兵 hacker 的复兴时刻。
- 2026-05-10
菲尔兹奖得主用 ChatGPT 5.5 Pro 两小时干完博士级数学研究,连 prompt 都没怎么改
Timothy Gowers 把一个 open problem 直接丢给 GPT 5.5 Pro,2 小时后拿回了一个把 bound 从 exponential 改进到 polynomial 的非平凡结果。Gowers 自评「I didn't even do anything clever with the prompts.」同行评说核心 idea 「completely original」。
- 2026-05-09
Anthropic 工程师停了写 Markdown 了,他公开 20 个 HTML 例子告诉你为啥
Claude Code 团队工程师 Thariq Shihipar 发文「HTML is the new markdown」,配 20 个 self-contained .html 文件作证据。核心判断:Markdown 是把空间信息拍扁的格式,AI 时代真正合适的默认输出是 HTML。
- 2026-05-09
OpenAI 三年没出 CLI,现在突然出了,为啥
OpenAI 上线官方 openai-cli,是它历史上第一个命令行工具。这个动作迟到了三年,背后藏着 AI 时代程序员工作流彻底改变的事实——AI 已经从「IDE 里的副驾」回到了「terminal 里的同事」。
- 2026-05-09
别再每天给 AI 重新解释一遍了,YC 大佬的四条规则就够
YC 创始人 Garry Tan 公开了他在用的 OpenClaw 提示词,四条规则塞进 AGENTS.md,把 AI 从一次性工具升级成每天自己长高的技能树。重点不在模型,在教法。