01 关于我 ABOUT ME
AI Harness 工程师,给大模型搭脚手架
创业公司 | agent 工具链 · 评测 · 调度 · 上下文管理 | 写一线实战、踩坑与判断
- 公众号 小岛AI
- RSS /rss.xml ↗
- LLMs /llms.txt ↗
- 更多 /about/
“ 看模型在生产里
怎么跑、怎么翻车。 ”
HI
AI Harness 工程师,在创业公司给大模型搭脚手架。
记录一线实战、踩坑与判断,偶尔泼冷水。
AI Harness 工程师,给大模型搭脚手架
创业公司 | agent 工具链 · 评测 · 调度 · 上下文管理 | 写一线实战、踩坑与判断
总第 48 期 · 2026-09-15 · 18 条信号
Anthropic 的 CI 任务在 6 个月内增至 25 倍。真正值得借的不是加机器,而是把测试选择做成有状态、可分片、可观测的服务。
GPT-Live-1 在最新语音榜单拿到 81.5 分。可对电话客服、预约和语音助手团队来说,迁移与否不该由 0.2 分决定,先用十通真实电话把打断、工具、成本和兜底验明白。
它能读懂屏幕、跨 app 找资料,也会替你起草邮件。但首轮英语 beta、中国大陆暂不可用、设备与日限额都摆在前面。换机或升级前,先把这五项查清。
它把模糊的好看拆成设计判断、三个旋钮和交付前检查。适合要做落地页、作品集或重做官网的人,文末有最短安装命令和避坑表。
一份公开复核让 AI 补丁 26% 的结论重新回到方法本身。真正能进主干的补丁,得同时经得住原始 PoC、同根因变体、回归和可复核记录。
Suno v6 真正值得看的一步,是把配乐从一次性抽卡改成可编辑的工作流。做视频 BGM 时,用 mini 试方向、wild 找意外、v6 收成品,返工会少很多。
Pro $200 暂停新购与升级后,最容易被忽略的是取消或降级真正生效的那天。把账户状态、账期与替代路径核对完,再动订阅设置。
gws-gmail 能把 Gmail 的筛选、归类和草稿交给 Agent,但 OAuth scope、提示注入和误发风险不能用一句自动化带过。本文给出先只读、再草稿、再谨慎开放发送的三道门。
OpenAI 的 Habitat 把支撑 ChatGPT、API 和 Codex 的在线数据访问收进一个服务。对 AI 产品团队来说,更值得学的不是 Rust,而是把在线状态、复杂查询和权限治理分开设计。
Iris 把模型、搜索循环、上下文管理和判分器一起开源。看完它的公开数据,就会知道一张排行榜为什么不足以帮你选 Agent。
Google 开源的 ARTEMIS 把自然语言需求、真机执行、截图和 Logcat 串进同一条链路。99% 的跑分可看,真正值得先试的是把回归与复现留成可回放证据。
Vercel 的 70 条 React 规则把异步瀑布和包体放在最前面。给 Coding Agent 一段按优先级审查的指令,先解决用户真会等的那几秒。
GPT‑Live‑1 终于进了 API,但全双工只是前台体验的升级。语音层、推理层、工具权限和后台任务仍该分开算账,这份分工表比换模型更值得先做。
上下文窗口更大,并不等于 Agent 更能扛长任务。把目标、约束、证据和下一步放进可恢复的外部状态,才是跨文件 Bug 和长流程不跑偏的底盘。
在一个有连续提交记录的本地语音输入法里实测后,它没把 543 行热键代码拆散,而是把泄漏的剪贴板归还协议收进一个可验证的小模块。
Shop 用 12 周交付原生版本,但重写速度只回答了一半问题。拿一个真实业务流程试跑,把开发、验收和后续改动放进同一本账,才能判断你该不该迁移。
模型能力跑得比流程快时,最容易漏掉的不是一条 Prompt,而是可回放的权限、日志和停机边界。这里给 Agent 团队一份能带进上线评审的检查表。
它不替你赌一张好看的页面,而是把产品类型、版式、配色、字体和可用性检查先定下来。附安装命令和一份可直接复制的设计 Brief。
Cursor Projects 把长期任务交给一个协调者管理,真正变重的不是并发数,而是范围、上下文、权限和验收。这里给出一份启动前就能用的检查清单。
9 月 14 日起,DeepSeek V4 Pro 的 API 请求会自动转到 V4.1 Flash。模型不需要手动换,生产验收却必须提前做。
Claude Code 这两周补了三条命令,把「我装的这堆技能占多少上下文、到底有没有用」从凭感觉变成可量。我在自己机器上把账算了一遍。
GitHub 一位营销负责人把活动筹备收进一张 Issue。真正可借的不是 Copilot 写文案,而是表单、标签、干跑、告警和复盘组成的可审查工作流。
一组 7×7 对照实验把模型配方和数据语料分开重训。12 倍只是开头,更值得看的是它如何测量、哪里不能外推,以及训练预算该怎么重新分。
ChatGPT Images 2.5 最有用的不是把图画得更花,而是把改海报、封面和产品图的返工,收进一套可验收的局部编辑顺序。
Rovo MCP v2 加了更多产品与工具,但团队真正该先安排的是按需取数、最小权限、人工确认和用量边界。这里有一份可直接照着走的接入检查表。
会让 GPT-6 控 Blender,不等于拿到可交付的 3D 资产。Computer Use、MCP 和 CLI 各自该在什么时候上,一份首轮验收清单讲清楚。
最高法刚公开的 AI 纠纷审理意见,不是一张给产品经理背诵的法规清单。把它翻成上线待办,最该补的是授权、停止生成、证据包和风险说明。
Mistral 的 30 亿欧元融资不是让团队今天换模型,而是提醒下一轮模型 POC 把路线、数据、算力与退出条件一起验收。
shadcn 的官方 Skill 不负责替你画页面,它逼着 Coding Agent 先读项目上下文、查现成组件、看文档再动手。设置页和表单这类高频活,终于有了一条不靠临时样式硬顶的短路径。
OpenAI 的 Agent 运行时已达人力的 3.1 倍,但复杂任务依然离不开人工介入。让 Agent 长时并发前,先把这张验收单贴进任务卡。