OpenAI 达成自动化研究实习生里程碑,Agent 运行时长达人力 3.1 倍
Agent 跑得更久了,验收标准反而更值钱。
OpenAI 的 Agent 运行时已达人力的 3.1 倍,但复杂任务依然离不开人工介入。让 Agent 长时并发前,先把这张验收单贴进任务卡。
读全文 →Anthropic 的 frontend-design Skill 不是一套配色模板。装上前先看这张开工检查表:它怎么把产品语境、字体、布局和自检塞进 Coding Agent 的第一轮工作。
GPT-6 Astra 更会追问,也更认真执行它读得到的规则。升级长任务 Agent 前,先把可直接做、必须确认和如何验收写清,能少掉一半无效拉扯。
OpenAI 说思维链监控正变得更难依赖。真正要紧的不是逼 Agent 多解释,而是在模型之外留住输入、行动、结果和干预四类可复核证据。
英伟达在最新 10-Q 中披露 990 亿美元股权投资和 250 亿美元承诺。对算力采购者而言,真正该追踪的不再只是芯片报价,还有客户融资、锁定期与未来使用率。
Agent 跑得更久了,验收标准反而更值钱。
会做事不稀奇,知道该做什么才开始贵。
长时运行的难题,从来不只是一句自主完成。
时间表很大,今天先把一个任务验收好。
卖卡之外,英伟达开始替算力需求找更长的钱。
省钱不靠猜模型,得把整条任务账算完。
模型会解释,日志才会作证。
验证做得很硬,但同题刚写过,先放下。
模型变强后,提示词终于也得讲卫生。
防住第一脚不够,攻击者会换个角度再敲门。
会写 JSX 还不够,先把页面为什么长成这样讲明白。