Cognition 基于 Devin 背景,用内部工程师真实任务检验 Claude Fable 5 的长程编程能力。其内部评测 Frontier Code 不仅要求补丁通过测试,还排除不可维护的结果,最难子集成绩从 Opus 约 10% 提升至 Fable 5 约 30%。团队强调模型能在杂乱日志中持续检索、区分已知与未知,并先明确约束再执行。文章指出“长程”更实用的定义是代理是否记得任务边界、检查操作、承认未知,并建议团队将信任拆解为可观察的过程证据。
http://x.com/i/article/2075729990013132800
BestBlogs 早报 · 07-11|真实工程检验长程编程,训练系统扩展智能体,产品团队重审判断与推荐透明度
在线阅读本期早报
BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。
导语
把一个完整的 issue 交给代理,真正令人不安的地方不在于它能否写出补丁,而在于你要在什么时候相信它已经完成。
今天的三篇精讲分别给出三个不相同的切面:Cognition 用工程师日常工作检验模型能否在长任务里保持判断;快手把可运行仓库变成训练场;Instagram 负责人 Adam Mosseri 则把视线放回产品团队仍要做的选择。
7 月 9 日我们还在讨论长任务模型如何进入工作流。今天更适合把问题收窄:模型能跑得更久之后,评测、训练环境与人的策略判断分别该承担什么责任?