Cognition 用真实工程检验 Claude Fable 5 长程编程能力


腾讯orkbuddy注册即可得2000积分,可以干不少活。下载链接:https://www.workbuddy.cn/

百度Dumate智能体,也是工作搭配好工具:邀请码及下载地址:百度 Dumate邀请码: 7D8DUYG

字节TraeWork免费4500积分,点击下载字节跳动TraeWork免费4500积分

Tabbit AI浏览器,在浏览器里用AITabbit AI浏览器,点击下载

MonkeyCode 长亭百智云Monkeycode-AI,点击在线使用

Cognition 用真实工程检验 Claude Fable 5 长程编程能力ginobefun@hongming731 · X
2026-07-11 07:56·5小时前
在 X 看原推· x.com
AI 摘要

Cognition 基于 Devin 背景,用内部工程师真实任务检验 Claude Fable 5 的长程编程能力。其内部评测 Frontier Code 不仅要求补丁通过测试,还排除不可维护的结果,最难子集成绩从 Opus 约 10% 提升至 Fable 5 约 30%。团队强调模型能在杂乱日志中持续检索、区分已知与未知,并先明确约束再执行。文章指出“长程”更实用的定义是代理是否记得任务边界、检查操作、承认未知,并建议团队将信任拆解为可观察的过程证据。

http://x.com/i/article/2075729990013132800

BestBlogs 早报 · 07-11|真实工程检验长程编程,训练系统扩展智能体,产品团队重审判断与推荐透明度

在线阅读本期早报

BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。

导语

把一个完整的 issue 交给代理,真正令人不安的地方不在于它能否写出补丁,而在于你要在什么时候相信它已经完成。

今天的三篇精讲分别给出三个不相同的切面:Cognition 用工程师日常工作检验模型能否在长任务里保持判断;快手把可运行仓库变成训练场;Instagram 负责人 Adam Mosseri 则把视线放回产品团队仍要做的选择。

7 月 9 日我们还在讨论长任务模型如何进入工作流。今天更适合把问题收窄:模型能跑得更久之后,评测、训练环境与人的策略判断分别该承担什么责任?

暂无评论,快来发表第一条评论吧!

📮 需求咨询