一个 Reddit 帖子最近在 r/opencode 社区引发热议。
发帖人 candraa6 自称"GitHub Copilot Refugee"——从 Copilot 转过来的开发者。他说自己试了 OpenCode Go 订阅才几天,月度额度已经烧掉了 50%。
不过他的语气并没有在抱怨。恰恰相反,他在表达一种近乎兴奋的困扰:这个模型太好用了,用得根本停不下来。

▲ candraa6 在 r/opencode 发帖:「Didn't expect Qwen 3.7 Max to be this good!」
2-3 分钟抓住根因,Copilot 时代要等 10 分钟还越改越乱
candraa6 是一名软件工程师,主要写 Elixir/Erlang,也做 Python、JS 和 Android 的个人项目。他描述的工作场景全是 brownfield——维护已有代码、修复线上问题、在老项目里加新功能。
他对 Qwen3.7-Max 的核心评价:
"It solves any problem I throw at it like under 5 min, mostly 2-3 minutes."
「抛给它的问题基本 5 分钟内解决,大多数 2-3 分钟。」
"It's like immediately know what the root problem was in few reads and exploration, and then it just fix it."
「它几轮读代码和探索就直接抓住了根因,然后直接修。」
做过维护工程的人都清楚:定位根因往往比修复本身更难。很多 AI 编码工具能改代码,但给出的方案经常在治标——改了这个 bug 又引入那个。candraa6 明确对比了他之前用的顶级模型:
"Mostly I wait >10min for top models like GPT5.4 and Sonnet4.6 to finish its task, and those top models output code that bring more stress to me than solving the actual problem."
「大多数时候等 GPT-5.4 和 Sonnet 4.6 跑完要超过 10 分钟,而且这些顶级模型输出的代码给我带来的压力比解决问题本身还大。」
从 10+ 分钟等待加事后返工,到 2-3 分钟直达根因——这个体验差距足够让人改变使用习惯。candraa6 说他"几天就烧掉了 50% 月额度",原因很简单:每轮反馈都快速有效,他愿意反复投入。
10 行配置文件搞定代码风格,GPT-5.4 需要反复纠正
除了速度,candraa6 提到了一个容易被忽略但实际影响巨大的细节:指令遵循能力。
"It seems really know my taste without I need to extensively tell it, I just slap few lines (less than 10 lines) of global AGENTS.md and it did follow it, full stop."
「它好像不用我多解释就懂我的风格偏好。我只是甩了几行(不到 10 行)全局 AGENTS.md 配置,它就完全遵守了,句号。」
"And yet, on the other hand, I need to constantly yell to top models like GPT5.4 and Sonnet4.6 to really adhere to my taste. HUGE difference."
「但另一方面,我需要不停地对 GPT-5.4 和 Sonnet 4.6 喊话,才能让它们真正按我的风格来。差距巨大。」
AGENTS.md 是 OpenCode 里的一个全局配置文件,类似于团队的 coding guidelines——写上你的风格偏好、约束条件、项目规范,模型在整个会话期间都能"看到"并内化这些规则。
这个能力在日常开发里的价值远超 benchmark 分数。真正在产线上干活的工程师最怕的就是 AI 输出风格飘忽、不遵守团队规范。candraa6 用不到 10 行配置就让 Qwen3.7-Max 稳定输出符合他风格的代码——同样的事情在其他顶级模型上要靠"不停纠正"才能勉强做到。
Qwen3.7-Max 背后:专为 Agent 时代设计的旗舰模型
candraa6 的体验背后有技术支撑。
2026 年 5 月 19 日,Qwen 团队发布了 Qwen3.7-Max,官方博客标题直接点明定位:「The Agent Frontier」。这个模型从设计之初就锚定了 coding agent 场景——编码、调试、重构、多文件工程、长时程自主执行。

▲ Qwen 团队博客:Qwen3.7-Max 定位为「Agent Frontier」
Benchmark 上的表现确实硬:
- Terminal-Bench 2.0(终端环境真实编码任务):69.7 分,超过 DeepSeek V4 Pro Max 的 67.9 和 Claude Opus 4.6 的 65.4
- SWE-Verified(真实 GitHub issue 修复):80.4 分,几乎追平 Opus 的 80.8
- SWE-Multilingual(多语言代码):78.3 分,排名第一
- Apex(高难度数学推理):44.5 分,大幅领先 DeepSeek 的 38.3 和 Opus 的 34.5
但 benchmark 只是一面。更有说服力的是一个官方披露的实战案例:
Qwen 团队让 Qwen3.7-Max 在一块从未训练过的硬件(平头哥 T-Head ZW-M890 PPU)上优化 SGLang 的 Extend Attention 内核。模型连续自主运行了约35 个小时,执行了1158 次工具调用、评估了432 个 kernel 方案,最终实现了10 倍加速(相比 Triton 参考实现的 geometric mean speedup)。
整个优化过程有清晰的阶段性跃迁:
- 前 2 小时:Split-KV 并行策略,从 0.33x 提升到 2.58x
- 中期:去除 launch 和 allocation 开销,跃升至 5.37x
- 25 小时处:累计优化到 8.50x
- 最终 32-35 小时:针对 MTP γ=4 的专用 kernel 重构,达到 10.0x
同样条件下其他模型的成绩:GLM 5.1 达到 7.3x,Kimi 达到 5.0x,DeepSeek V4 Pro 只有 3.3x。
35 小时连续自主执行、10 倍加速——这已经超出了"辅助编码"的范畴,进入了自主工程的领域。
跨 Harness 泛化:不挑框架,放哪儿都能打
candraa6 在帖子里还提到了一个关键观察:
"I think the opencode harness also plays a part of it, it drives these models really well, I guess."
「我觉得 OpenCode 的 harness 也起了很大作用,它把这些模型驱动得很好。」
这恰好呼应了 Qwen3.7-Max 的一个核心设计目标:跨 harness 泛化能力(Cross-Harness Generalization)。
什么意思?简单说,AI coding agent 的表现取决于两个部分:底层大模型 + 上层脚手架(harness)。Harness 负责给模型装上"手脚"——读写文件、执行命令、搜索代码、管理上下文。Claude Code、OpenCode、Qwen Code、Qoder 都是不同实现的 harness。
很多模型在自家 harness 里跑分很高,换个环境就掉链子。Qwen3.7-Max 的训练策略明确针对了这个问题:在多种 harness 上进行强化学习,确保模型学到的是通用的问题求解策略,而不只是特定框架的 prompt 套路。
结果就是:它在 OpenCode 里表现优秀,在 Claude Code 里也行,在自家 Qwen Code 里自然更不用说。官方的 SkillsBench 甚至直接用 OpenCode 跑了 78 个任务来评测。

▲ OpenCode Go 订阅计划:$10/月即可用上 Qwen3.7-Max 等多个模型
生态全景:从 OpenCode 到 Qwen Code,再到 Qoder
Qwen3.7-Max 在第三方 harness 里跑出好成绩,但阿里自家的工具链同样值得关注。
Qwen Code是 Qwen 团队推出的开源终端 AI 编码 agent,专为 Qwen 系列模型优化。它支持交互式 TUI 和 headless 模式,可以用 @ 引用本地文件,支持 Skills/SubAgents/MCP 协议,兼容 OpenAI/Anthropic/Qwen OAuth 多种接入方式。

▲ Qwen Code:开源终端 AI 编码 agent,专为 Qwen 模型优化
如果说 Qwen Code 代表的是"终端流"开发者的选择,Qoder则面向更广泛的工程团队。
Qoder(qoder.com)定位为 agentic coding platform——既有智能补全和对话编程,也支持长时程自动生成。它明确支持 Qwen3.7-Max,并提供限时免费每日调用额度。Qoder 强调的是从辅助到自主的端到端体验,适合想在 IDE 环境里获得 agent 能力的团队。

▲ Qoder:Agentic Coding Platform,支持 Qwen3.7-Max
加上第三方的 OpenCode Go 订阅,开发者现在有三条路径用上 Qwen3.7-Max 的 agent 能力:
- OpenCode Go:低成本订阅,终端 agent,社区活跃
- Qwen Code:官方开源工具,和 Qwen 模型天然适配
- Qoder:IDE 友好的 agentic 平台,适合团队协作
这三条路径覆盖了从独立开发者到工程团队的不同需求。
社区验证:「第一个真正的 Opus Killer」
candraa6 的帖子引发了大量讨论。Reddit 评论区里的反馈进一步印证了他的体验:
"qwen 3.7 max is miles ahead of ds4 pro"
「Qwen 3.7 Max 甩 DeepSeek V4 Pro 好几条街。」
"3.7 max is the first real 'opus killer' IMO"
「3.7 Max 是我认为第一个真正的'Opus 杀手'。」
也有人给出了务实的使用建议:日常开发用便宜模型(DeepSeek Flash、MiMo 等),碰到硬骨头再切 Max。这恰好验证了 OpenCode Go 的混合计费设计——额度按美元等价值计算,用户可以自由搭配不同模型。
X(原 Twitter)上的声音也类似。开发者 @Jamiescript 在 6 月 13 日发帖:

▲ @Jamiescript:「在 OpenCode 上用 Qwen 3.7 Plus 编码,效果和 Claude Opus 4.6 一样好」
"Currently using Qwen 3.7 plus on @opencode for coding and the result is as good as Claude Opus 4.6 from @AnthropicAI. What a time to be alive."
「目前在 OpenCode 上用 Qwen 3.7 Plus 编码,效果和 Anthropic 的 Claude Opus 4.6 一样好。真是个激动人心的时代。」
注意他用的还只是Qwen 3.7 Plus(更便宜的版本),就已经达到了 Opus 级别的效果。Max 版本在此基础上还要更强。
candraa6 自己也在评论区补充了一个重要细节:他从不完全让 AI 自动驾驶(autopilot),始终保持人工在环验证。这种 pair-programming 式的工作流——让模型快速出方案,人类快速验证和修正——可能才是 AI 编码工具当前最高效的使用方式。
$10/月的「Agent 旗舰」体验
回到那个"烧额度"的问题。
OpenCode Go 的月度计划是 $60 额度(约 4770 次 Qwen3.7-Max 请求)。candraa6 几天烧掉 50%,大约消耗了 2400 次高质量请求的等价资源。
这个数字意味着什么?意味着他在几天内完成了大量真实的代码修复和工程任务——每一次请求都产出了足够好的结果,值得继续投入下一轮。
对比一下:如果用 DeepSeek Flash 这类廉价模型,同样的预算可以跑 10 倍以上的请求量。但 candraa6 选择把额度全部花在 Max 上,说明单次输出质量的差距确实能被体感感知到。
Qwen3.7-Max对于独立开发者和小团队来说,这个价格意味着前沿 agent 模型已经从实验室走出来,变成了日常开发工具。
从"等 10 分钟还焦虑"到"2 分钟迭代一轮"
candraa6 的故事里有一个值得深挖的转变:AI 编码工具从"偶尔用用"变成了"全天候搭档"。
在他的 Copilot 时代,使用体验是:提交任务 → 等 10+ 分钟 → 审查输出 → 发现问题 → 返工修复。每个完整循环可能耗费 20-30 分钟,中间还夹杂着"这代码能不能用"的焦虑。
切换到 Qwen3.7-Max 之后:提交任务 → 2-3 分钟出结果 → 验证 → 微调 → 下一轮。循环时间从半小时级压缩到了 5 分钟级,而且输出质量高到用户"压力更小而非更大"。
当反馈循环足够快且质量足够高时,AI 编码工具就不再只是"遇到难题才打开"的救急方案——开发者会自然地把它带进每一个任务里。这就是为什么额度烧得快:每一轮交互都有价值,所以用得越来越频繁。
candraa6 在帖子结尾说:
"Kudos, opencode team & qwen team, I'll definitely keeping this sub, maybe I'll also run the Qwen 3.6 locally to see how good it is"
「致敬 OpenCode 团队和 Qwen 团队,我肯定会续订。也许我还会在本地跑一下 Qwen 3.6 看看效果如何。」
一个前 Copilot 付费用户,4 天内把一半额度用在了 Qwen3.7-Max 上,然后主动决定续订。
对于 Qwen 团队来说,这可能比任何 benchmark 排行榜都更有说服力。