本文来源:https://mp.weixin.qq.com/s/UygkZyDqWnBVl0Ts0Q0lAw
若有版权问题,请来信告知:13951431913#139.com 或在右方提交评论。
2026 年 7 月 13 日,新加坡 Sapiens AI 正式发布了 Agnes-2.5-Flash——一个定位为"全能力文本模型"的机型。同日上线的还有 Agnes Code 桌面端,以及尚未正式发布但已在内部完成训练的旗舰版本 Agnes-2.5-Pro。
看完刚才这段话,可能你还是一头雾水,什么AI?什么Flash?没听说过。
不过“免费”二字,倒是很有含金量。毕竟免费意味着无限试错、无限迭代,既不用绞尽脑汁写一些文言文prompt节省token,也不用在月底为账单感到心痛。免费模型无论是给老玩家补充token弹药,还是帮新手小白探索Agent玩法,都是不错的挑选。
尽管如此,如果模型的能力太差,听不懂需要、多次返工,就算免费也会令人抓狂。幸运的是,看能力,Agnes已经接近了全球第一梯队。
一、Agnes 模型概况
1.1 什么 AI ?
Agnes AI 是新加坡 AI 公司 Sapiens Technology Pte. Ltd. 旗下的机型品牌。这家公司成立于 2024 年(一说 2025 年 7 月),创始人与 CEO 是 Bruce Yang——新加坡莱佛士书院校友,NUS 人工智能方向博士生。团队核心成员来自 NUS、NTU、MIT、斯坦福、UC Berkeley、UT Austin 等高校。
Sapiens AI 的融资情况:
公司定位格外明确:自己训练模型,不用第三方 API。它不是 OpenRouter 那种模型聚合平台,而是从底层架构到应用层全部自研。这也是为什么它能做到"不限期免费"——成本结构完全掌握在自己手里。
截至 2026 年 6 月,Agnes AI 已有超过 600 万使用者,每周处理超过 5.41 万亿 tokens(其中文本 token 3.25 万亿、多模态 2.16 万亿)。这个数字意味着什么?大概相当于每周免费输出数百万本长篇小说的文字量。
1.2 什么 Flash ?
Agnes AI 的机型矩阵围绕三类模型展开:
文本 / Agent 模型
agnes-1.5-flash | |||
agnes-2.0-flash | |||
agnes-2.5-flash | 2026 年 7 月 13 日 | ||
agnes-2.5-pro |
图像模型
agnes-image-2.0-flash | |
agnes-image-2.1-flash |
视频模型
agnes-video-v2.0 |
另外还有创意平台 Pavo(web 端 AI 创作工作室)和桌面 IDE 工具 Agnes Code,统一账号体系,一套积分通吃所有能力。
1.3 Agnes-2.5-Flash 的核心规格
依据官方文档和发布信息,Agnes-2.5-Flash 的关键参数如下:
| 输入 0(永久免费) |
比较前一代 agnes-2.0-flash,官方强调在以下几个维度有显著提高:
1.4 与 OpenAI / Anthropic 的兼容性
显然兼容。Agnes AI 给出的是 OpenAI 兼容 API:
from openai import OpenAIclient = OpenAI( base_url="https://apihub.agnes-ai.com/v1", api_key="your-key-here")response = client.chat.completions.create( model="agnes-2.5-flash", messages=[{"role": "user", "content": "你好"}], stream=True)同样兼容 Anthropic 风格的 thinking 字段。这意味着如果你的项目已经在用 OpenAI 或 Anthropic SDK,只需要替换 base_url 和 model 名称就能切换,集成成本极低。
1.5 免费?
很多人会问:免费能做到什么程度?是不是有隐藏限制?
实际情况是:
也就是说:Agnes AI 自己的模型全部免费,涵盖文本、图像和视频。如果你借助 OpenRouter 等第三方平台间接使用,那是另一回事。RPM 对日常开发够用,但如果你要跑大规模自动化 Agent,可能需要升级到 Token Plan 或企业计划。
二、工艺创新点
上一章笔者了解了 Agnes 的"硬指标":免费、免费 API、免费多模态。但真正让这套打法跑通的,不是营销话术,而是一整套从底层训练到上层调度的工艺栈。
下面从最简单的直觉出发,一步步拆解 Agnes 有哪些自己独有、别人没有的工艺优化。
2.1 强化学习的"防崩溃"算法:DSPO
先回答一个根本难题:模型怎么变聪明?
大模型训练分几步:先用海量文本做预训练(读万卷书),再用人类反馈微调(学习规范),最后一步是强化学习(RL)——让模型在复杂任务中借助"试错+奖惩"学会最优策略。
但 RL 有个致命弱点:复杂任务中的奖励信号太稀疏、太高频的失败会导致策略崩溃。
举个例子。让 AI 帮你做一份研究报告,流程大概是:理解需要 → 搜索资料 → 整理分析 → 写结论。如果最后只给一个"做完了就给奖励"的信号,模型根本不知道哪一步做得好、哪一步做错了。更糟的是,在搜索情形中,大量尝试会失败,奖励信号几乎为零,梯度变得不稳定,训练直接崩塌。
这就是 DeepSeek 的 GRPO 等主流算法碰到的难题——它们在简单推理任务上表现出色,但在需要多轮搜索、工具调用、长链规划的 Agent 任务中容易"学崩"。
Agnes 的做法叫 DSPO(Dynamic-filter Sequence-level Policy Optimization),中文名"动态过滤序列级策略优化"。它不是又发明了一个新 RL 算法,而是把两个已知的好思想巧妙组合在一起。
先看第一个难题:优化单位不匹配。 GRPO 在 token 级别做优化,但奖励是对整个序列给的——相当于你用每个字的表现来打分,但评判标准却是整句话写得好不好。这就像用每一步来评价一场马拉松的成绩。DSPO 改成序列级优化:不再盯着每个 token 单独算梯度,而是对整条轨迹算一个综合校正因子。这样梯度方差大幅降低,训练不再崩溃。
第二个难题:稀疏奖励浪费样本。 搜索 Agent 的训练过程中,很多 prompt 的 trial group 要么全部成功、要么全部失败,这些组的长处信号为零或不存在,白白浪费了算力。DSPO 引入了动态过滤机制:只保留"既有成功又有失败"的 trial group 用于训练,强制确保每个 batch 都有非零的、有效的长处信号。
一个比喻就好理解了:
这不是一个小改进。依据 Sapiens AI 在 arXiv 上发表的论文 DSPO,他们在 7B 模型上训练出的 Agent,比之前的基线模型(同规模 GRPO)提高了 34.1%,还超越了一个14B 模型在近 9% 的相对提高——一个参数量只有对方一半的模型,击败了更大的对手。
对使用者的感知价值是什么?模型更稳了,Agent 任务的可靠性更高了,搜索和推理不再是"碰运气"而是"稳定输出"。
2.2 CodeAgents:用"伪代码"而不是自然语言来做 Agent 协作
前面说了如何让单个模型变强,现在聊一个不同的难题:多个 AI Agent 之间怎么高质沟通? 当下使用多Agent拆分复杂任务,分工合作已经有各种细致的落地应对思路,不过Agnes在此基础上,开展了新的优化。
假设你有一个研究 Agent 平台,里面有三个角色:
如果用自然语言让这三个 Agent 协作,会发生什么? Planner 说"帮我查一下东南亚科技投资趋势",Solver 搜了一堆信息,然后 Replanner 看了结果觉得不对,又要 Planner 重新调整方向。难题是:每个人的语言理解是模糊的。"查一下"可以理解为深度报告,也可以理解为三句话总结。"科技投资"可以指风投、并购、政府基金……歧义越多,返工越多。
CodeAgents 的核心思路是:不要用自然语言做 Agent 之间的通信协议,改用结构化伪代码。
具体怎么做?
把 Planner、Solver、Replanner 的交互编码成类似这样的结构:
task:"analyze SE Asia tech investment trends"plan:-step:"search"tool:"google_search"query:"Southeast Asia tech funding 2026"expected_length:">= 5 results"-step:"filter"condition:"result_count >= 3"subroutine:"summarize_trends"这不是真的 Python 代码,而是一种类型化的伪代码格式:
这就像软件工程中 API 的约定:前端和后端借助 JSON schema 通信,而不是互相发微信语音。
这种格式化的处理思路有一点像 MCP。 MCP 是 AI 应用连接外部工具和数据源的协议标准(例如怎么调用搜索引擎、数据库、API),而 CodeAgents 是 Agent 平台内部的编排框架——它管的是 Planner、Solver、Replanner 这些角色之间怎么交换信息,不管怎么接入外部工具。
换句话说,MCP 应对的是"AI 怎么用工具",CodeAgents 应对的是"多个 AI 之间怎么高质协作"。在实际机型中,两者可以共存:内部多 Agent 通信走 CodeAgents 式的结构化编排,外部工具调用可以借助 MCP 来对接。
这个外观带来了什么?
| 55–87% | |
| 41–70% | |
数据来源:CodeAgents 论文的 arXiv - 基准测试 链接:2507.03254。
注意这里和之前"40-70% token 节省"的粗略说法不同——论文原文的数据范围更大,真实数字是 **输入端节省 55-87%,输出端节省 41-70%**。
当然,这也意味着同样的模型能力下,Agnes 可以服务更多使用者而不增加同等比例的推理成本。这就是"免费"背后的真实数学:不靠补贴,靠省下来的 token。
2.3 Universal Verifier:给"主观题"打分
Bruce Yang 本人将其称为 "secret sauce",未开源。
Benchmark 分数高≠实际感受好。你可以在数学题上拿第一,但在写 PPT、做研究报告、甚至"在群聊里该不该说话"这种主观任务上一塌糊涂。Agnes 的核心机型情形恰恰是这类没有标准答案的任务。
例如:
传统做法是给这些主观任务找人工标注员打分,效率低且不可扩展。
Agnes 的做法是 Universal Verifier(UV):一个内部评估平台,能对主观任务给出评分和奖励信号。
按 Bruce Yang 本人的说法:"否则模型不知道往哪个方向改进。它甚至不知道该往哪儿走。"
UV 的工作方式大致是两层:
第一层:训练过程中的评估器。 对主观型任务,UV 给出生成结果的评分和反馈,告诉模型"哪里做得好、哪里需要改"。它不仅看最终答案对不对,还要看推理路径是否合理。
第二层:上线后的持续监控。 UV 在后台跟踪真实情形中的反馈信号,如果发现某类任务的回答率下降,就触发重新训练。
传统的科研→发布→上线→发现难题的循环太慢。UV 把它变成了一个持续的闭环:
研究 → 评估 → 训练 → 上线 → 反馈 ↑ ↓ ←←←←←←←← 持续循环 ←←←←←←←Yang 的原话是:"UV 是笔者的 secret sauce——笔者没有开源它。"它没有公开细节,但从其能力定位来看,它是连接 benchmark 和真实使用者感受的关键桥梁。
2.4 生成平台的"中间层":Intent 翻译而非 Agent 创新
坦率地说,**"三个 Agent 协作"本身不是新概念。** 从 GAN 的 Generator vs Discriminator,到 RLHF 的 Response vs Reward Model,再到各种框架里的 Solver/Reviewer/Replanner 分工,业界早就这么做了。
这里要写清楚的不是"谁用了三个 Agent",而是一个更具体的难题:
当使用者输入是模糊的自然语言,但下游生成模型(图像/视频 Diffusion)需要精确的结构化指令时,中间该放什么?
Agnes 的做法是加一个 Intent Understanding Agent,放在使用者和 Generation/Judge Agent 之间。核心逻辑很简单:
所以这个"三 Agent"的真正价值不在于 agent 数量,而在于LLM 作为意图翻译层,把自然语言的模糊性转化为生成模型可执行的确定性指令。它应对的不是"如何组织多个 Agent"这个新难题,而是"如何让文本生成模型和图像/视频生成模型在同一个工作流中衔接"这个工程难题。
用一句话总结:这不是一个新的创新点,而是一个针对特定情形(多模态生成)的合理工程架构。 值得记录的只是它被明确命名和机型化了。
多Agent开发并不是新鲜事物,不过如何能标准化的使用这种思想,而不依赖于使用者自己人肉Harness,甚至不需要使用者做任何事情,并且要保证稳定性与成效。可以优化到这种程度,那才算是真正值得注意的创新,才不算是似是而非的自我包装。
2.5 自研模型路由:不是所有难题都值得用最大模型
Agnes 不只是一个模型,而是一套模型家族。从 7B 到 30B+ 的参数规模,针对不同任务有不同的小模型专化版本。
Yang 的表述很清楚:
"笔者不需要在每个维度都超过 GPT-4,笔者只需要在特定类别上超越它——研究、PPT 生成、群聊辅助。笔者的平台中每种模式都有专门的模型。"
路由逻辑如下:
这本质上是多模型任务路由,类似于 MoE 中"路由器"的思路,但 Agnes 的路由粒度更粗——它不是在模型内部挑选专家,而是在模型之间挑选调度对象。
对成本的直接影响:约一半的使用者流量被路由到小模型或专化模型上,只有一小部分请求需要消耗最大计算资源。这意味着 Agnes 的成本结构中,大头不是"每次调用都用旗舰模型",而是按需分配。这也是"免费"的经济基础之一。
2.6 真实使用者数据飞轮
最后一环:数据的来源。
Agnes AI 有 600 万使用者,日活 20 万以上。这意味着每天有海量真实的、多样的、甚至包含非主流语言和小语种的使用数据被产生。
训练流程大致是:
这就是一个正循环:
使用者越来越多 → 数据越来越多元 → 模型越来越贴使用者需要 → 感受越来越好 → 使用者越来越多这个飞轮为什么 Agnes 能做到? 因为聚合平台(例如 OpenRouter)只转发请求,看不到使用者和模型之间的完整交互闭环。Agnes 自己训练模型、自己给出 API、自己积累数据,这个闭环是完整的。
2.7 Speed as Product:一分钟内必须完成
贯穿以上所有工艺的最终原则:速度就是机型本身。
Yang 给出的硬标准是:使用者可以在一分钟内完成一次完整的研究。 为什么是一分钟?心理学研究表明,使用者对等待的感受是非线性的:
要达到这个速度,需要前面的每一项工艺协同配合:自研模型降低推理成本、DSPO 提高训练稳定性(减少反复试验)、CodeAgents 节省 token、意图翻译层减少生成返工、模型路由避免"杀鸡用牛刀"、数据飞轮持续提高成效。
用一句话总结:**"Speed as Product"不是机型上线后再去优化的工程目标,而是从一开始就指导整个工艺栈外观的机型哲学。**
2.8 工艺护城河总结表
| 自研全栈模型 | |||
| DSPO | |||
| CodeAgents | |||
| Universal Verifier | |||
| 意图翻译层 | |||
| 多模型路由 | |||
| RLAF + 数据飞轮 | |||
| Speed as Product |
三、表现横评:免费模型能跟谁打?
光说"免费"没意义,人们最关心的还是:它到底有多强?
3.1 Claw-Eval:Agent 能力的试金石
Claw-Eval 是当下最具参考价值的 Agent 基准之一。它评估的是 AI 能否像真正的软件工程师一样,在真实环境中自主规划、调用工具、执行多步骤任务。
| 9 | Agnes-2.0-Flash | 60.9% |
Agnes-2.0-Flash 以 60.9% Pass@3 排名全球第 9,超越 Gemini 和 MiniMax,进入了全球前十。而 Agnes-2.5-Flash 在这个基准上的具体分数官方尚未公开,但依据官方说法,2.5 版本在所有基准上全面超越了 2.0。
这个排名的含金量很高:Claw-Eval 用的是三次独立测试的 Pass@3 指标——不是跑一次就给你个平均分,而是要三次都能成功才算借助。这意味着模型不仅要"偶尔能做对",还要稳定可靠。
3.2 SWE-bench Verified:软件工程真实任务
SWE-bench Verified 衡量的是模型修复真实 GitHub issues 的能力,被业界视为"代码能力黄金标准"。
官方披露的数据:
*GPT-5.5 在不同评估体系下有两个版本:标准版约 84.4,Codex CLI 版约 88.7。
Agnes 2.5 Pro 的 82.7 分已经格外接近 GPT-5.5。但注意,这是 Pro 版本的成绩——Flash 版本的绝对排名官方没有给出具体的公开数据。依据 LinkedIn 和多家媒体的报道,Flash 在多项基准上超越了 GLM 5.2 和 DeepSeek 54 Pro 的部分子项,总体与同级别的开源模型处于同一竞争区间。
3.3 Multilingual SWE:多语言编码
3.4 与主要竞品的横向比较
| 售价 | 免费 | |||||
| 上下文 | 1,000,000 | |||||
| 开源 | ||||||
| Agent 能力 | 极强 | 极强 | ||||
| 编程能力 | 第一梯队 | 第一梯队 | ||||
| 多模态 | ||||||
| 免费可用 |
几个观察:
3.5 性价比计算
假设你每天写代码 4 小时,平均每小时产生约 10,000 tokens 输出:
| $0 | |||||
| $0 |
每个月光这一个数字,Agnes 就能帮你省下不少钱。当然,这不是说你应该完全依赖免费模型,但至少对于日常开发、原型验证、学习探索,它完全可以信赖,作为主力模型使用。
四、总结:值不值得用?
我自己主要在OpenCode的桌面版本,搭配第三方API使用各家模型,当然Agnes也是其中之一。
在使用者意图理解,代码生成、工作流优化、代码难题排查与应对、文档书写与事实核查几个维度的感受,我对于Agnes 2.5 Flash的评价是,高于Deepseek V4 Flash,与Deepseek V4 Pro相当或略低,不如Hy3但差距不大。
考虑到免费与稳定性(我使用Nvidia给出的免费Deepseek V4 Pro,但其额度很小且本身不稳定),再综合考量表现,我自己已经完全将Agnes 2.5 Flash作为默认的模型使用,偶尔用一下Deepseek V4 Flash开展交叉验证。
合适的情形
不合适的情形
一句话
Agnes-2.5-Flash 是当下市面上唯一一个把"免费 + 第一梯队能力 + 完整多模态"三件事同时做到的机型。它可能不是每一项都拿第一,但在"花最少的钱取得足够好的感受"这件事上,当下没有对手。
参考来源
官方文档与发布
学术论文
基准排名
工艺分析与采访
Benchmark 数据新闻
尾声
Agnes AI 的故事很有趣。一家新加坡创业公司,2000 万美元融资,不做聚合平台,自己训练从文本到图像到视频的全栈模型,然后全部免费开放。
这种打法在任何行业都算激进——但它之所以敢这么干,是因为它有别家没有的东西:完整的自研模型栈。不需要向 OpenAI、Anthropic、Google 交"过路费",所以它能把售价打到零。
免费从来不是终点,而是一个让使用者先尝到甜头的入口。但如果 Agnes-2.5-Pro 能像宣传的那样逼近 Claude Opus 4.8,那这个入口可能比很多人想象的要深遂得多。
至于它能不能真正留住使用者?这种模式可以跑多久?我也没有答案,但也许答案就在笔者的手里。