可能是最好用的免费模型了——Agnes 2.5 flash


腾讯Workbuddy下载链接 百度 Dumate邀请码: 7D8DUYG 字节跳动TraeWork免费4500积分 Tabbit AI浏览器 MonkeyCode 长亭百智云

本文来源:https://mp.weixin.qq.com/s/UygkZyDqWnBVl0Ts0Q0lAw
若有版权问题,请来信告知:13951431913#139.com 或在右方提交评论。

2026 年 7 月 13 日,新加坡 Sapiens AI 正式发布了 Agnes-2.5-Flash——一个定位为"全能力文本模型"的机型。同日上线的还有 Agnes Code 桌面端,以及尚未正式发布但已在内部完成训练的旗舰版本 Agnes-2.5-Pro

看完刚才这段话,可能你还是一头雾水,什么AI?什么Flash?没听说过。

不过“免费”二字,倒是很有含金量。毕竟免费意味着无限试错、无限迭代,既不用绞尽脑汁写一些文言文prompt节省token,也不用在月底为账单感到心痛。免费模型无论是给老玩家补充token弹药,还是帮新手小白探索Agent玩法,都是不错的挑选。

尽管如此,如果模型的能力太差,听不懂需要、多次返工,就算免费也会令人抓狂。幸运的是,看能力,Agnes已经接近了全球第一梯队。


一、Agnes 模型概况

1.1 什么 AI ?

Agnes AI 是新加坡 AI 公司 Sapiens Technology Pte. Ltd. 旗下的机型品牌。这家公司成立于 2024 年(一说 2025 年 7 月),创始人与 CEO 是 Bruce Yang——新加坡莱佛士书院校友,NUS 人工智能方向博士生。团队核心成员来自 NUS、NTU、MIT、斯坦福、UC Berkeley、UT Austin 等高校。

Sapiens AI 的融资情况:

轮次
时间
金额
领投方
Seed
2025 年
未公开
Series A
2026 年 2 月 13 日
1000 万美元
LOOK FORWARD VCC
累计融资
约 2000 万美元

公司定位格外明确:自己训练模型,不用第三方 API。它不是 OpenRouter 那种模型聚合平台,而是从底层架构到应用层全部自研。这也是为什么它能做到"不限期免费"——成本结构完全掌握在自己手里。

截至 2026 年 6 月,Agnes AI 已有超过 600 万使用者,每周处理超过 5.41 万亿 tokens(其中文本 token 3.25 万亿、多模态 2.16 万亿)。这个数字意味着什么?大概相当于每周免费输出数百万本长篇小说的文字量。

1.2 什么 Flash ?

Agnes AI 的机型矩阵围绕三类模型展开:

文本 / Agent 模型

模型
发布时间
定位
状态
agnes-1.5-flash
早期
快速对话、内容生成、简单多模态任务
✅ 已发布
agnes-2.0-flash
2026 年 5 月前
编码、推理、Tool Calling、Agent 工作流、图像理解
✅ 当前主力
agnes-2.5-flash2026 年 7 月 13 日
新一代编码与 Agent 主力模型,全面升级
✅ 已发布
agnes-2.5-pro
预计 2026 年 7 月下旬
旗舰通用推理,对标 Claude Opus 4.8 / GLM-5.2
🚧 Pro 预览版

图像模型

模型
用途
agnes-image-2.0-flash
文生图、图生图、快速出图
agnes-image-2.1-flash
高精细图生图、图像编辑

视频模型

模型
用途
agnes-video-v2.0
文生视频、图生视频、关键帧动画

另外还有创意平台 Pavo(web 端 AI 创作工作室)和桌面 IDE 工具 Agnes Code,统一账号体系,一套积分通吃所有能力。

1.3 Agnes-2.5-Flash 的核心规格

依据官方文档和发布信息,Agnes-2.5-Flash 的关键参数如下:

维度
数值
上下文窗口
256K tokens
最大输出
65K tokens
多模态输入
文本 + 图像 URL
Thinking Mode
兼容(编码/调试情形启动深度思考)
Tool Calling
兼容(Function Calling)
Stream 输出
兼容
API 兼容
OpenAI SDK + Anthropic thinking 字段兼容
定价
输入 0(永久免费)

比较前一代 agnes-2.0-flash,官方强调在以下几个维度有显著提高:

1.4 与 OpenAI / Anthropic 的兼容性

显然兼容。Agnes AI 给出的是 OpenAI 兼容 API

from openai import OpenAIclient = OpenAI(    base_url="https://apihub.agnes-ai.com/v1",    api_key="your-key-here")response = client.chat.completions.create(    model="agnes-2.5-flash",    messages=[{"role""user""content""你好"}],    stream=True)

同样兼容 Anthropic 风格的 thinking 字段。这意味着如果你的项目已经在用 OpenAI 或 Anthropic SDK,只需要替换 base_url 和 model 名称就能切换,集成成本极低。

1.5 免费?

很多人会问:免费能做到什么程度?是不是有隐藏限制?

实际情况是:

项目
说明
费用
输入、输出均 $0
有效期
不限期(官方承诺)
RPM 限制
免费版 30 RPM(实际可执行约 20 RPM)
模型挑选
只能使用 Agnes AI 自有模型
第三方模型
需要借助 Agnes Code 等平台,按会员收费(定价未公布)

也就是说:Agnes AI 自己的模型全部免费,涵盖文本、图像和视频。如果你借助 OpenRouter 等第三方平台间接使用,那是另一回事。RPM 对日常开发够用,但如果你要跑大规模自动化 Agent,可能需要升级到 Token Plan 或企业计划。


二、工艺创新点

上一章笔者了解了 Agnes 的"硬指标":免费、免费 API、免费多模态。但真正让这套打法跑通的,不是营销话术,而是一整套从底层训练到上层调度的工艺栈。

下面从最简单的直觉出发,一步步拆解 Agnes 有哪些自己独有、别人没有的工艺优化


2.1 强化学习的"防崩溃"算法:DSPO

先回答一个根本难题:模型怎么变聪明?

大模型训练分几步:先用海量文本做预训练(读万卷书),再用人类反馈微调(学习规范),最后一步是强化学习(RL)——让模型在复杂任务中借助"试错+奖惩"学会最优策略。

但 RL 有个致命弱点:复杂任务中的奖励信号太稀疏、太高频的失败会导致策略崩溃。

举个例子。让 AI 帮你做一份研究报告,流程大概是:理解需要 → 搜索资料 → 整理分析 → 写结论。如果最后只给一个"做完了就给奖励"的信号,模型根本不知道哪一步做得好、哪一步做错了。更糟的是,在搜索情形中,大量尝试会失败,奖励信号几乎为零,梯度变得不稳定,训练直接崩塌。

这就是 DeepSeek 的 GRPO 等主流算法碰到的难题——它们在简单推理任务上表现出色,但在需要多轮搜索、工具调用、长链规划的 Agent 任务中容易"学崩"。

Agnes 的做法叫 DSPO(Dynamic-filter Sequence-level Policy Optimization),中文名"动态过滤序列级策略优化"。它不是又发明了一个新 RL 算法,而是把两个已知的好思想巧妙组合在一起。

先看第一个难题:优化单位不匹配。 GRPO 在 token 级别做优化,但奖励是对整个序列给的——相当于你用每个字的表现来打分,但评判标准却是整句话写得好不好。这就像用每一步来评价一场马拉松的成绩。DSPO 改成序列级优化:不再盯着每个 token 单独算梯度,而是对整条轨迹算一个综合校正因子。这样梯度方差大幅降低,训练不再崩溃。

第二个难题:稀疏奖励浪费样本。 搜索 Agent 的训练过程中,很多 prompt 的 trial group 要么全部成功、要么全部失败,这些组的长处信号为零或不存在,白白浪费了算力。DSPO 引入了动态过滤机制:只保留"既有成功又有失败"的 trial group 用于训练,强制确保每个 batch 都有非零的、有效的长处信号。

一个比喻就好理解了:

这不是一个小改进。依据 Sapiens AI 在 arXiv 上发表的论文 DSPO,他们在 7B 模型上训练出的 Agent,比之前的基线模型(同规模 GRPO)提高了 34.1%,还超越了一个14B 模型在近 9% 的相对提高——一个参数量只有对方一半的模型,击败了更大的对手。

对使用者的感知价值是什么?模型更稳了,Agent 任务的可靠性更高了,搜索和推理不再是"碰运气"而是"稳定输出"。

2.2 CodeAgents:用"伪代码"而不是自然语言来做 Agent 协作

前面说了如何让单个模型变强,现在聊一个不同的难题:多个 AI Agent 之间怎么高质沟通? 当下使用多Agent拆分复杂任务,分工合作已经有各种细致的落地应对思路,不过Agnes在此基础上,开展了新的优化。

假设你有一个研究 Agent 平台,里面有三个角色:

如果用自然语言让这三个 Agent 协作,会发生什么? Planner 说"帮我查一下东南亚科技投资趋势",Solver 搜了一堆信息,然后 Replanner 看了结果觉得不对,又要 Planner 重新调整方向。难题是:每个人的语言理解是模糊的。"查一下"可以理解为深度报告,也可以理解为三句话总结。"科技投资"可以指风投、并购、政府基金……歧义越多,返工越多。

CodeAgents 的核心思路是:不要用自然语言做 Agent 之间的通信协议,改用结构化伪代码。

具体怎么做?

把 Planner、Solver、Replanner 的交互编码成类似这样的结构:

task:"analyze SE Asia tech investment trends"plan:-step:"search"tool:"google_search"query:"Southeast Asia tech funding 2026"expected_length:">= 5 results"-step:"filter"condition:"result_count >= 3"subroutine:"summarize_trends"

这不是真的 Python 代码,而是一种类型化的伪代码格式

这就像软件工程中 API 的约定:前端和后端借助 JSON schema 通信,而不是互相发微信语音。

这种格式化的处理思路有一点像 MCP。 MCP 是 AI 应用连接外部工具和数据源的协议标准(例如怎么调用搜索引擎、数据库、API),而 CodeAgents 是 Agent 平台内部的编排框架——它管的是 Planner、Solver、Replanner 这些角色之间怎么交换信息,不管怎么接入外部工具。

换句话说,MCP 应对的是"AI 怎么用工具",CodeAgents 应对的是"多个 AI 之间怎么高质协作"。在实际机型中,两者可以共存:内部多 Agent 通信走 CodeAgents 式的结构化编排,外部工具调用可以借助 MCP 来对接。

这个外观带来了什么?

指标
比较自然语言 baseline
输入 token 减少
55–87%
输出 token 减少
41–70%
规划准确率提高
绝对值 +3 到 +36 个百分点
VirtualHome 成功率
56%(新 SOTA)

数据来源:CodeAgents 论文的 arXiv - 基准测试 链接:2507.03254。

注意这里和之前"40-70% token 节省"的粗略说法不同——论文原文的数据范围更大,真实数字是 **输入端节省 55-87%,输出端节省 41-70%**。

当然,这也意味着同样的模型能力下,Agnes 可以服务更多使用者而不增加同等比例的推理成本。这就是"免费"背后的真实数学:不靠补贴,靠省下来的 token。

2.3 Universal Verifier:给"主观题"打分

Bruce Yang 本人将其称为 "secret sauce",未开源。

Benchmark 分数高≠实际感受好。你可以在数学题上拿第一,但在写 PPT、做研究报告、甚至"在群聊里该不该说话"这种主观任务上一塌糊涂。Agnes 的核心机型情形恰恰是这类没有标准答案的任务

例如:

传统做法是给这些主观任务找人工标注员打分,效率低且不可扩展。

Agnes 的做法是 Universal Verifier(UV):一个内部评估平台,能对主观任务给出评分和奖励信号。

按 Bruce Yang 本人的说法:"否则模型不知道往哪个方向改进。它甚至不知道该往哪儿走。"

UV 的工作方式大致是两层:

第一层:训练过程中的评估器。 对主观型任务,UV 给出生成结果的评分和反馈,告诉模型"哪里做得好、哪里需要改"。它不仅看最终答案对不对,还要看推理路径是否合理。

第二层:上线后的持续监控。 UV 在后台跟踪真实情形中的反馈信号,如果发现某类任务的回答率下降,就触发重新训练。

传统的科研→发布→上线→发现难题的循环太慢。UV 把它变成了一个持续的闭环

研究 → 评估 → 训练 → 上线 → 反馈  ↑                        ↓  ←←←←←←←← 持续循环 ←←←←←←←

Yang 的原话是:"UV 是笔者的 secret sauce——笔者没有开源它。"它没有公开细节,但从其能力定位来看,它是连接 benchmark 和真实使用者感受的关键桥梁。

2.4 生成平台的"中间层":Intent 翻译而非 Agent 创新

坦率地说,**"三个 Agent 协作"本身不是新概念。** 从 GAN 的 Generator vs Discriminator,到 RLHF 的 Response vs Reward Model,再到各种框架里的 Solver/Reviewer/Replanner 分工,业界早就这么做了。

这里要写清楚的不是"谁用了三个 Agent",而是一个更具体的难题:

当使用者输入是模糊的自然语言,但下游生成模型(图像/视频 Diffusion)需要精确的结构化指令时,中间该放什么?

Agnes 的做法是加一个 Intent Understanding Agent,放在使用者和 Generation/Judge Agent 之间。核心逻辑很简单:

所以这个"三 Agent"的真正价值不在于 agent 数量,而在于LLM 作为意图翻译层,把自然语言的模糊性转化为生成模型可执行的确定性指令。它应对的不是"如何组织多个 Agent"这个新难题,而是"如何让文本生成模型和图像/视频生成模型在同一个工作流中衔接"这个工程难题。

用一句话总结:这不是一个新的创新点,而是一个针对特定情形(多模态生成)的合理工程架构。 值得记录的只是它被明确命名和机型化了。

多Agent开发并不是新鲜事物,不过如何能标准化的使用这种思想,而不依赖于使用者自己人肉Harness,甚至不需要使用者做任何事情,并且要保证稳定性与成效。可以优化到这种程度,那才算是真正值得注意的创新,才不算是似是而非的自我包装。

2.5 自研模型路由:不是所有难题都值得用最大模型

Agnes 不只是一个模型,而是一套模型家族。从 7B 到 30B+ 的参数规模,针对不同任务有不同的小模型专化版本。

Yang 的表述很清楚:

"笔者不需要在每个维度都超过 GPT-4,笔者只需要在特定类别上超越它——研究、PPT 生成、群聊辅助。笔者的平台中每种模式都有专门的模型。"

路由逻辑如下:

使用者请求
可能路由到
"明天天气如何"
小型快速模型
"生成 PPT"
PPT 专化模型
"图像编辑"
Image 2.0/2.1 Flash
"文生视频"
Video V2.0
"复杂代码调试 + Agent 工作流"
Agnes-2.5-Flash / Pro

这本质上是多模型任务路由,类似于 MoE 中"路由器"的思路,但 Agnes 的路由粒度更粗——它不是在模型内部挑选专家,而是在模型之间挑选调度对象。

对成本的直接影响:约一半的使用者流量被路由到小模型或专化模型上,只有一小部分请求需要消耗最大计算资源。这意味着 Agnes 的成本结构中,大头不是"每次调用都用旗舰模型",而是按需分配。这也是"免费"的经济基础之一。

2.6 真实使用者数据飞轮

最后一环:数据的来源。

Agnes AI 有 600 万使用者,日活 20 万以上。这意味着每天有海量真实的、多样的、甚至包含非主流语言和小语种的使用数据被产生。

训练流程大致是:

这就是一个正循环:

使用者越来越多 → 数据越来越多元 → 模型越来越贴使用者需要 → 感受越来越好 → 使用者越来越多

这个飞轮为什么 Agnes 能做到? 因为聚合平台(例如 OpenRouter)只转发请求,看不到使用者和模型之间的完整交互闭环。Agnes 自己训练模型、自己给出 API、自己积累数据,这个闭环是完整的。

2.7 Speed as Product:一分钟内必须完成

贯穿以上所有工艺的最终原则:速度就是机型本身。

Yang 给出的硬标准是:使用者可以在一分钟内完成一次完整的研究。 为什么是一分钟?心理学研究表明,使用者对等待的感受是非线性的:

等待时长
感受
3 秒内
"即时"
10 秒内
"有点慢"
30 秒
注意力开始分散
60 秒
大部分耐心耗尽

要达到这个速度,需要前面的每一项工艺协同配合:自研模型降低推理成本、DSPO 提高训练稳定性(减少反复试验)、CodeAgents 节省 token、意图翻译层减少生成返工、模型路由避免"杀鸡用牛刀"、数据飞轮持续提高成效。

用一句话总结:**"Speed as Product"不是机型上线后再去优化的工程目标,而是从一开始就指导整个工艺栈外观的机型哲学。**

2.8 工艺护城河总结表

工艺维度
核心创新
与传统思路比较
论文/证据来源
自研全栈模型
Text/Vision/Video 全自研,不做聚合
聚合 vs 自产
Coruzant
DSPO
序列级优化 + 动态过滤防崩溃
token 级 GRPO 在 Agent 任务上不稳定
arXiv:2510.09255
CodeAgents
伪代码结构化多 Agent 通信
自然语言 Agent 间通信冗余、易歧义
arXiv:2507.03254
Universal Verifier
主观任务内部评分与持续评估
仅依赖 benchmark 无法衡量真实质量
Coruzant
意图翻译层
LLM 将模糊使用者需要翻译为生成模型的精确指令
多 Agent 架构并非新概念,价值在于应对自然语言→Diffusion 的桥接难题
TechLead Journal #246
多模型路由
7B–30B+ 按任务分发,半流量走小模型
固定用一个旗舰模型处理所有请求
AI Magazine
RLAF + 数据飞轮
真实使用者数据 → 预训练 → 蒸馏 → DSPO
静态数据集训练
Sapiens AI Case Study
Speed as Product
一分钟内完成研究
先保质量再加速
Coruzant

三、表现横评:免费模型能跟谁打?

光说"免费"没意义,人们最关心的还是:它到底有多强?

3.1 Claw-Eval:Agent 能力的试金石

Claw-Eval 是当下最具参考价值的 Agent 基准之一。它评估的是 AI 能否像真正的软件工程师一样,在真实环境中自主规划、调用工具、执行多步骤任务。

排名
模型
Pass@3
1
Claude Opus 4.6
70.4%
2
Step 3.7 Flash
68.3%
3
Claude Sonnet 4.6
67.8%
...
...
...
9Agnes-2.0-Flash60.9%

Agnes-2.0-Flash 以 60.9% Pass@3 排名全球第 9,超越 Gemini 和 MiniMax,进入了全球前十。而 Agnes-2.5-Flash 在这个基准上的具体分数官方尚未公开,但依据官方说法,2.5 版本在所有基准上全面超越了 2.0。

这个排名的含金量很高:Claw-Eval 用的是三次独立测试的 Pass@3 指标——不是跑一次就给你个平均分,而是要三次都能成功才算借助。这意味着模型不仅要"偶尔能做对",还要稳定可靠

3.2 SWE-bench Verified:软件工程真实任务

SWE-bench Verified 衡量的是模型修复真实 GitHub issues 的能力,被业界视为"代码能力黄金标准"。

官方披露的数据:

模型
SWE-bench Verified
说明
Agnes 2.5 Pro
~82.7
内部评估,已接近或达到顶尖水平
GPT-5.5
~84.4 / 88.7*
闭源旗舰
DeepSeek V4 Pro
80.6
开源旗舰
Hy3
78.0
开源 MoE

*GPT-5.5 在不同评估体系下有两个版本:标准版约 84.4,Codex CLI 版约 88.7。

Agnes 2.5 Pro 的 82.7 分已经格外接近 GPT-5.5。但注意,这是 Pro 版本的成绩——Flash 版本的绝对排名官方没有给出具体的公开数据。依据 LinkedIn 和多家媒体的报道,Flash 在多项基准上超越了 GLM 5.2 和 DeepSeek 54 Pro 的部分子项,总体与同级别的开源模型处于同一竞争区间。

3.3 Multilingual SWE:多语言编码

模型
Multilingual SWE
Agnes 2.5 Pro
~78.7
其他模型
官方仅展示了相对排名,无具体分数

3.4 与主要竞品的横向比较

维度
Agnes-2.5-Flash
DeepSeek V4 Flash
GLM-5.2
Kimi K3
GPT-5.5
Claude Opus 4.8
售价免费
0.07
0.28
0.64
30
75
上下文
256K
128K
128K
1,000,000
1,000,000
1,000,000
开源
✅ Apache 2.0
✅ Apache 2.0
✅ 计划中
Agent 能力
Top 10
极强
极强
编程能力
第一梯队
第一梯队
第一梯队
第一梯队
第一梯队
第一梯队
多模态
文本+图像输入
文本为主
文本+视觉
文本+图像+视频
文本+图像+视频
文本+图像+视频
免费可用
✅ 永久免费
❌ 付费 API
❌ 付费 API
❌ 付费 API
❌ 付费 API
❌ 付费 API

几个观察:

3.5 性价比计算

假设你每天写代码 4 小时,平均每小时产生约 10,000 tokens 输出:

项目
每天消耗
月消耗
GPT-5.5 售价
Claude 售价
Agnes 售价
输出 tokens
~240K
~7.2M
$216
$540
$0
输入 tokens
~480K
~14.4M
$72
$216
$0

每个月光这一个数字,Agnes 就能帮你省下不少钱。当然,这不是说你应该完全依赖免费模型,但至少对于日常开发、原型验证、学习探索,它完全可以信赖,作为主力模型使用。


四、总结:值不值得用?

我自己主要在OpenCode的桌面版本,搭配第三方API使用各家模型,当然Agnes也是其中之一。

在使用者意图理解,代码生成、工作流优化、代码难题排查与应对、文档书写与事实核查几个维度的感受,我对于Agnes 2.5 Flash的评价是,高于Deepseek V4 Flash,与Deepseek V4 Pro相当或略低,不如Hy3但差距不大。

考虑到免费与稳定性(我使用Nvidia给出的免费Deepseek V4 Pro,但其额度很小且本身不稳定),再综合考量表现,我自己已经完全将Agnes 2.5 Flash作为默认的模型使用,偶尔用一下Deepseek V4 Flash开展交叉验证。

合适的情形

不合适的情形

一句话

Agnes-2.5-Flash 是当下市面上唯一一个把"免费 + 第一梯队能力 + 完整多模态"三件事同时做到的机型。它可能不是每一项都拿第一,但在"花最少的钱取得足够好的感受"这件事上,当下没有对手。


参考来源

官方文档与发布

学术论文

基准排名

工艺分析与采访

Benchmark 数据新闻


尾声

Agnes AI 的故事很有趣。一家新加坡创业公司,2000 万美元融资,不做聚合平台,自己训练从文本到图像到视频的全栈模型,然后全部免费开放。

这种打法在任何行业都算激进——但它之所以敢这么干,是因为它有别家没有的东西:完整的自研模型栈。不需要向 OpenAI、Anthropic、Google 交"过路费",所以它能把售价打到零。

免费从来不是终点,而是一个让使用者先尝到甜头的入口。但如果 Agnes-2.5-Pro 能像宣传的那样逼近 Claude Opus 4.8,那这个入口可能比很多人想象的要深遂得多。

至于它能不能真正留住使用者?这种模式可以跑多久?我也没有答案,但也许答案就在笔者的手里。

暂无评论,快来发表第一条评论吧!

📮 需求咨询