Token太贵?这个项目对接了15+免费大模型,智能路由无感切换,每月13亿token免费用


腾讯orkbuddy注册即可得2000积分,可以干不少活。下载链接:https://www.workbuddy.cn/

百度Dumate智能体,也是工作搭配好工具:邀请码及下载地址:百度 Dumate邀请码: 7D8DUYG

字节TraeWork免费4500积分,点击下载字节跳动TraeWork免费4500积分

Tabbit AI浏览器,在浏览器里用AITabbit AI浏览器,点击下载

MonkeyCode 长亭百智云Monkeycode-AI,点击在线使用

\n

本文来源:https://mp.weixin.qq.com/s/SV-xv0bNxUM9jtI7jQJRCg
若有版权问题,请来信告知:13951431913#139.com 或在右方提交评论。

封面

AI Agent的火爆正在带动大模型 token 集体涨价。

智谱 GLM 的 Coding Plan 每天 10:00 放量,几分钟售罄,年内已经三度提价累计 83%。腾讯 CodeBuddy 企业版价格直接翻倍。字节豆包上线专业版收费,加强版 200 元/月,5 小时额度没做多少任务就烧完。

这是整个行业的转向——从"烧钱抢用户"到"让用户买单"。40块一个月挺划算?不是幻觉,是之前各平台在补贴。2026 年中,补贴结束了。

但有一个事实容易被忽略——说"AI太贵"的前提是你只用一家。如果愿意花十几分钟注册几个免费账号,把各家免费额度统一调度呢?每个大模型厂商其实都在提供免费额度。 Google 每天 1500 次免费推理、Groq 每天 7000 次、GitHub Models 每月 $150 额度、OpenRouter 和 HuggingFace 也有免费套餐……

单独看每一个都不够用,但 15+ 家叠在一起,就是每月约 13 亿 Token 的免费池子。

免费额度池示意

但问题在于每次注册一个新平台就要换一个 SDK、换一个 Key,还要写代码做负载均衡。

15+家免费模型聚合

有个开源项目叫 FreeLLMAPI,就是做这件事的。它解决的不是注册,是注册完之后的统一调度。


这是怎么做到的

FreeLLMAPI 本质是一个智能路由器。它把 15+ 家厂商的免费 API 全部接进来,统一成一个 /v1 接口。

统一调度示意你的代码连这一个地址,发请求时指定 model="auto",路由器自己决定用哪个模型。

它聚合了哪些模型

模型列表截图

项目聚合了 15+ 家厂商的免费模型。以下是部分示例(完整列表见项目官网):

提供商代表模型说明
GoogleGemini 2.5 Flash / 3.x有免费额度,速率限制较低
GroqLlama 4 / Qwen 3速度快,免费额度充足
GitHub ModelsGPT-4.1 / GPT-4o月度免费额度
MistralLarge 3 / Codestral每日免费额度
CloudflareKimi K2 / GLM-4.7免费,低延迟
HuggingFaceDeepSeek V4 / Qwen 3每日免费推理
OpenRouter21 个免费模型聚合多个来源
智谱 (Z.ai)GLM-4.7 Flash国内模型,无需代理

还有 OpenAI 兼容的自定义提供商——你可以把自己的付费 API Key 也加进去,允许路由器优先用免费额度,免费额度用完自动走你的付费 Key。

六种路由策略

六种路由策略

路由器不只"谁有空用谁"。六种模式对应不同场景:

auto 是默认选项,适合大多数人。路由器每几秒检测一次各模型的响应延时和剩余额度,谁快用谁。你写一封邮件它可能选 Gemini,写一段代码它选 Llama,做一个翻译它选 GPT-4o-mini——不需要你手动干预。

priority 让你指定顺序。比如你先想用智谱(国内快),智谱不行走 Groq,Groq 不行走 Google。路由器按顺序尝试,前面的不行自动跳到后面的。

smartest 和 fastest 是一对。写方案、做分析时用 smartest 选最强模型(GPT-4o 或 Gemini),简单问答用 fastest 选轻量模型(Gemini Flash 或 Groq 上的小模型)。可以手动切,也可以让路由器根据 prompt 长度自动判断。

reliable 适合对稳定性有要求的场景。路由器会避开近期错误率高的提供商,选最不容易报错的。

custom 是高级模式,你可以定义路由链规则——比如"当 prompt 超过 2000 tokens 时走 Gemini,否则走 Groq"。通过管理面板配置。

故障转移和粘性会话

如果正在用的模型突然报 429 限速或 5xx 错误,路由器会自动切换到下一个可用的模型。切换过程你是无感的——不会看到报错,只会收到其他可用大模型的回复。

同一个话题如果中途换模型,AI 会丢失刚才的上下文。FreeLLMAPI 会自动保持同一个模型 30 分钟,只有当你开启新话题或超时才尝试切换。

额度预警

管理面板会显示每个提供商今天的用量、剩余额度、响应速度排行。你可以直观地看到哪个模型今天快用完了,提前手动切换策略——而不是等到请求报错了才知道。

用量统计面板
装一个服务,一劳永逸

怎么装

先用好桌面版。 去 GitHub Releases 下载对应系统的安装包(Windows .exe 或 macOS .dmg),安装后在系统托盘运行。

但使用之前需要先注册几个免费账户。 FreeLLMAPI 本身不生产免费额度,它是把你已注册的各家厂商免费额度统一调度。以下是你需要提前注册的平台:

平台注册难度说明
OpenRouter邮箱注册,免费模型多;充值 $10 后日限额从 50 提升到 1000
Google AI Studio有谷歌账号即可,免费额度充足
Groq邮箱注册,无需海外卡,速度最快
GitHub Models有 GitHub 账号即可,每月免费额度
HuggingFace邮箱注册,无需海外卡
智谱 (Z.ai)国内直连手机号注册,无需代理

注册后在控制台生成 API Key,然后在 FreeLLMAPI 管理面板的 Keys 页面逐一添加。

代码中只需要改一行(统一 API Key 在管理面板 Keys 页面获取):

from openai import OpenAIclient = OpenAI(    base_url="http://localhost:3001/v1",    api_key="freellmapi-your-key",)

其他一切不变。model="auto" 让路由器自动选模型,也可以指定具体模型名。

你也可以混入自己的付费 Key(比如 OpenAI 的付费 API),路由器会自动优先用免费额度,免费的用完再走你的付费 Key,不会浪费一分钱。

如果想用 Docker 部署或从头编译,项目 GitHub 上有完整的安装文档。


什么时候该用,什么时候不该用

适合的场景:

Agent日常写作、AI 聊天、内容创作、原型验证、作业汇报、个人项目——这些场景模型偶有切换不影响最终结果。你省下的可能是一年几千块的 API 费用。

不适合的场景:

代码补全和 IDE 内联建议——模型切换会打乱补全逻辑,前一秒用 GPT-4o 后一秒切到 Gemini,上下文不一致会导致补全质量跳水。

生产环境——需要确定性的模型行为、固定的延迟表现、可追溯的调用链路。免费额度的不确定性和路由器的黑盒决策不适合线上业务。

一句话判断: 如果 AI 输出的质量波动你能接受,用它省钱;如果需求更精准的输出质量,就搭一个固定的付费Plan。


觉得有用的话,点个关注+赞再走~我是专注AI自动化的启明,咱们下一篇接着聊。

暂无评论,快来发表第一条评论吧!

📮 需求咨询