本文来源:https://mp.weixin.qq.com/s/SV-xv0bNxUM9jtI7jQJRCg
若有版权问题,请来信告知:13951431913#139.com 或在右方提交评论。

AI Agent的火爆正在带动大模型 token 集体涨价。
智谱 GLM 的 Coding Plan 每天 10:00 放量,几分钟售罄,年内已经三度提价累计 83%。腾讯 CodeBuddy 企业版价格直接翻倍。字节豆包上线专业版收费,加强版 200 元/月,5 小时额度没做多少任务就烧完。
这是整个行业的转向——从"烧钱抢用户"到"让用户买单"。40块一个月挺划算?不是幻觉,是之前各平台在补贴。2026 年中,补贴结束了。
但有一个事实容易被忽略——说"AI太贵"的前提是你只用一家。如果愿意花十几分钟注册几个免费账号,把各家免费额度统一调度呢?每个大模型厂商其实都在提供免费额度。 Google 每天 1500 次免费推理、Groq 每天 7000 次、GitHub Models 每月 $150 额度、OpenRouter 和 HuggingFace 也有免费套餐……
单独看每一个都不够用,但 15+ 家叠在一起,就是每月约 13 亿 Token 的免费池子。

但问题在于每次注册一个新平台就要换一个 SDK、换一个 Key,还要写代码做负载均衡。

有个开源项目叫 FreeLLMAPI,就是做这件事的。它解决的不是注册,是注册完之后的统一调度。
这是怎么做到的
FreeLLMAPI 本质是一个智能路由器。它把 15+ 家厂商的免费 API 全部接进来,统一成一个 /v1 接口。
你的代码连这一个地址,发请求时指定 model="auto",路由器自己决定用哪个模型。
它聚合了哪些模型

项目聚合了 15+ 家厂商的免费模型。以下是部分示例(完整列表见项目官网):
| 提供商 | 代表模型 | 说明 |
|---|---|---|
| Gemini 2.5 Flash / 3.x | 有免费额度,速率限制较低 | |
| Groq | Llama 4 / Qwen 3 | 速度快,免费额度充足 |
| GitHub Models | GPT-4.1 / GPT-4o | 月度免费额度 |
| Mistral | Large 3 / Codestral | 每日免费额度 |
| Cloudflare | Kimi K2 / GLM-4.7 | 免费,低延迟 |
| HuggingFace | DeepSeek V4 / Qwen 3 | 每日免费推理 |
| OpenRouter | 21 个免费模型 | 聚合多个来源 |
| 智谱 (Z.ai) | GLM-4.7 Flash | 国内模型,无需代理 |
还有 OpenAI 兼容的自定义提供商——你可以把自己的付费 API Key 也加进去,允许路由器优先用免费额度,免费额度用完自动走你的付费 Key。

六种路由策略
路由器不只"谁有空用谁"。六种模式对应不同场景:
auto 是默认选项,适合大多数人。路由器每几秒检测一次各模型的响应延时和剩余额度,谁快用谁。你写一封邮件它可能选 Gemini,写一段代码它选 Llama,做一个翻译它选 GPT-4o-mini——不需要你手动干预。
priority 让你指定顺序。比如你先想用智谱(国内快),智谱不行走 Groq,Groq 不行走 Google。路由器按顺序尝试,前面的不行自动跳到后面的。
smartest 和 fastest 是一对。写方案、做分析时用 smartest 选最强模型(GPT-4o 或 Gemini),简单问答用 fastest 选轻量模型(Gemini Flash 或 Groq 上的小模型)。可以手动切,也可以让路由器根据 prompt 长度自动判断。
reliable 适合对稳定性有要求的场景。路由器会避开近期错误率高的提供商,选最不容易报错的。
custom 是高级模式,你可以定义路由链规则——比如"当 prompt 超过 2000 tokens 时走 Gemini,否则走 Groq"。通过管理面板配置。
故障转移和粘性会话
如果正在用的模型突然报 429 限速或 5xx 错误,路由器会自动切换到下一个可用的模型。切换过程你是无感的——不会看到报错,只会收到其他可用大模型的回复。
同一个话题如果中途换模型,AI 会丢失刚才的上下文。FreeLLMAPI 会自动保持同一个模型 30 分钟,只有当你开启新话题或超时才尝试切换。
额度预警
管理面板会显示每个提供商今天的用量、剩余额度、响应速度排行。你可以直观地看到哪个模型今天快用完了,提前手动切换策略——而不是等到请求报错了才知道。


怎么装
先用好桌面版。 去 GitHub Releases 下载对应系统的安装包(Windows .exe 或 macOS .dmg),安装后在系统托盘运行。
但使用之前需要先注册几个免费账户。 FreeLLMAPI 本身不生产免费额度,它是把你已注册的各家厂商免费额度统一调度。以下是你需要提前注册的平台:
| 平台 | 注册难度 | 说明 |
|---|---|---|
| OpenRouter | 低 | 邮箱注册,免费模型多;充值 $10 后日限额从 50 提升到 1000 |
| Google AI Studio | 低 | 有谷歌账号即可,免费额度充足 |
| Groq | 低 | 邮箱注册,无需海外卡,速度最快 |
| GitHub Models | 低 | 有 GitHub 账号即可,每月免费额度 |
| HuggingFace | 低 | 邮箱注册,无需海外卡 |
| 智谱 (Z.ai) | 国内直连 | 手机号注册,无需代理 |
注册后在控制台生成 API Key,然后在 FreeLLMAPI 管理面板的 Keys 页面逐一添加。
代码中只需要改一行(统一 API Key 在管理面板 Keys 页面获取):
from openai import OpenAIclient = OpenAI( base_url="http://localhost:3001/v1", api_key="freellmapi-your-key",)其他一切不变。model="auto" 让路由器自动选模型,也可以指定具体模型名。
你也可以混入自己的付费 Key(比如 OpenAI 的付费 API),路由器会自动优先用免费额度,免费的用完再走你的付费 Key,不会浪费一分钱。
如果想用 Docker 部署或从头编译,项目 GitHub 上有完整的安装文档。
什么时候该用,什么时候不该用
适合的场景:
Agent日常写作、AI 聊天、内容创作、原型验证、作业汇报、个人项目——这些场景模型偶有切换不影响最终结果。你省下的可能是一年几千块的 API 费用。
不适合的场景:
代码补全和 IDE 内联建议——模型切换会打乱补全逻辑,前一秒用 GPT-4o 后一秒切到 Gemini,上下文不一致会导致补全质量跳水。
生产环境——需要确定性的模型行为、固定的延迟表现、可追溯的调用链路。免费额度的不确定性和路由器的黑盒决策不适合线上业务。
一句话判断: 如果 AI 输出的质量波动你能接受,用它省钱;如果需求更精准的输出质量,就搭一个固定的付费Plan。
觉得有用的话,点个关注+赞再走~我是专注AI自动化的启明,咱们下一篇接着聊。