ARTICLE · 1159187
AI工具都在收费了?这些大模型API现在还能免费用

不知道你有没有这种感觉:去年还能随便白嫖的 AI 接口,今年一个个都开始要钱了。GitHub Models 直接下线,Cerebras 开始绑卡,OpenAI 和 Anthropic 从头到尾就没给过免费 API 档,连 Hugging Face 的免费额度都缩到了每月 0.1 美元。
但说实话,"免费"并没有消失,只是变得更隐蔽、更需要你挑。我这两天把国内外主流平台的免费政策重新翻了一遍,发现真正常驻免费、不绑卡的还有十来个,日常写脚本、做原型、跑批处理完全够用。
这篇我把它们按国内直连 / 海外一手 / 聚合路由三类整理清楚,附上额度、限制和可直接跑的代码。
先搞清楚"免费"到底有几种
这是我个人认为最该先建立的一个认知——你看到的"免费",其实是三种完全不同的东西:
| 常驻免费档 | ||
| 一次性赠送额度 | ||
| 绑卡试用 |
我的经验是:只有第一种值得写进你的项目架构里,第二种拿来评测模型还行,第三种我一律不碰——尤其是那些"免费试用需绑定信用卡"的,设个日历提醒都比赌自己记得强。
另外有个坏消息得先说:GitHub Models 已于 2026 年 7 月 30 日正式下线,playground、模型目录和推理 API 全停了。现在网上一堆 2025 年的"免费 API 汇总"还在推荐它,别再去踩了(这个时间点有待你在官方页面复核)。
国内直连:不用折腾网络,中文场景首选
| 智谱 BigModel | ||
| 火山引擎方舟(豆包) | ||
| 百度千帆 | ERNIE-Speed / Lite / Tiny 永久免费 | |
| 腾讯混元 | Hunyuan-Lite 永久免费 | |
| 讯飞星火 | Spark Lite 永久免费 | |
| 硅基流动 SiliconFlow | ||
| 阿里云百炼 | ||
| Kimi(月之暗面) |
我的建议:如果只是跑中文的摘要、分类、抽取、翻译这类轻活,智谱 Flash 档 + 讯飞 Spark Lite + 百度 ERNIE-Speed 三家轮着用,基本不会断供,而且都是永久免费档,不用担心哪天到期。
海外一手:额度更大,但要考虑可达性
| Google AI Studio(Gemini API) | ||
| Cloudflare Workers AI | 10,000 Neurons/天 | |
| Groq | 速度最快 | |
| NVIDIA build(NIM) | ||
| Mistral | ||
| Cohere | 仅限非商业评估 | |
| OpenRouter | :free 后缀的模型,20 RPM / 50 RPD;累计充值满 $10 后提升到 1000 RPD | |
| Hugging Face | ||
| Cerebras |
一句话总结:要性能用 Groq,要上下文和多模态用 Gemini,要模型数量用 NVIDIA build 和 OpenRouter,要边缘部署用 Cloudflare。
把一堆 key 变成一个:聚合路由实战
说实话,注册七八个平台拿七八个 key,管理起来是灾难。我的做法是把它们焊成一个 OpenAI 兼容端点——因为上面这些平台几乎全都兼容 OpenAI 协议,所以改 base_url 就能切。
1. 最简调用:换 base_url 即可
from openai import OpenAIimport osclient = OpenAI( base_url="https://openrouter.ai/api/v1", # 换成任意兼容平台的地址 api_key=os.environ["OPENROUTER_API_KEY"], # 永远从环境变量读,别硬编码)resp = client.chat.completions.create( model="deepseek/deepseek-v4-flash:free", # OpenRouter 上带 :free 后缀 messages=[{"role": "user", "content": "用一句话解释什么是幂等性"}],)print(resp.choices[0].message.content)2. 多 key 自动故障转移(LiteLLM)
某个平台限流了,自动切下一个,这是把一堆小额度凑成"可靠额度"的关键:
from litellm import completionimport os# 同一个逻辑名配置多条通道,LiteLLM 会按顺序重试fallbacks = [ {"model": "openrouter/deepseek/deepseek-v4-flash:free","api_key": os.environ["OPENROUTER_API_KEY"]}, {"model": "groq/openai/gpt-oss-120b","api_key": os.environ["GROQ_API_KEY"]}, {"model": "gemini/gemini-2.5-flash","api_key": os.environ["GEMINI_API_KEY"]},]for target in fallbacks:try: r = completion(model=target["model"], api_key=target["api_key"], messages=[{"role": "user", "content": "你好"}])print(r.choices[0].message.content)breakexcept Exception as e:print(f"{target['model']} 不可用:{e}")3. 自建网关:One-API / New-API
如果你想给团队统一出口,开源网关是更省事的选择:
docker run -d --name new-api -p 3000:3000 calciumion/new-api:latest进去把各家 key 填进去,它就对外暴露一个 OpenAI 兼容地址,自带负载均衡、额度统计和故障转移。团队里每人发一个子 key,谁用了多少一目了然。
这对我们意味着三件事:
免费层的定位是"原型和低频",不是"生产"。想跑线上业务,老老实实付费,别把用户命运押在随时会变的限流策略上。 小模型能力已经够用了。分类、抽取、格式化、简单摘要这些活,7B-30B 的模型做得不比旗舰差,而它们恰好是免费的主力。 多云/多平台会成为默认架构。既然没有哪家能保证永久免费,把调用层抽象出来、随时可切,比押注某一个平台重要得多。这也是我推荐 LiteLLM / New-API 这类中间层的原因。
薅之前先看这四条
先分层再选型:学习和原型全用免费档;一旦要上线,至少准备一个付费通道做兜底。我见过太多 demo 跑得好好的,一上线就被限流打回原形。
Key 管理必须上规矩:
# 放进 .env,并加进 .gitignoreecho".env" >> .gitignoreexport OPENROUTER_API_KEY="sk-or-xxxx"三条铁律:不进代码仓库、不下发到前端、不同项目用不同 key。前端暴露 key 是最常见的泄露方式,几分钟就会被扫走刷爆额度。
读一遍免费层条款,重点看两件事:数据会不会被用于训练、允不允许商业用途。Gemini 免费层明确写了可能用于改进产品,Cohere 直接限制非商业——涉及公司业务数据的,别往免费层送。
警惕第三方"中转站"。2026 年 CISPA 的一份研究指出,接近一半的中转服务存在"偷换模型"行为——你调的是某个旗舰模型,实际返回的可能是别的小模型。加上这类站点跑路风险高,我的建议是:只用厂商官方端点,敏感项目一律不碰中转。(该研究的具体比例和结论我来自二手引用,有待核实。)