夜雨聆风学习资料网

ARTICLE · 1159187

AI工具都在收费了?这些大模型API现在还能免费用

AI工具都在收费了?这些大模型API现在还能免费用

不知道你有没有这种感觉:去年还能随便白嫖的 AI 接口,今年一个个都开始要钱了。GitHub Models 直接下线,Cerebras 开始绑卡,OpenAI 和 Anthropic 从头到尾就没给过免费 API 档,连 Hugging Face 的免费额度都缩到了每月 0.1 美元。

但说实话,"免费"并没有消失,只是变得更隐蔽、更需要你挑。我这两天把国内外主流平台的免费政策重新翻了一遍,发现真正常驻免费、不绑卡的还有十来个,日常写脚本、做原型、跑批处理完全够用。

这篇我把它们按国内直连 / 海外一手 / 聚合路由三类整理清楚,附上额度、限制和可直接跑的代码。

先搞清楚"免费"到底有几种

这是我个人认为最该先建立的一个认知——你看到的"免费",其实是三种完全不同的东西:

类型
特征
值不值得用
常驻免费档
(standing free tier)
按 RPM/TPM/每日请求数限流,永久有效、不绑卡
✅ 真正的免费,本文重点
一次性赠送额度
注册送 XXX 万 tokens 或几美元,用完即止
⚠️ 试完好就走,别当长期方案
绑卡试用
免费 30 天,到期自动扣费
❌ 忘了解绑就是真扣钱

我的经验是:只有第一种值得写进你的项目架构里,第二种拿来评测模型还行,第三种我一律不碰——尤其是那些"免费试用需绑定信用卡"的,设个日历提醒都比赌自己记得强。

另外有个坏消息得先说:GitHub Models 已于 2026 年 7 月 30 日正式下线,playground、模型目录和推理 API 全停了。现在网上一堆 2025 年的"免费 API 汇总"还在推荐它,别再去踩了(这个时间点有待你在官方页面复核)。

国内直连:不用折腾网络,中文场景首选

平台
免费额度
限制与提醒
智谱 BigModel
GLM 系列 Flash 档永久免费(如 GLM-4-Flash / GLM-4.7-Flash),新用户另赠约 2000 万 tokens
国内目前最稳的免费通道,支持函数调用;免费模型清单会变,以控制台为准
火山引擎方舟(豆包)
日均约 200 万 tokens 自动刷新,单模型另送 50 万
⚠️ 必须在控制台手动开通模型才有额度,不开通调不通
百度千帆ERNIE-Speed / Lite / Tiny 永久免费
新用户需实名认证
腾讯混元Hunyuan-Lite 永久免费
;首次开通赠约 100 万 tokens(有效期 1 年)
微信/腾讯云生态接入方便
讯飞星火Spark Lite 永久免费
走 WebSocket,合规性好
硅基流动 SiliconFlow
新用户约 2000 万 tokens;部分小模型 / embedding / 语音 / OCR 免费
⚠️ 有资料称"对话类小模型免费已取消"——这条我两个来源对不上,请以官方模型页为准
阿里云百炼
单模型最高约 100 万 tokens(90 天有效)
⚠️ 有资料称仅新加坡地域提供免费额度,需核实
Kimi(月之暗面)
网页/App 免费,长上下文强;API 侧新用户赠代金券
API 本身按量计费

我的建议:如果只是跑中文的摘要、分类、抽取、翻译这类轻活,智谱 Flash 档 + 讯飞 Spark Lite + 百度 ERNIE-Speed 三家轮着用,基本不会断供,而且都是永久免费档,不用担心哪天到期。

海外一手:额度更大,但要考虑可达性

平台
免费额度
特点
Google AI Studio(Gemini API)
Flash 系列免费,约 15 RPM / 1500 RPD / 1M TPM,1M 上下文,免绑卡
综合能力最强的免费档,原生多模态;⚠️ 免费层数据可能用于改进产品
Cloudflare Workers AI10,000 Neurons/天
,免绑卡
边缘推理,延迟极低,适合配合 Workers 部署
Groq
约 30 RPM / 1000 RPD / 200K tokens 每天(按模型)
速度最快
,LPU 硬件,做流式对话体验最好
NVIDIA build(NIM)
开发用途免费推理,约 40 RPM,开源模型多
需开发者账号,部分场景要手机验证
Mistral
Free / Experiment 档,免绑卡
有欧洲数据合规需求的场景
Cohere
Trial key 约 1000 次/月
仅限非商业评估
OpenRouter
约 20 个带 :free 后缀的模型,20 RPM / 50 RPD;累计充值满 $10 后提升到 1000 RPD
一个 key 打天下,免费模型轮换频繁
Hugging Face
免费账户约 $0.10/月 credit
额度很小,聊胜于无
Cerebras
$5 试用额度,30 天过期
⚠️ 现已要求绑定支付方式,不再是免卡档

一句话总结:要性能用 Groq,要上下文和多模态用 Gemini,要模型数量用 NVIDIA build 和 OpenRouter,要边缘部署用 Cloudflare。

把一堆 key 变成一个:聚合路由实战

说实话,注册七八个平台拿七八个 key,管理起来是灾难。我的做法是把它们焊成一个 OpenAI 兼容端点——因为上面这些平台几乎全都兼容 OpenAI 协议,所以改 base_url 就能切。

1. 最简调用:换 base_url 即可

from openai import OpenAIimport osclient = OpenAI(    base_url="https://openrouter.ai/api/v1",   # 换成任意兼容平台的地址    api_key=os.environ["OPENROUTER_API_KEY"],  # 永远从环境变量读,别硬编码)resp = client.chat.completions.create(    model="deepseek/deepseek-v4-flash:free",   # OpenRouter 上带 :free 后缀    messages=[{"role": "user", "content": "用一句话解释什么是幂等性"}],)print(resp.choices[0].message.content)

2. 多 key 自动故障转移(LiteLLM)

某个平台限流了,自动切下一个,这是把一堆小额度凑成"可靠额度"的关键:

from litellm import completionimport os# 同一个逻辑名配置多条通道,LiteLLM 会按顺序重试fallbacks = [    {"model": "openrouter/deepseek/deepseek-v4-flash:free","api_key": os.environ["OPENROUTER_API_KEY"]},    {"model": "groq/openai/gpt-oss-120b","api_key": os.environ["GROQ_API_KEY"]},    {"model": "gemini/gemini-2.5-flash","api_key": os.environ["GEMINI_API_KEY"]},]for target in fallbacks:try:        r = completion(model=target["model"],                       api_key=target["api_key"],                       messages=[{"role": "user", "content": "你好"}])print(r.choices[0].message.content)breakexcept Exception as e:print(f"{target['model']} 不可用:{e}")

3. 自建网关:One-API / New-API

如果你想给团队统一出口,开源网关是更省事的选择:

docker run -d --name new-api -p 3000:3000 calciumion/new-api:latest

进去把各家 key 填进去,它就对外暴露一个 OpenAI 兼容地址,自带负载均衡、额度统计和故障转移。团队里每人发一个子 key,谁用了多少一目了然。

这对我们意味着三件事:

  1. 免费层的定位是"原型和低频",不是"生产"。想跑线上业务,老老实实付费,别把用户命运押在随时会变的限流策略上。
  2. 小模型能力已经够用了。分类、抽取、格式化、简单摘要这些活,7B-30B 的模型做得不比旗舰差,而它们恰好是免费的主力。
  3. 多云/多平台会成为默认架构。既然没有哪家能保证永久免费,把调用层抽象出来、随时可切,比押注某一个平台重要得多。这也是我推荐 LiteLLM / New-API 这类中间层的原因。

薅之前先看这四条

  1. 先分层再选型:学习和原型全用免费档;一旦要上线,至少准备一个付费通道做兜底。我见过太多 demo 跑得好好的,一上线就被限流打回原形。

  2. Key 管理必须上规矩:

    # 放进 .env,并加进 .gitignoreecho".env" >> .gitignoreexport OPENROUTER_API_KEY="sk-or-xxxx"

    三条铁律:不进代码仓库、不下发到前端、不同项目用不同 key。前端暴露 key 是最常见的泄露方式,几分钟就会被扫走刷爆额度。

  3. 读一遍免费层条款,重点看两件事:数据会不会被用于训练、允不允许商业用途。Gemini 免费层明确写了可能用于改进产品,Cohere 直接限制非商业——涉及公司业务数据的,别往免费层送。

  4. 警惕第三方"中转站"。2026 年 CISPA 的一份研究指出,接近一半的中转服务存在"偷换模型"行为——你调的是某个旗舰模型,实际返回的可能是别的小模型。加上这类站点跑路风险高,我的建议是:只用厂商官方端点,敏感项目一律不碰中转。(该研究的具体比例和结论我来自二手引用,有待核实。)

相关学习资料