乐于分享
好东西不私藏

这周新发现的3个免费AI API

这周新发现的3个免费AI API

这周新发现的3个免费AI API(附限速对比)

上周做一个小项目,需要调API做文本生成和代码补全。翻了一圈发现,7月有好几个平台悄悄更新了免费额度——有的每天100万token白送,有的一个月10亿token不限量,还有一个国内直连14个模型永久免费。

我花了两天实测注册、写代码调用、记录响应速度和限速数据。结果挺有意思:同样的任务,三个API的速度差距能到20倍。

今天把实测结果和限速对比完整分享出来,你按需选择就行。


先说Cerebras:晶圆级推理,每天100万token白送

Cerebras是做AI芯片的美国公司,用的是晶圆级引擎——一块芯片上集成几十万个核心,推理速度比传统GPU快20倍。

听起来很高端对吧?但关键是:它有免费API,每天100万token,不需要信用卡。

7月1日Cerebras更新了rate limit文档,新增了几个模型:

 

gpt-oss-120b

 

120B参数开源大模型 · 5 RPM · 30万 TPM · 每天100万 token

 

zai-glm-4.7

 

GLM-4.7中国版推理接口 · 5 RPM · 30万 TPM · 每天100万 token

 

gemma-4-31b

 

Google最新开源模型 · 15 RPM · 30万 TPM · 每天100万 token

实测速度:2000+ tokens/秒。 一个300字的回复,从发出请求到收到完整结果,不到0.2秒。

 

注册步骤

 

1. 打开 cloud.cerebras.ai

 

2. 邮箱注册(不需要信用卡)

 

3. 进入Dashboard → "Create API Key"

 

4. 复制key,OpenAI兼容格式调用

 
from openai import OpenAI

client = OpenAI(
    api_key="你的Cerebras API Key",
    base_url="https://api.cerebras.ai/v1"
)

response = client.chat.completions.create(
    model="gpt-oss-120b",
    messages=[{"role": "user", "content": "用Python写一个快速排序"}]
)
print(response.choices[0].message.content)

用下来感受:

 

好的地方

 

- 速度是真的快,写代码的体验像本地模型

 

- 100万token/天大约能生成500次对话

 

- API格式完全兼容OpenAI,迁移零成本

 

不太好的地方

 

- 大模型只5 RPM,高并发场景不够用

 

- 需要代理访问(中国大陆无法直连)

 

- 模型选择较少,只有3个

适合:需要极速响应的代码生成、单次长文生成、Agent工作流中的快速推理步骤。


再说Mistral:每月10亿token,含编程专用模型

Mistral是法国AI公司,模型质量在欧洲排第一。今年他们的免费tier直接拉满——每月10亿token,所有模型都能调,包括编程专用的Codestral。

10亿token是什么概念?大约能生成3万次完整对话,或者跑5万次代码补全。对个人开发者来说,基本等于无限用。

 

Mistral Large

 

通用对话 · Mistral最强模型,推理能力接近Claude

 

Codestral

 

编程专用 · 代码生成和补全,支持80+编程语言

 

Mistral Small

 

轻量对话 · 速度更快,适合日常任务

 

Pixtral 12B

 

多模态 · 支持图片+文字输入

 

Mistral Embed + OCR

 

向量检索 + 图片文字识别 · RAG系统搭建利器

 

限速数据

                                                               
RPM2(每分钟2个请求)
TPM50万/分钟
月上限约10亿token

2 RPM听起来很紧,但实际用下来发现:大多数场景你不需要高频调用。写一篇2000字的文章,一次请求就够了。

 

注册步骤

 

1. 打开 console.mistral.ai

 

2. 邮箱注册(不需要信用卡)

 

3. 创建API Key

 

4. OpenAI兼容格式调用

 
from openai import OpenAI

client = OpenAI(
    api_key="你的Mistral API Key",
    base_url="https://api.mistral.ai/v1"
)

# 编程补全
response = client.chat.completions.create(
    model="codestral-latest",
    messages=[{"role": "user", "content": "写一个React登录组件"}]
)

# 通用对话
response = client.chat.completions.create(
    model="mistral-large-latest",
    messages=[{"role": "user", "content": "分析一下2026年中国AI市场趋势"}]
)

用下来感受:

 

好的地方

 

- Codestral编程质量极高,代码补全准确率接近Claude

 

- 模型种类齐全,从对话到编程一站式搞定

 

- 欧洲数据合规标准,隐私安全性高

 

- 还提供免费聊天界面 Le Chat

 

不太好的地方

 

- 2 RPM限速是硬伤,批量任务需要排队

 

- 中国大陆需要代理访问

 

- 大模型响应速度中等(约15-20 tokens/秒)

适合:代码补全和编程辅助(Codestral)、长文写作(Mistral Large)、RAG系统搭建。


最后说硅基流动:14个模型永久免费,国内直连

硅基流动是国内AI推理平台,主打开源模型托管。最狠的一点:14个模型永久免费,不限量,中国大陆直连。

不需要代理、不需要信用卡、手机号注册就行。这是三家里面唯一一个国内开发者零门槛就能用的。

 

DeepSeek V3.2 · 671B

 

通用对话 · 国产最强开源模型之一 · 注册赠送额度

 

Qwen 3.5 72B

 

中文对话 · 阿里最新开源,中文一流 · 注册赠送额度

 

Qwen 2.5 7B

 

轻量任务 · 永久免费不限量

 

DeepSeek R1

 

推理思考 · 类o1推理链 · 注册赠送额度

 

GLM-4 · Llama 3.3 70B · Pixtral 等

 

共14个模型 · 涵盖对话、编程、多模态、嵌入

 

限速数据

                                                               
永久免费模型不限量调用,约10-20 RPM
注册赠送模型2000-3000万token,永久有效
赠送模型限速约5-10 RPM
 

注册步骤

 

1. 打开 siliconflow.cn

 

2. 手机号注册

 

3. 完成实名认证(身份证)

 

4. 创建API Key

 

5. OpenAI兼容格式调用

 
from openai import OpenAI

client = OpenAI(
    api_key="你的硅基流动 API Key",
    base_url="https://api.siliconflow.cn/v1"
)

# 调用DeepSeek V3.2
response = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-V3",
    messages=[{"role": "user", "content": "帮我写一个Python爬虫"}]
)

用下来感受:

 

好的地方

 

- 国内直连,延迟极低(50ms以内)

 

- 注册送2000万token+永久免费模型,性价比无敌

 

- 模型覆盖面广,国产和国际开源都有

 

- API格式完全兼容OpenAI

 

不太好的地方

 

- 需要实名认证(身份证)

 

- 免费模型多为轻量版(7B),重度任务需赠送额度

 

- 赠送额度用完后,大模型需要付费

适合:日常中文对话、轻量代码生成、文本分类/提取等批量任务、国内项目的默认API。


三家限速对比

这才是你最关心的。我统一用"生成300字中文短文"这个任务做对比测试:

 

Cerebras

                                                                                                                                               
日免费额度100万/天
RPM限速5-15
响应速度2000+ tok/s
300字耗时0.15秒 ⚡
大陆直连需代理
门槛邮箱注册,无需信用卡
最擅长极速响应
 

Mistral

                                                                                                                                               
日免费额度3300万/天
RPM限速2
响应速度15-20 tok/s
300字耗时约20秒
大陆直连需代理
门槛邮箱注册,无需信用卡
最擅长编程/RAG
 

硅基流动

                                                                                                                                               
日免费额度永久免费 🔥
RPM限速10-20
响应速度30-50 tok/s
300字耗时约6秒
大陆直连直连 ✅
门槛手机号+身份证实名
最擅长日常中文

有意思的是:

 

- 速度差距20倍:Cerebras生成300字只要0.15秒,Mistral要20秒

 

- 额度差距30倍:Mistral每月10亿token vs Cerebras每天100万

 

- 门槛差距:硅基流动国内直连零门槛,其他两家需要代理


我日常怎么搭配的

别只选一个,三家各有所长,组合使用才是最优解。

 

日常中文任务(80%的使用场景)

 

→ 硅基流动 Qwen 2.5 7B

 

永久免费不限量,国内直连

 

编程和代码补全

 

→ Mistral Codestral

 

每月10亿token,编程专用模型

 

需要极速响应的场景

 

→ Cerebras gpt-oss-120b

 

2000+ tok/s,Agent工作流首选

成本:0元。

三家加起来,你每天至少有100万+3300万+不限量的token额度。对个人开发者来说,超过任何付费方案能给的量了。


几个要注意的事

 

1. Cerebras的5 RPM是硬限制——批量任务要加延时

 

2. Mistral的2 RPM更严格——循环调用务必加sleep(30)以上

 

3. 硅基流动实名认证是必须的——没认证就不能用

 

4. 免费额度政策随时可能变——注册后尽快用,不要囤着

 

5. 代理稳定性影响体验——代理不稳的话Cerebras和Mistral会频繁超时


你最想试哪个?速度最快的Cerebras,编程最强的Mistral,还是零门槛的硅基流动?

评论区说说你的场景,我帮你选最合适的。


 

本文数据基于2026年7月实测。各平台免费政策可能随时调整,请以官方最新公告为准。

 

如果你觉得有用,转发给同样在白嫖AI API的朋友。