7月15日,AI圈发生了两件互为镜像的大事。上午,Ilya Sutskever的Thinking Machines Lab把公司首个基础模型Inkling的完整权重扔上了Hugging Face;几小时后,马斯克旗下的SpaceXAI宣布开源编程智能体Grok Build的全部代码。同一天,一个名不见经传的Agnes AI放出了承诺"不限期免费"的Coding模型。三件事凑在一起,不是巧合,是一个信号:闭源收费的护城河,正在以肉眼可见的速度塌方。

unsetunset三件事,同一天unsetunset
Grok Build 是SpaceXAI的终端原生编程智能体,此前只有闭源客户端。7月15日,官方把完整代码库推上GitHub(xai-org/grok-build),涵盖智能体链路、工具调用、终端UI、扩展系统(Skills / 插件 / hooks / MCP服务器 / 子智能体),全部以Apache 2.0许可发布。这意味着你可以自己编译、指向本地模型、完全离线运行。
Inkling 是Thinking Machines Lab的首个公开基础模型,9750亿总参数、410亿激活参数的多模态MoE,支持文本、图像、音频输入,上下文窗口长达100万token。7月15日完整权重上架Hugging Face,同样Apache 2.0。官方还同步发布了Tinker微调平台。
Agnes-2.5-Flash 来自Agnes AI,7月13日发布。它的SWE-bench成绩逼近Claude Opus 4.8,官方原话是:"我们在进一步提升模型性能的同时,继续坚持Agnes-2.5-Flash不限期免费开放。"

unsetunset先上硬货:三模型核心对比unsetunset
| 975B / 41B | |||
| 1M tokens | |||
数据来源:SpaceXAI官方博客、Thinking Machines Lab模型卡、Agnes AI官方公告。
unsetunsetGrok Build:自己编译一个编程智能体unsetunset
Grok Build最吸引人的不是它的模型能力,而是它的架构透明度。你可以看到智能体如何构建上下文、如何解析模型响应、如何调度工具调用。官方明确说:"开源也让框架更容易探索和扩展。"
如果你不想用Grok模型,完全可以把它指向本地运行的其他模型——比如后面要讲的Inkling量化版,或者Ollama里的任意开源模型。
本地编译运行步骤:
# 1. 克隆仓库
git clone https://github.com/xai-org/grok-build.git
cd grok-build
# 2. 安装依赖(需要 Rust 工具链)
cargo build --release
# 3. 配置本地模型(编辑 config.toml)
# 将默认的云端接口指向你的本地推理端点
# 例如指向 Ollama:
# model_endpoint = "http://localhost:11434/v1"
# model_name = "gpt-oss:20b"
# 4. 运行
./target/release/grok-build
编译完成后,你就拥有一个完全离线的编程智能体。它会读取你的代码仓库、执行命令、生成差异视图,所有数据留在本地硬盘,不会上传到任何云端。对于担心代码隐私的团队,这是目前最干净的方案。
unsetunsetInkling:9750亿参数的"家用超算"梦unsetunset
Inkling的参数规模放在半年前是不可想象的开源体量。9750亿总参数、410亿激活、100万token上下文,这三个数字任何一个单独拿出来,都足以定义一个旗舰闭源模型。现在它们被装在一个Apache 2.0的压缩包里,任何人都能从Hugging Face下载。
当然,诚实地说,BF16精度的全量模型需要约1.8TB显存,这不是个人玩家能碰的。但Thinking Machines Lab同步提供了量化版本,且MoE架构的稀疏特性意味着推理时只激活410亿参数。配合Unsloth等推理加速框架,消费级GPU运行中小规模任务是可行的。
用 Transformers 快速加载量化版:
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "thinkingmachines/inkling"
# 加载 4-bit 量化版本
model = AutoModelForCausalLM.from_pretrained(
model_id,
load_in_4bit=True,
device_map="auto",
trust_remote_code=True
)
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
# 多模态输入示例(文本 + 图像)
inputs = tokenizer(
"描述这张图片中的主要元素",
images=["example.jpg"],
return_tensors="pt"
).to(model.device)
outputs = model.generate(**inputs, max_new_tokens=512)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
Inkling的真正价值在于多模态+超长上下文。你可以扔给它一本几百页的PDF、一段会议录音、几张设计草图,让它跨模态推理并输出结论。1M token的上下文意味着你基本不用再做复杂的RAG切分,直接把原始材料塞进去就行。
unsetunsetAgnes-2.5-Flash:免费替代Claude的Coding模型unsetunset
Claude Opus 4.8的SWE-bench Pro得分是**69.2%**,目前公开模型的天花板。Agnes-2.5-Flash的内部评测显示,它在SWE Atlas等基准上的进步"最为显著",且官方明确将其定位在"全球第一梯队"。
关键区别在于价格:Claude Opus 4.8每月最低20美元,Agnes-2.5-Flash的API是不限期免费。
直接调用示例:
import requests
url = "https://api.agnes-ai.com/v1/chat/completions"
headers = {"Authorization": "Bearer 你的免费API_Key"}
payload = {
"model": "agnes-2.5-flash",
"messages": [
{"role": "system", "content": "你是一个专业的Python工程师。"},
{"role": "user", "content": "写一个带缓存机制的HTTP请求装饰器,要求支持TTL和最大内存限制。"}
],
"stream": False
}
response = requests.post(url, json=payload, headers=headers)
print(response.json()["choices"][0]["message"]["content"])
对于日常开发中的代码补全、重构、Bug修复、单元测试生成,Agnes-2.5-Flash已经足够胜任。如果你的预算有限,或者不想绑定在Claude的订阅体系里,这是一个可以无缝切换的选项。
unsetunset还有一个隐藏福利:Step Plan + 腾讯Hy3unsetunset
如果你不想折腾本地部署,还有两条零成本路径:
阶跃星辰 Step Plan:新用户注册即送15天免费体验,额度用完系统自动再补一次15天,活动持续到7月31日。接入方式很简单——在OpenClaw、Cursor、Trae里选择StepFun provider,填入API Key即可。支持的模型包括step-3-7-flash等旗舰款。
腾讯混元 Hy3:7月6日开源,295B总参、21B激活、256K上下文,已以免费模型身份接入OpenCode Zen(模型ID: hy3-free)。在OpenCode里输入/models切换即可零成本使用。
unsetunset为什么这时候集体开源unsetunset
表面看是各家在抢开发者生态,深层逻辑是信任危机倒逼开放。Grok Build开源的直接导火索,是7月初被安全研究者曝出"上传整个git仓库和未脱敏的.env密钥到Google Cloud存储桶"。SpaceXAI的回应很干脆:既然你不信任我的客户端,我把代码全给你,你自己审。
Thinking Machines Lab选择在这个时间点开源Inkling,则更像是一场理念宣言。Ilya从OpenAI离开创办新公司,核心主张之一就是安全与开放并重。9750亿参数的开源,是对"只有闭源才能保障安全"这一论调的直接反驳。
对于普通开发者来说,这意味着一个久违的买方市场:你不再需要为了用一个好模型而接受某家云厂商的锁定。代码在本地,权重可下载,API有免费 tier——选择权第一次真正回到了用户手里。
unsetunset坑在哪:别急着喊颠覆unsetunset
硬件门槛是最大现实。Inkling全量版的1.8TB显存需求,目前只有数据中心能消化。个人用户要么等量化版本成熟,要么通过云服务按需调用。
Grok Build虽然代码开源,但它本质上是一个框架,推理能力取决于你接的模型。如果你接一个7B的小模型,它的表现不会比一个配置精良的Cursor强多少。
Agnes-2.5-Flash的"不限期免费"听起来美好,但小团队的续费能力始终是个问号。建议不要把它作为生产环境的唯一依赖,而是作为Claude/GPT的低成本备选。
另外,开源不等于无责任。Grok Build的代码里包含了完整的工具调用和命令执行逻辑,本地运行时请务必在沙箱或容器环境里测试,别让AI智能体不小心执行了rm -rf。
当代码和权重都可以免费下载,AI能力的分水岭会从"你有没有钱买API"变成"你有没有能力把它跑起来、调好用"。这对你来说,是更公平了,还是门槛变高了?
如果你身边还有朋友每月花20美元订阅Coding助手,把这篇文章转给他——这15分钟阅读,可能帮他省下一整年的订阅费。
夜雨聆风