夜雨聆风学习资料网

ARTICLE · 1095992

AI工具速递 | 9月29日:0.8B 小模型 22 毫秒做一次零样本决策

AI工具速递 | 9月29日:0.8B 小模型 22 毫秒做一次零样本决策

今天精选 4 个值得关注的 AI 开发工具,最推荐 jeff——0.8B 决策模型单次前向 22ms 出校准概率,分类基准追平大模型,全程本地硬件训练。另有 3 个项目速览。

🔥 本周精选

jeff — 0.8B 零样本决策模型,22ms 出概率

🔥 HN 首页 171 赞,1 天 187 星 | ⭐ 187 / MIT | 上手:低

当你要给客服工单路由、用户意图分类、内容审核打标,又不想为每个任务调用大模型 API 的时候,jeff 把这件事压缩成一次前向传播:你用自然语言描述场景和选项,它直接返回每个选项的校准概率,不生成文本、不用解析。

核心能力拆解:三类问题——choice(最多 255 个选项选一)、noul(是非题给概率)、score(按你描述的标尺打分);多个问题可以合并在一次请求里回答。RTX PRO 6000 上每次决策 22ms,M4 Max(MLX)28ms,权重仅 1.7GB。在 5 个公开基准 4599 题上,Jeff-Qwen3.5-0.8B 总体 79.1%、2B 版 83.1%,对比 Jev 公布的 83.0%——分类和 grounding 类任务追平甚至反超,推理密集任务(BBH、JudgeBench)则明确承认不如大模型。

差异化在于训练完全本地化:一张工作站 GPU 2 小时训完 0.8B,合成数据由开源模型生成;作者自己的语音导航微调把 held-out 准确率从 31.7% 拉到 95.8%,全程不到半小时。它还给出诚实的边界——游戏零样本测试里 0.8B 能打平手写规则 bot,2B 版本反而翻车。

适合谁: 需要在代码里嵌入快速分类/路由判断的开发者;需要复杂推理链的场景不要指望它。

评价: 值得上手

来源:https://github.com/firelex/jeff

ClaudeSonnet5.5— Terminal-Bench 从 10% 跳到 70%

🔥 HN 首页 517 赞,Anthropic 官方发布 | ⭐ $2/$10 每百万 token | 上手:低

当你觉得 Sonnet 5 在 agentic coding 上力不从心、Opus 5.5 又太贵的时候,Sonnet 5.5 正好卡在这个空档:Terminal-Bench 4.0 得分 70.6%,而 Sonnet 5 只有 10.3%;CursorBench 上最好成绩距离 Opus 5.5 仅约 2 分。

核心能力拆解:输出速度快 30%+,单任务成本最多省 30%(定价与 Sonnet 5 相同,但完成任务所需 token 大幅减少);FrontierCode High effort 比 Sonnet 5 同档高 10 分,成本仅为其 1/15;它是首个仅凭截图通关 Pokémon Red 的 Sonnet 模型,长程任务和图像理解都有明显进步。

差异化:在 Low/Medium effort 下,Sonnet 5.5 以约 1/10 的单任务成本超过 Sonnet 5 的最好成绩,和 Opus 5.5 形成"快而省 vs 深而稳"的互补。官方明确说 Opus 5.5 在需要持续判断的开放任务上仍明显更强,选哪个取决于任务形态。

适合谁: 日常编码、修 bug、文档/幻灯片生成等任务明确的开发者;复杂开放任务仍建议 Opus 5.5。

评价: 值得上手

来源:https://www.anthropic.com/claude-sonnet-5-5

Cloudflare cf — 给 Agent 用的全量 API CLI

🔥 HN 首页 102 赞,Cloudflare 官方开源 | ⭐ 覆盖 3000+ API 操作 | 上手:低

当你的 Agent 用 Wrangler 只能调 280 个命令、想买个域名或配置 WAF 就得绕路的时候,cf 把整个 Cloudflare API(3000+ 操作)都暴露成了 CLI 命令。官方数据显示 Wrangler 的 Agent 使用占比已从个位数涨到 48%,这个工具就是为此而生。

核心能力拆解:所有命令由 OpenAPI schema 经内部生成管线 Forge(同步开源)自动生成,术语统一;JSON 为默认输出,人类看排版、Agent 看压缩版以省上下文;引入 cloudflare.config.ts 作为全产品统一配置格式,TypeScript 类型安全直通 LSP;内置面向 Agent 的命令搜索与引导,Agent 不需要预先"见过"这个 CLI。

差异化:Cloudflare 明确判断"改 Wrangler 等于对抗模型的已学行为",所以宁可另起炉灶;随附的 AGENTS.md 注入让 Agent 开箱即用。Vite 成为默认本地开发服务器。

适合谁: 用 Agent 做 Cloudflare 部署/运维的开发者;纯手动运维 Wrangler 老用户可观望。

评价: 值得上手

来源:https://blog.cloudflare.com/cloudflare-cf-cli-launch/

seiso — AI 生成文档的 Markdown 约定与 Linter

🔥 2 天 115 星 | ⭐ 115 / MIT | 上手:低

当 AI 写文档的速度远超人类 review 速度、而过期的版本号和复制了三份只改了一份的字段列表会同时误导人类和 Agent 的时候,seiso 做的事情相当于 rustfmt 之于 Rust——为仓库里的 Markdown 定一套共享约定,并用 linter 强制执行。

核心能力拆解:每个文档必须声明一种 kind(howto / reference / adr 等),只装该 kind 该装的内容;每条事实只能有一个归属页面,其他页面链接而非复述;长命页面禁止记录易变值(版本号、部署状态);指针必须指向具体文件或符号。seiso init 生成配置,seiso check 跑稳定规则,诊断信息写清问题和修法,Agent 可以据此自动修复大部分发现。

差异化:稳定规则和 preview 规则严格分离,preview 默认不进 CI gate;它明确不猜"文字是否像机器写的",把格式和拼写留给其他工具。cargo / pipx / npm 三种安装方式,预编译覆盖 mac/Linux/Windows。

适合谁: 文档由 AI 大量生成、又被 Agent 当上下文读的团队;文档量小的个人项目收益有限。

评价: 值得上手

来源:https://github.com/scarletkc/seiso

⚡ 速览

• Naive-N0.5-Flash — 309B MoE(15.5B 激活)开源权重,原生 1M 上下文无全注意力层,Ultrafast 模式 2000 token/s → https://github.com/NaiveAI-Labs/Naive-N0.5-Flash

• system-design-trainer — 带实时容量模型的系统设计面试练习白板,1 天 92 星 → https://github.com/santtiago49/system-design-trainer

• MicroLLM Lab — 浏览器里直接试跑 7 个微型 LLM → https://stateofutopia.com/experiments/microllmlab/


💡 今日技巧

给 Agent 接 jeff 这类决策模型时,把分类标签写成完整短句而不是单个词——"Refunds and payments" 比 "refund" 的校准效果明显更好;多个独立判断(路由 + 情绪)合并到一次请求,延迟不变。


以上就是今天的 AI 工具速递。jeff 和 seiso 你最想先试哪个?评论区聊聊。如果觉得有用,欢迎转发给身边的开发者朋友。

📚 参考来源

1. jeff

https://github.com/firelex/jeff

2. Claude Sonnet 5.5

https://www.anthropic.com/claude-sonnet-5-5

3. Cloudflare cf

https://blog.cloudflare.com/cloudflare-cf-cli-launch/

4. seiso

https://github.com/scarletkc/seiso

5. Naive-N0.5-Flash

https://github.com/NaiveAI-Labs/Naive-N0.5-Flash

6. system-design-trainer

https://github.com/santtiago49/system-design-trainer

7. MicroLLM Lab

https://stateofutopia.com/experiments/microllmlab/

相关学习资料