ARTICLE · 1060447
我们把"开源版 Jev"装进了自己的电脑:不要钱、快 4 倍,然后被它的准确率整不会了
上篇实测了云端决策模型 Jev(判断题全对、批量 12 倍效率),评论区最多的问题是:"有没有开源平替?不想把数据传出去。"
这篇,我们找到了——而且在你我这种普通笔记本上就能跑。先说结论:免费、离线、快 4 倍,但准确率把我们整不会了。
一、Laya 是什么?
9月初,GitHub上三天涨了四千星的一个项目:Laya,自称"Jev 的开源平替"。
它和 Jev 一样,是System 1 决策模型——不聊天、不写文章,输入一段文本加几个带标准的问题,吐出带置信度的结构化判断:真/假(noul)、多选(choice)、打分(score)。
关键参数:
🧠 只有 421M 参数(对比:LLaMA-7B 的 1/16) 📦 权重 2.5GB,基于 ModernBERT/mmBERT 双向编码器 ⚖️ Apache 2.0,可自由商用 🌍 内置 100+ 语言路由 💻 官方声称:普通 GPU 上 33ms/题,支持纯 CPU 推理
宣传都是虚的,我们直接把它装进了一台再普通不过的笔记本:i7-10750H + 32GB 内存 + 一张带不动新驱动的老显卡(Quadro P620 4GB,最后纯 CPU 跑)。pip install laya,权重走国内镜像,10 分钟搞定。
二、先给个甜头:冒烟测试 5/5 全对
上手先来 5 道题,中英文混合:
中英文通吃,置信度敢给,单题150-200ms——只有 Jev API(实测 ~920ms,含网络)的四分之一,而且完全离线,数据不出本机,零成本。
到这里我们差点就想喊"Jev 可以卸载了"。
然后我们把它拉上了和 Jev 同一套考卷。
三、同卷考试:差距在这一段
用上篇那套 60 多道带标准答案的基准题,原题原判分规则,再考 Laya 一次:
事实判断 50%,等于抛硬币;语言识别 17%,比瞎蒙(25%)还低。
我们第一反应是"提示词写错了",于是做了个对照实验:给判断题补上明确的判定标准(criteria)再考一次——还是 50%,纹丝不动。
这不是用法问题,是官方 README 里那句被大多数人忽略的小字的实话:
基础 checkpoint 零样本能力接近随机,请把它视为"a fast base to specialise"(一个需要专门化的快速底座)。
翻译一下:Laya 是个半成品底座,不微调就想开箱即用,只有"给了明确判断标准的分类任务"能打——我们实测里唯一满分的就是这种(紧急度判断,criteria 写得清清楚楚)。
四、速度的另一面:两个"魔法"没了
Jev 有两个反直觉的速度特性,Laya 全都没继承:
1️⃣ 批量魔法消失Jev:13 个问题塞一次调用,单题成本降到 73ms(12 倍效率)。Laya:13 题合一次,反而涨到247ms/题,比单题还贵。批量越多越亏。
2️⃣ 长度无感消失Jev:输入从 20 token 到 2600 token,延迟几乎不变。Laya:短文 219ms → 长文3369ms,涨了 15 倍。
不过公平地说,纯单题延迟 Laya 完胜:150-250ms vs 900ms,而且是本机到本机,没有网络抖动。
3️⃣ 唯一保留的品质:稳定同一问题重复 10 次,方差 0.0,模糊案例也零翻转。这一点上,本地小模型和云端旗舰出奇一致。
五、所以,选谁?
一句话:Laya 不是"免费的 Jev",是"免费的底座"。它把门槛从"每月 $42/十亿 token"降到了"零",但把成本转移到了你的微调数据上。天下没有免费的午餐,只有换了形态的账单。
有意思的是,这两家恰好演示了开源与闭源的经典分工:闭源卖"开箱即用的效果",开源卖"自己动手的自由"。你选哪个,取决于你的数据能不能出门、以及你有没有标注团队。
六、工具包照旧白送
这次的对比测试脚本 + 上篇的 Jev 基准系统,打包好了:
评论区留下"666",或公众号后台私信"666",整套工具(含 Laya 本地测试脚本、Jev 云端基准、全部测试场景)一一发你。
拿到后三条命令就能在你自己电脑上复刻全部数据,顺便看看 Laya 在你的业务数据上是神是鬼——说不定你的场景恰好是它 100% 的甜区呢。
上篇:《实测 Jev:这个号称"比 LLM 快 200 倍、零幻觉"的 AI,我们花 1.5 厘钱把它测穿了》
觉得这种"用自己电脑跑数据说话"的实测有用,点赞、在看、转发三连,是我们继续折腾的最大动力。
数据截至 2026 年 9 月。Jev 版本 jev-1.13.0;Laya 版本 0.3.5(multilingual checkpoint,CPU 推理,i7-10750H)。所有数字来自独立实测,与两家官方均无利益关联。