夜雨聆风学习资料网

ARTICLE · 1050522

琐思录0921-教AI说话的人,现在让它闭嘴了

琐思录0921-教AI说话的人,现在让它闭嘴了
所有人都在比谁更能说,有人开始比谁更能不说
1.
这两天开发者圈又出现了个有趣的东西。
一个叫Jev的新模型,X和Hacker News上全是讨论。火的方式挺抽象——聊天不会、代码不写,你给它A、B、C三个选项,它选一个,还附带概率。
JEev把传统大模型最引以为傲的“生成”功能给砍了,只专心干一件事,下判断。
更狠的是定价。输入每百万token只要0.042美元,输出token永久免费。官方的说法是“太便宜了,不好计量”。
各家的Flash模型看到这个定价,估计连夜在改财报模型。
2.
开发者叫Diogo Almeida,OpenAI前研究员,RLHF和InstructGPT的共同发明人。ChatGPT能“好好说话”,这套人类反馈强化学习的底层方法,有他一份功劳。
换句话说,他亲手教了AI小半辈子怎么跟人对话,怎么说人话,怎么说人爱听的话。
然后他出走创办了TypeSafe AI,推出的第一个产品Jev,核心思路就四个字,AI闭嘴。
教了AI半辈子怎么说话,最后发现最值钱的是让它别说话。这剧情,比任何创业故事都有张力。
3.
Jev官方给自己的定位是第一个“System One Model"。
这个概念来自卡尼曼的快慢系统理论:系统1是高速直觉式决策,秒出答案,不怎么费脑子;系统2是慢速长文本推理,要一步步想,费算力费时间。
现在所有大模型都在卷系统2——推理链越长越好,思考步骤越多越值钱,一个问题写三千字思考过程那是标配。
Jev反其道而行之,返璞归真做系统1。你给它非结构化的状态和一组限定回答类型的问题,它直接输出决策结果和概率,交给代码接着跑。
官方给了三个基础能力:Choice(从候选项里做选择)、Score(按标准打分)、Noul(给出某个判断成立的概率)。
这似乎是一个带概率的语义逻辑门。
4.
传统大模型不也能做分类吗?
能,但区别在于答案是怎么产出来的。
传统生成式模型哪怕最后只需要输出一个A,它也得先逐token写一堆解释,再把答案说出来。这就像你去餐厅点个菜,厨师非要先给你讲一遍这道菜的历史渊源、食材产地、烹饪哲学,最后才把菜端上来。
Jev直接跳过讲故事这一步,并行处理多个独立问题,省掉了把答案逐字”写出来“的过程。
效果是炸裂的,端到端响应时间70到500毫秒,官方实测数据,速度最快193.6倍,价格最便宜444.6倍。
5.
光有快和便宜还不够,工业界最关心的是,判断到底靠不靠谱?
Jev的训练方法叫RLCD,用于校准决策的强化学习。
对照一下就明白了,RLHF是根据人类偏好奖励人更爱听的回答,RLVR是根据可验证结果奖励正确的答案。RLCD则把优化重点放在决策及其概率上,不仅要判断得准,还要准确表达自己有多大把握。
所谓校准决策,说白了就是让模型输出的概率值匹配真实发生的频率。标为0.2概率的结果,真实发生比例就约等于20%;标为1的,几乎一定会发生。
这一步看似不起眼,其实是工业落地的命门。
没有校准,模型输出的置信度数字就是摆设,它说99%确信,实际可能只有60%,你敢用它做自动化决策吗?
Jev把知道自己不知道这件事,做成了可计量的产品特性。
6.
官方宣传Jev是零幻觉,这个说法得打个折扣。
它保证的是模式匹配层面的零幻觉——你给它A、B、C三个选项,它绝不会自作主张编出一个D输出。但正确答案明明是A,它照样可能选成B。
所以准确的说法是,类型正确,事实不一定正确。
但这已经足够解决一大类问题了。
在软件自动化流程里,最头疼的不是模型选错,而是模型编造,输出格式不对、字段缺失、凭空捏造不存在的选项,导致下游代码直接崩掉。
Jev把输出空间锁死在定义的schema里,从根上杜绝了编造的可能。至于选得对不对,那是准确率问题,可以靠模型迭代和人工兜底解决;但“编不编”是架构问题,Jev在架构层面就给焊死了。
对于工程师来说,一个偶尔犯错但从不越界的模型,远比一个经常越界同时经常惊艳的模型好用得多。
7.
Jev发布36小时,14万开发者注册。大家用它干什么?
第一类是接管软件里的高频判断。Vercel工程师拿它测了安全分类器,比原来用的GPT-5.6 Luna快5到18倍,准确性还更高。Bryo AI技术总监拿它做商业邮件分类,准确率略输Gemini,但价格是Gemini的十分之一到二十分之一,性价比直接碾压。
第二类是给大模型当验收员。有人把Jev接进Agent框架,在Agent宣称任务完成后再检查一遍,防止模型越狱或谎报进度。验证成本足够低,目标结果可信度高,相当于系统1和系统2打配合,系统2负责干活,系统1负责查岗。
第三类是模型路由。先让Jev判断请求难度,简单任务交给快模型,难题再请昂贵的推理模型出马。有开发者做了个下棋测试挺有意思:Jev每步0.3秒、不到0.0001美元,GLM 5.3每步5.8秒、约0.008美元,最后却是GLM在29步内将死对手。
下得快,未必想得深。但大多数场景,不需要每一步都想29步那么深。
8.
Jev火了之后,开源版紧跟着就来了,Nimble。
基于Qwen3.5-9B做LoRA微调,模型适配器以Apache 2.0许可发布,训练数据和方法一并开源。Jev还只能通过API访问,Nimble已经能装进本地跑。
训练思路有点像让AI找不同,构造两份几乎一模一样的材料,只改一个关键事实,答案正确与否随之翻转。想答对,模型必须抓住真正影响判断的核心信息。
效果上,基础Qwen3.5-9B与参考标签的一致率是66.36%,Nimble提升到90.12%,Jev是93.21%。开源版稍逊,但已经能用了。
从闭源爆火到开源跟进,前后不到一周。这条赛道的热度,可见一斑。
9.
Jev这个名字,出自Jevons悖论。
这个悖论说的是,当某种资源的使用效率大幅提升、单位成本暴跌时,人们不会因此减少使用,反而会因为太便宜而大量增加使用量,总消耗不降反升。
Diogo Almeida用这个名字给自己的模型命名,野心写在脸上。他赌的是,当AI判断的成本降到接近零,整个软件行业对AI判断的使用量会爆炸式增长。
今天的前沿实验室都在卷一个公式:更多钱=更多算力=更智能=更值钱。模型越来越大,价格越来越贵,推理越来越慢,仿佛AI的价值就体现贵和慢上。
Jev从另一个方向撕开了口子,AI的价值不一定体现在能说多少,还体现在能判断多快、多准、多便宜。当系统1的判断变成基础设施,系统2的推理才真正有了用武之地。因为不再需要用昂贵的推理模型去做那些几毫秒就能搞定的判断。
当判断的成本趋近于零,判断本身就从奢侈品变成了基础设施。
教AI说话的人,最后让AI闭上了嘴。这不是退步,这是回到了AI最该待的位置,不是陪聊的玩具,是干活的工具。
(本文基于2026年9月15日TypeSafe AI发布的Jev模型及公开资料整理,观点仅供参考)

相关学习资料