夜雨聆风学习资料网

ARTICLE · 1133465

让 AI 做判断题,这个新工具便宜到离谱

让 AI 做判断题,这个新工具便宜到离谱

上周帮朋友改一个小系统,要 AI 帮忙判断用户留言是"投诉"还是"咨询"。用的正是眼下最火的聊天大模型。判断本身没错,但它每次都顺带写一大段分析,格式每次还不一样,有时还会临时发挥加个表情。为了拿到那一个词,后面得再挂一坨解析代码,慢,费钱,还偶尔抽风。

这个痛点太普遍了,普遍到 10 月 1 日这一天,三家大公司同时给出了解法。

Cloudflare、Perplexity、AWS Strands Labs,同一天各自发布了一个新物种:决策模型。它不写文章,不聊天。你把情况发给它,问一个格式明确的问题——是还是否、几个选项选哪个、给个 1 到 10 的分——它直接返回答案,每个选项后面还带一个置信度概率。没有自由发挥的文本可解析,格式永远不会飘。

价格低得离谱,因为输出免费:

· Perplexity 的 pplx-decider-v1-27b:每百万 token 输入 4 美分,输出 0。开源,Apache 2.0。
· Cloudflare 的 Clef:输入 24 美分每百万 token,输出 0;低延迟版 Clef-flash 中位响应 38.8 毫秒。
· AWS 的 Strands Decider 2B:干脆给齐了训练配方,你可以下载到自己机器上跑,一分 API 费不花。

这个品类最早是 TypeSafe 家的 Jev 定义出来的,输入每百万 token 4.2 美分。现在这几家等于把价格又打了一轮。

怎么用?拿工单分类举例:把用户的留言原文塞给它,问"这段属于投诉、咨询还是夸奖?三选一"。它回你"咨询,置信度 0.94"。你设一条规则:置信度高于 0.9 的自动分流处理,低于的转人工。整个链路又快又稳,成本可能只有聊天模型的几十分之一。

▲ 绿灯行、红灯停——判断就该这么干脆

适合的场景其实遍地都是:留言审核、意图识别、邮件分拣、内容打标、给长文本挑重点段落。所有"答案很短、判断很频繁"的活,都该换这类工具。反过来,需要写作、分析、多轮对话的,它干不了,老老实实回聊天模型。

顺带说个行业信号:llama.cpp 上周也合入了决策模型支持,SGLang 加了专门的 API 路由。基础设施都在跟进,说明这不是噱头,是实打实的新类别。你下次做自动化流程时,把"判断"这一步单独拎出来用决策模型跑,省下的钱和时间是看得见的。

图源:Wikimedia Commons · CC 授权

相关学习资料