
你可能还在小红书上搜旅游攻略、看穿搭笔记,但这家公司的AI团队刚刚干了一件技术圈都没太注意的事——开源了一个大模型。
不是那种"我们微调了一下"的小打小闹。8月中旬,小红书旗下dots实验室正式开源了dots3-note preview:MoE架构,总参数280B,激活参数16B,支持512K上下文窗口,文本、视觉、语音三模态理解,Apache 2.0协议发布在Hugging Face和GitHub。全球任何开发者都可以免费使用、部署和修改。
更让人意外的是这个模型的"前传"。今年7月,dots团队的模型在第67届国际数学奥林匹克竞赛上拿下官方认证满分——42分满分,金牌线仅29分,超出13分。IMO的题目全部是当年全新命题,没法靠训练集押题,必须给出完整数学证明。一个月后,这个团队把同系模型开源了。
不追榜单,追"长程"
先看dots3-note preview到底做了什么。
传统大模型最大的毛病是一本正经地错——第一步推理跑偏,后面一路到底。dots3-note preview的核心差异点是Self-Critiquing能力:模型在执行长链路任务时,会不断充当自己的质检员,发现路线不对及时修正,环境变化时更新记忆。不是一次性输出答案,而是一边做一边自我纠错。
这套能力的背后是一个叫TEMPO的训练方法。传统强化学习里,评估函数通常靠一次前向计算来判断当前状态的好坏。TEMPO把一条长轨迹切成多个macro-step,每个macro-step包含多轮模型与环境的交互,专门优化长程决策的稳定性。很多模型"前20分钟聪明,做一小时掉链子",尤其在上下文超过100K token之后,容易出现目标漂移和记忆混淆。TEMPO就是冲着这个痛点去的。
验证场景是ARC-AGI-3——一个考察未知环境下自主推理的基准测试。dots3-note preview自主观察环境、试探规则,通过320步复杂操作连破全部6关。成本不到500美元。绝对分数低于Claude Opus 4.8的高配版,但成本效率明显更高。在多项推理和Agent任务上,它甚至超过了参数量大自己数倍的模型,视觉能力在同尺寸区间尤为突出。
不过它也有明显短板。终端操作、复杂编程等任务和头部闭源模型仍有差距,强化学习训练也还不够充分。与其说它在追逐榜单第一,不如说它在发布一块已经能上手、但还会持续演进的能力模块。小红书自己也坦言,幻觉控制和多模态能力平衡方面仍有改善空间。
一个种草App为什么要自己做模型?
问题来了。现在第三方大模型已经足够强,百度有文心、阿里有通义、字节有豆包,API随处可调,一个内容平台为什么还要自己造底座?
对小团队来说,调用API完全合理。但当你的平台月活超过3亿,搜索、推荐、内容审核、广告创意、客服、创作工具全都要跑模型,每天的调用量是个天文数字。外部API接得快,调用量上去之后成本和价格波动就是悬在头上的刀。自研模型不是说完全不用外部,而是在高频、稳定的场景里有更可控的成本结构。
更深层的原因是通用模型不懂小红书上的生活。找餐厅、做攻略、挑婚纱、装修避坑——这些不是一次检索就能完成的任务。用户会补充条件、改预算、比方案,被图片和评论影响决策。小红书的内容生态有自己的语境和逻辑,通用大模型回答什么都能答两句,但未必真正理解这些场景意味着什么。
字节有豆包、腾讯有混元、阿里有通义——大家做的事情本质相同:一旦模型能力成了核心链路,就不能长期把命脉交给外部。
但小红书的做法更值得关注的一点是:它不是单纯为了"不被API卡脖子",而是从自己的业务场景出发,反向定义了AI应该具备什么能力。
评测基准暴露了真正的野心
dots3-note preview同步开源了两套评测基准:VibeSearchBench和VibeLifeBench。前者考察"用户没说清需求时Agent能不能逐步搞明白",覆盖20个领域、200项任务,模拟用户在多轮对话中逐步补充限制条件;后者考察"外部环境变了Agent还能不能跟得上",每项任务包含20到30个执行阶段,设置了1247项原子检查点逐一验证状态一致性和工具执行正确性。
结果相当扎心:Claude Opus 5和GPT-5.5在这两套基准上都没有达到及格线。
这个评测方向本身就是小红书产品逻辑的镜像。用户在小红书上的典型路径是"刷到一个东西→收藏→比价→下单→回来写体验",每一环都是多轮、多条件、多模态的交互。小红书没有用通用的benchmark来证明自己"也能做通用模型",而是从自身业务逻辑出发定义了"什么叫好的生活Agent"。
dots3-note preview发布当天就完成了华为昇腾Atlas 800 A3和900 A3 SuperPoD的适配,基于vLLM Ascend推理引擎,实现了0 Day国产算力兼容。开发者在Hugging Face拉下模型的同一天,就能在国产芯片上跑起来。不需要等适配、不用折腾算子兼容——FlashComm通信优化和MoE算子融合这些底层工作,昇腾团队在模型发布前就已经准备好了。
"开源模型+国产算力"的同步响应速度,两年前不敢想。那时候开源模型默认绑定英伟达CUDA生态,移植到国产芯片意味着几周的算子适配和内存调优。现在模型发布当天国产算力就能跑,这个"模型—算力—生态"的闭环,已经从"能用"走到了"好用"。
从"调用方"到"造底座"的人越来越多了
小红书这个动作放在2026年的大背景下看,其实指向一个更大的趋势:大模型竞争的壁垒正在从"谁的模型更强"转向"谁更懂场景"。
过去两年,大模型赛道的主角是互联网大厂和AI创业公司。但当一个平台拥有数亿用户、高频搜索和推荐场景,模型能力成了核心链路的一部分,完全依赖外部供给就不再安全。美团要优化本地生活服务,快手需要更深的内容理解,电商平台要搞清楚用户到底想买什么——它们未必需要训练最强的通用模型,但都会越来越需要属于自己的模型能力。
关键在于,模型能力越往前沿走,通用模型公司越强;但模型能力越往场景深处扎,拥有数据和场景的平台越有优势。技术差距在缩小的当下,差异化更多来自场景理解和数据飞轮。小红书每天数亿用户在真实生活场景中产生的搜索、浏览、交互数据,是训练生活Agent最稀缺的燃料。
两年前,造模型的是模型公司,用模型的是平台。现在,拥有场景的人开始自己造模型了。这两股力量的碰撞,才是大模型下一阶段真正的竞争格局。
夜雨聆风