小红书做种草社区做了十年,现在他们要做大模型了。8月中旬,dots studio(小红书旗下AI团队)在HuggingFace上悄悄放出了dots3-note preview模型权重,Apache 2.0协议,完全开源。280B总参数,16B激活参数,支持文本、图像、视频、音频四种模态输入,512K上下文。我拿到消息后第一时间体验了一圈,这篇文章记录实测过程和部署方法。

这模型什么来路
先说背景。dots3-note preview是dots3系列第一个开放权重的模型,由小红书的dots studio团队开发。Copyright写的是"2026 Xiaohongshu",联系邮箱是dots-model-feedback@xiaohongshu.com。

几个关键参数:
• 架构:多模态混合专家模型(MoE) • 总参数量:280B,激活参数量16B • 上下文长度:512K token • 专家配置:256个路由专家+1个共享专家,Top-8激活 • 视觉编码器:MoE ViT,7B总参数,1.2B激活 • 音频编码器:800M • 支持精度:BF16、FP8 • 输入:文本、图像、视频、音频;输出:文本
为什么这些参数重要?MoE架构的好处是推理时只激活一部分专家,16B的激活量意味着实际推理成本远低于280B的稠密模型。对标一下,DeepSeek-V3也是MoE,671B总参数,37B激活。dots3-note的激活参数更小,理论上推理更便宜。
512K上下文在开源模型里属于第一梯队。GPT-4o是128K,Claude 3.5 Sonnet是200K。当然,上下文长度和实际长文本表现不完全正相关,但这个数字确实够用。
免费体验:30秒上手
不想折腾部署的话,直接用OpenRouter的免费额度。打开这个链接:
https://openrouter.ai/dots-studio/dots-3-note-preview:free
注册个账号就能调API,不需要GPU。我测试了几轮,响应速度还行,高峰期偶尔排队。
简单测试一下:
from openai import OpenAIclient = OpenAI( base_url="https://openrouter.ai/api/v1", api_key="你的openrouter key")response = client.chat.completions.create( model="dots-studio/dots-3-note-preview:free", messages=[ {"role": "user", "content": "用三句话解释什么是混合专家模型(MoE)"}, ], temperature=1.0, top_p=0.95, max_tokens=256, extra_body={"chat_template_kwargs": {"enable_thinking": False}},)print(response.choices[0].message.content)enable_thinking=False是直接回复模式,设成True会先输出思考过程再给答案,类似DeepSeek-R1的reasoning模式。日常对话用False就够了,复杂推理任务可以打开。
多模态实测:能看图、能听音频
dots3-note支持四种输入:文本、图像、视频、音频。我分别测了几个场景。

看图识数:
messages = [{"role": "user", "content": [ {"type": "image_url", "image_url": { "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/cats.png" }}, {"type": "text", "text": "这张图片中有几只猫?"},]}]模型准确识别了图片中的猫,描述了颜色和姿态。这类任务现在大部分多模态模型都能做,不算特别惊艳,但确认了基础视觉能力没问题。
音频理解:
messages = [{"role": "user", "content": [ {"type": "audio_url", "audio_url": { "url": "https://huggingface.co/datasets/hf-internal-testing/dummy-audio-samples/resolve/main/mary_had_lamb.mp3" }}, {"type": "text", "text": "请转写这段音频内容。"},]}]音频转写准确,标点也合理。音频编码器只有800M参数,比专门的ASR模型小很多,但日常使用够了。
视频理解:
视频输入会自动包含音轨处理。我传了一个演唱会片段,问"描述这场表演以及视频中可以听到的内容",模型同时描述了画面内容和音乐信息。多模态融合能力是这个模型区别于纯文本模型的核心卖点。
本地部署:8卡H100能跑
如果你想本地部署,dots3-note的FP8版本可以在单台8卡H100上跑。官方推荐三种方式:vLLM、SGLang、Transformers。

vLLM部署(推荐):
vLLM的main分支已经原生支持,需要较新的nightly build。
vllm serve dots-studio/dots3-note-prev-fp8 \ --served-model-name dots3-note-prev \ --host 0.0.0.0 \ --tensor-parallel-size 8 \ --enable-expert-parallel \ --moe-backend deep_gemm \ --max-model-len 262144几个可选项值得注意:
# 只加载语言模型,跳过视觉和音频编码器(省显存)--language-model-only# 启用3-token MTP投机解码,降低TPOT 50%+--speculative-config '{"method":"mtp","num_speculative_tokens":3}'# 启用OpenAI兼容的自动工具调用--enable-auto-tool-choice --tool-call-parser dotsMTP(Multi-Token Prediction)是dots3-note的一个亮点功能,通过预测多个token来加速推理。开启后每步预测3个token,吞吐量提升明显。投机解码在vLLM里配置简单,一行参数搞定。
SGLang部署:
官方提供了Docker镜像,开箱即用:
docker run --gpus all --ipc=host -p 8000:8000 \ lmsysorg/sglang:dev-dots3-note \ sglang serve \ --model-path dots-studio/dots3-note-prev-fp8 \ --served-model-name dots3-note-prev \ --host 0.0.0.0 --port 8000 \ --context-length 524288 \ --enable-dp-attention \ --dp-size 8 --tp-size 8 --ep-size 8 \ --moe-dense-tp-size 1 \ --page-size 64 \ --trust-remote-code \ --attention-backend fa3 \ --moe-a2a-backend deepep \ --enable-multimodal \ --speculative-algorithm NEXTN \ --speculative-num-steps 3 \ --speculative-eagle-topk 1 \ --speculative-num-draft-tokens 4 \ --speculative-draft-model-path dots-studio/dots3-note-prev-fp8SGLang的Dots3-Note cookbook有完整的调优说明,在GitHub上能找到。
显存不够怎么办?
FP8需要8张H100(80GB),BF16需要更多。手头没有8卡H100的话:
1. 用OpenRouter免费API(上面提到的) 2. 等社区出更小的量化版本(GGUF版本已经有人在做) 3. 只跑语言模型,跳过多模态编码器( --language-model-only)
HuggingFace上已经能看到几个社区量化版本:Mike0021/dots3-note-prev-GGUF、Baekpica/dots3-note-prev-Mixed-Quant-GGUF。GGUF格式可以在消费级显卡上跑,虽然速度慢但能体验。
和谁对标?横向对比
dots3-note preview的定位是"系列中最轻量级的成员",对标对象应该是同级别的开源MoE模型。
dots3-note的激活参数只有16B,是DeepSeek-V3的不到一半。这意味着同样硬件条件下,dots3-note的推理吞吐可能更高。代价是总参数覆盖的能力广度可能不如更大模型。
多模态是dots3-note的差异化优势。DeepSeek-V3目前是纯文本模型,dots3-note原生支持四种输入模态。如果你需要处理图像、视频、音频,dots3-note是目前开源MoE里少有的选择。
512K上下文也领先于大部分开源模型。处理长文档、代码仓库分析这类场景时,上下文长度是硬门槛。
我的实测感受
用了一周,几个感受:
好的方面:
• 多模态是真做了,视频+音频一起处理,不是凑数 • 512K上下文实测能吃下整本技术书,长文本召回准确 • 工具调用支持原生OpenAI格式,接入Agent框架很方便 • Apache 2.0协议,商用没有限制
需要注意的:
• 这是preview版本,官方说完整报告"即将发布",意味着部分benchmark可能还会调整 • 8卡H100的门槛不低,个人开发者基本靠OpenRouter免费额度 • 社区生态刚起步,vLLM/SGLang的PR还在review中,可能有兼容性问题 • 多模态的精度上限需要更多实测验证,目前官方放出的benchmark图片不够详细
谁该关注这个模型
正在做多模态Agent的开发者:dots3-note原生支持工具调用+多模态输入,可以直接做视觉问答、视频分析类Agent。OpenAI兼容API格式,迁移成本低。
需要长上下文场景的用户:512K token能塞进一整本书或一个中型代码仓库。如果你的应用需要处理超长输入,开源模型里这个长度不多见。
关注国产AI生态的人:小红书从内容平台切入大模型赛道,走的是"内容平台造底座"的路线。和字节跳动做豆包、腾讯混元类似,都是业务场景驱动模型开发。dots3-note的开源释放了一个信号:内容平台也需要自己的模型能力,不是所有公司都愿意用第三方API。

想低成本跑MoE模型的人:16B激活参数,推理成本在280B级别模型里算很低的。配合MTP投机解码,吞吐还能再提升。
本文记录的是preview版本的体验,dots3系列后续应该会有更大参数量的版本。小红书做开源大模型,说白了是内容平台在抢AI基础设施的入场券。图文、视频数据他们不缺,训练多模态模型有天然优势。dots3系列后续应该会有更大参数量的版本,到时候再看真正的水平。
夜雨聆风