小红书开源 dots3-note:一个月活3亿的种草社区,为何亲自下场造大模型?
8月末小红书 dots studio 开源 dots3-note preview:280B总参、激活仅16B、512K上下文、Apache 2.0,主打长程生活智能体。本文拆解参数与TEMPO方法,对比智谱GLM、腾讯混元,并回答内容平台为何亲自下场造大模型。
开场:一个种草社区,亲自下场造大模型
8 月末的国产开源大模型圈,又多了一张新面孔——而且来得很意外。
小红书旗下的 dots studio 把自研的 dots3-note preview 直接开源到了 Hugging Face 和 GitHub。它不是一个笔记插件,而是一头 280B 总参数、每次推理只激活 16B、支持 512K 上下文 的多模态 MoE 模型,主打"长程生活智能体"。
为什么意外?因为过去两年下场做基础模型的,要么是字节、腾讯、阿里、百度这类有搜索/推荐刚需的大厂,要么是智谱、DeepSeek、月之暗面这类模型公司。而小红书对外的人设是"种草社区"——一个看起来离底层算力最远的内容平台。
但换个角度想:一个月活 3 亿、主营业务高度依赖搜索、推荐、内容创作和客服的平台,把 AI 从"功能"升级成"底座",其实是一条所有大厂都在走的同一条路。这篇把事实和判断拆清楚,并和 智谱 GLM、腾讯混元 两款近期开源模型做横向对比。
一、dots3-note 到底是什么
dots3-note 是小红书 dots3 系列的第一个开放权重版本。这个系列还有 jazz、aria 两档(分别对应不同复杂度、响应速度与成本),note 是最轻量、最强调"能部署"的一档。
它的血统不简单:同系列的分支版本 dots-note-3.0 在 IMO 2026(国际数学奥林匹克)拿下了官方认证的 42/42 满分——这是史上首个在 IMO 拿到官方认证满分的 AI。也就是说,小红书不是临时拼一个对话模型蹭热度,而是把"能证明难题"的能力,转向"能在真实生活里完成跨天、跨模态、没有标准答案的长程任务"。
官方自己的定位原话是:"迈向服务真实生活的长程智能体,坚定的第一步。"
二、核心参数:280B 总参、16B 激活的多模态 MoE
把公开披露的核心规格摊开看(来源:官方 GitHub / Hugging Face Model Card):
- 总参数 280B,单次推理激活 16B:256 个路由专家 + 1 个共享专家,Top-8 路由。MoE 的思路就是把"模型容量"和"推理成本"拆成两件事——你脑子大,但每次只动一小部分,成本和显存都压得住。
- 512K 上下文:能吞下长文档、长对话、长任务状态,是做"长程智能体"的硬前提。
- 四模态输入:文本、图像、视频、音频都能吃,输出文本。视觉侧是 MoE ViT(7B 总参 / 1.2B 激活),音频侧是 800M 稠密编码器——注意视觉编码器本身也是 MoE,不是简单挂个视觉塔。
- Apache 2.0 协议,BF16 / FP8 两版权重,单台 8 卡 GPU 节点用 vLLM / SGLang 就能跑。
- 华为昇腾 0-Day 适配:发布当天 Atlas 800 A3、900 A3 超节点就跑通了 vLLM Ascend,国产模型 + 国产算力当天闭环。
值得国内开发者留意的是最后一条:从第一天起就能在国产算力上跑,对讲究自主可控的政企场景是实打实的加分项。
三、TEMPO 与长程智能体:它想干的不是"刷榜"
光看参数,280B 并不稀奇。dots3-note 真正的差异化在它选的战场:没有标准答案、执行周期可达数小时到数周的真实长程任务。
小红书官方把这类任务和数学、代码这种"可验证任务"做了明确区分:
- 用户不会一次性说清需求——真实意图是在多轮交互里逐渐浮现、还会随中间结果变化的;
- 任务要多次交互才能完成——可能持续数天,模型必须跨阶段保留并更新状态;
- 外部环境是动态的——天气、价格、库存、航班都会异步变化,且不一定主动通知你。
为此它配了三样东西:
- TEMPO 长程强化学习法(Test-time-scaled Value Estimation with Macro-step Policy Optimization):把长轨迹切成多个 macro-step,每个 macro-step 结束时,同一个 Agent 从"演员"切换成"评委",用 test-time scaling 推理估计剩余回报,从而解决"几十小时 rollout 里功劳算给谁"的信用分配难题。官方数据:ARC-AGI-3 上比 baseline 提升 31.5%、比 GRPO 提升 20.6%。
- 递归自我评价(Self-Critiquing):正是这种"能评价自己"的能力,支撑了 IMO 42/42 满分——Agent 递归生成证明,并自我评估增强。
- 两套真实生活基准 VibeSearchBench / VibeLifeBench:考的是"用户没说清需求时 Agent 能否问明白""外部条件变化后 Agent 还跟不跟得住"。结果显示,连 Claude Opus 5 和 GPT-5.5 都没在这两套基准上及格。
换句话说,单点硬任务各家都强,但把能力稳定维持几小时甚至几天,整个行业都还在补课——小红书想补的正是这一课。
四、为什么一个种草社区要做通用大模型
有人会问:一个种草社区,折腾通用大模型干嘛?
判断很直接:当搜索、推荐、审核、广告生成、客服、创作工具全部由模型驱动后,调用量巨大,长期依赖外部 API 的成本与价格波动难以承受;更关键的是,通用模型未必真懂"找餐厅""做攻略""装修避坑"这类强上下文的生活决策。生活决策不是一次检索,而是跨阶段的持续服务。
这解释了为什么 字节有豆包、腾讯有混元、阿里有通义、百度有文心——"大平台必须有自己的模型"正在成为国内共识。小红书补上这一位,逻辑上没有例外。
对开发者而言,开源带来的直接回报是:新模型最需要的是测试、反馈和生态,而华为昇腾的 0-Day 适配就是生态速度的例子。对社区来说,这也是一次公开表态——小红书不只是"用 AI 的应用方",而是参与底层能力建设的一方。
五、横向对比:dots3-note vs GLM 5.3-Flash vs 混元 Hy4 preview
8 月末,国产开源大模型形成了"内容平台 + 模型公司 + 大厂"同台的局面。把三款近期开源的主力放在一张表里看(数据见文末信息图):
| 维度 | 小红书 dots3-note | 智谱 GLM 5.3-Flash | 腾讯混元 Hy4 preview |
|---|---|---|---|
| 总参数 | 280B(激活16B) | 320B(激活18B) | 770B(激活49B) |
| 上下文 | 512K | 1M | 1M |
| 协议 | Apache 2.0 | MIT | 权重+代码双开 |
| 多模态 | 文本/图像/视频/音频 | 文本/图像 | 文本为主 |
| 核心定位 | 长程生活智能体 | Agent 编程+网络防御 | 软件工程/办公/科研 |
几个判断:
- 激活参数都压得很低,说明三家都走"小激活、大容量"路线,推理成本才是竞争焦点,不是纸面参数。
- dots3-note 的多模态最全(四模态),且主打别人没认真做的"长程任务"赛道;GLM 5.3-Flash 在编程与 Agent 上更强;Hy4 preview 在工程与科研场景更重。
- 这不是"谁碾压谁",而是分工:一个盯"帮你把麻烦事跑完几天",一个盯"帮你把代码写对",一个盯"帮你把工程交付"。
六、开发者怎么用、要花多少钱
- 开源权重:Hugging Face
dots-studio/dots3-note-prev、GitHubstudio-dots-ai/dots3-note-prev,Apache 2.0,BF16 / FP8 两版。 - API 体验:dots.ai 平台提供限时免费调用;OpenRouter 也已接入,可直接在支持 OpenRouter 的产品里调用。
- 本地部署:FP8 版本 + 单台 8 卡节点是性价比之选;走国产路线则昇腾 0-Day 适配意味着不用等第三方移植。
- 推理栈:vLLM 主分支原生支持(稳定版尚未包含),Transformers / SGLang 也带 dots3-note 支持。
费用上,开源权重本地部署的成本主要是算力租金;API 侧的正式定价以 dots.ai / OpenRouter 页面为准,预览期免费是试水窗口。
七、边界与判断
说边界,官方自己也很坦诚:这是预览版,强化学习训练尚不充分,幻觉抑制、多模态平衡、稳定性仍有不足;而且"模型权重 ≠ 完整产品"。真实生活任务的模拟环境跑分,不等于真实产品体验。
对站长、开发者、内容从业者的实际启示有三条:
- 长程智能体是 2026 下半年的真战场:从 OpenAI 的 Codex 到各家 Agent,趋势都是从"写一段代码"走向"替你跑完一个项目",小红书把这条线用开源权重摆到了社区面前。
- 国产开源 + 国产算力当天闭环会成为政企选型的新卖点,自主可控不再是口号。
- 内容平台自建底座意味着,未来你用的"种草推荐""攻略生成",底层可能就是这类长程模型在跑——SEO 和内容策略要考虑"模型怎么理解我的长上下文需求"。
一句话收尾:小红书这头牛,耕的田不是榜单,而是"能不能在真实生活里,替你把麻烦事跑完"。
❓ 常见问题
2026 年 8 月 14 日,小红书旗下 dots studio 在 Hugging Face 与 GitHub 正式开源 dots3-note preview,Apache 2.0 协议,提供 BF16 / FP8 两版权重;华为昇腾当天完成 0-Day 适配。它是 dots3 系列第一个开放权重版本,同系列分支曾在 IMO 2026 拿下官方认证 42/42 满分。
三者都走 MoE 小激活路线,但分工不同:dots3-note(280B/激活16B)主打长程生活智能体与四模态(文本/图像/视频/音频),GLM 5.3-Flash 强在 Agent 编程与网络防御,混元 Hy4 preview 重工程与科研。它不是单项碾压,而是补齐了'持续数小时到数天的真实任务'这一被忽视的赛道。
开源权重在 Hugging Face(dots-studio/dots3-note-prev)与 GitHub(studio-dots-ai/dots3-note-prev),vLLM 主分支、Transformers、SGLang 均支持;FP8 版 + 单台 8 卡 GPU 节点是性价比之选;昇腾 Atlas 800/900 A3 超节点也已跑通。API 侧 dots.ai 限时免费、OpenRouter 已接入。
TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization)把长轨迹切成多个 macro-step,每个 macro-step 结束时同一个 Agent 从演员切换为评委,用 test-time scaling 推理估计剩余回报,解决'几十小时 rollout 里功劳算给谁'的信用分配难题。官方数据:ARC-AGI-3 上比 baseline 提升 31.5%、比 GRPO 提升 20.6%。
当搜索、推荐、审核、广告、客服、创作工具全部由模型驱动后,调用量巨大,长期依赖外部 API 的成本与价格波动难承受;且通用模型未必真懂'找餐厅/做攻略/装修避坑'这类强上下文生活决策。大平台把模型变成底层底座已成国内共识,小红书补位逻辑与字节豆包、腾讯混元一致。