# 小红书开源 dots3-note：一个月活3亿的种草社区，为何亲自下场造大模型？

## 开场：一个种草社区，亲自下场造大模型

8 月末的国产开源大模型圈，又多了一张新面孔——而且来得很意外。

小红书旗下的 **dots studio** 把自研的 **dots3-note preview** 直接开源到了 Hugging Face 和 GitHub。它不是一个笔记插件，而是一头 **280B 总参数、每次推理只激活 16B、支持 512K 上下文** 的多模态 MoE 模型，主打"长程生活智能体"。

为什么意外？因为过去两年下场做基础模型的，要么是字节、腾讯、阿里、百度这类有搜索/推荐刚需的大厂，要么是智谱、DeepSeek、月之暗面这类模型公司。而小红书对外的人设是"种草社区"——一个看起来离底层算力最远的内容平台。

但换个角度想：一个月活 3 亿、主营业务高度依赖搜索、推荐、内容创作和客服的平台，把 AI 从"功能"升级成"底座"，其实是一条所有大厂都在走的同一条路。这篇把事实和判断拆清楚，并和 [智谱 GLM](https://www.aitoollab.cn/tools/glm-5-2/)、[腾讯混元](https://www.aitoollab.cn/tools/tencent-hunyuan/) 两款近期开源模型做横向对比。

## 一、dots3-note 到底是什么

dots3-note 是小红书 **dots3 系列**的第一个开放权重版本。这个系列还有 jazz、aria 两档（分别对应不同复杂度、响应速度与成本），note 是最轻量、最强调"能部署"的一档。

它的血统不简单：同系列的分支版本 **dots-note-3.0** 在 IMO 2026（国际数学奥林匹克）拿下了官方认证的 **42/42 满分**——这是史上首个在 IMO 拿到官方认证满分的 AI。也就是说，小红书不是临时拼一个对话模型蹭热度，而是把"能证明难题"的能力，转向"能在真实生活里完成跨天、跨模态、没有标准答案的长程任务"。

官方自己的定位原话是："迈向服务真实生活的长程智能体，坚定的第一步。"

## 二、核心参数：280B 总参、16B 激活的多模态 MoE

把公开披露的核心规格摊开看（来源：官方 GitHub / Hugging Face Model Card）：

- **总参数 280B，单次推理激活 16B**：256 个路由专家 + 1 个共享专家，Top-8 路由。MoE 的思路就是把"模型容量"和"推理成本"拆成两件事——你脑子大，但每次只动一小部分，成本和显存都压得住。
- **512K 上下文**：能吞下长文档、长对话、长任务状态，是做"长程智能体"的硬前提。
- **四模态输入**：文本、图像、视频、音频都能吃，输出文本。视觉侧是 MoE ViT（7B 总参 / 1.2B 激活），音频侧是 800M 稠密编码器——注意视觉编码器本身也是 MoE，不是简单挂个视觉塔。
- **Apache 2.0 协议**，BF16 / FP8 两版权重，单台 8 卡 GPU 节点用 vLLM / SGLang 就能跑。
- **华为昇腾 0-Day 适配**：发布当天 Atlas 800 A3、900 A3 超节点就跑通了 vLLM Ascend，国产模型 + 国产算力当天闭环。

值得国内开发者留意的是最后一条：从第一天起就能在国产算力上跑，对讲究自主可控的政企场景是实打实的加分项。

## 三、TEMPO 与长程智能体：它想干的不是"刷榜"

光看参数，280B 并不稀奇。dots3-note 真正的差异化在它选的战场：**没有标准答案、执行周期可达数小时到数周的真实长程任务**。

小红书官方把这类任务和数学、代码这种"可验证任务"做了明确区分：

1. **用户不会一次性说清需求**——真实意图是在多轮交互里逐渐浮现、还会随中间结果变化的；
2. **任务要多次交互才能完成**——可能持续数天，模型必须跨阶段保留并更新状态；
3. **外部环境是动态的**——天气、价格、库存、航班都会异步变化，且不一定主动通知你。

为此它配了三样东西：

- **TEMPO 长程强化学习法**（Test-time-scaled Value Estimation with Macro-step Policy Optimization）：把长轨迹切成多个 macro-step，每个 macro-step 结束时，同一个 Agent 从"演员"切换成"评委"，用 test-time scaling 推理估计剩余回报，从而解决"几十小时 rollout 里功劳算给谁"的信用分配难题。官方数据：ARC-AGI-3 上比 baseline 提升 31.5%、比 GRPO 提升 20.6%。
- **递归自我评价（Self-Critiquing）**：正是这种"能评价自己"的能力，支撑了 IMO 42/42 满分——Agent 递归生成证明，并自我评估增强。
- **两套真实生活基准 VibeSearchBench / VibeLifeBench**：考的是"用户没说清需求时 Agent 能否问明白""外部条件变化后 Agent 还跟不跟得住"。结果显示，连 Claude Opus 5 和 GPT-5.5 都没在这两套基准上及格。

换句话说，单点硬任务各家都强，但把能力稳定维持几小时甚至几天，整个行业都还在补课——小红书想补的正是这一课。

## 四、为什么一个种草社区要做通用大模型

有人会问：一个种草社区，折腾通用大模型干嘛？

判断很直接：当搜索、推荐、审核、广告生成、客服、创作工具全部由模型驱动后，调用量巨大，长期依赖外部 API 的成本与价格波动难以承受；更关键的是，通用模型未必真懂"找餐厅""做攻略""装修避坑"这类强上下文的生活决策。生活决策不是一次检索，而是跨阶段的持续服务。

这解释了为什么 [字节有豆包](https://www.aitoollab.cn/tools/doubao/)、[腾讯有混元](https://www.aitoollab.cn/tools/tencent-hunyuan/)、阿里有通义、百度有文心——"大平台必须有自己的模型"正在成为国内共识。小红书补上这一位，逻辑上没有例外。

对开发者而言，开源带来的直接回报是：新模型最需要的是测试、反馈和生态，而华为昇腾的 0-Day 适配就是生态速度的例子。对社区来说，这也是一次公开表态——小红书不只是"用 AI 的应用方"，而是参与底层能力建设的一方。

## 五、横向对比：dots3-note vs GLM 5.3-Flash vs 混元 Hy4 preview

8 月末，国产开源大模型形成了"内容平台 + 模型公司 + 大厂"同台的局面。把三款近期开源的主力放在一张表里看（数据见文末信息图）：

| 维度 | 小红书 dots3-note | 智谱 GLM 5.3-Flash | 腾讯混元 Hy4 preview |
|------|------|------|------|
| 总参数 | 280B（激活16B） | 320B（激活18B） | 770B（激活49B） |
| 上下文 | 512K | 1M | 1M |
| 协议 | Apache 2.0 | MIT | 权重+代码双开 |
| 多模态 | 文本/图像/视频/音频 | 文本/图像 | 文本为主 |
| 核心定位 | 长程生活智能体 | Agent 编程+网络防御 | 软件工程/办公/科研 |

几个判断：

- **激活参数都压得很低**，说明三家都走"小激活、大容量"路线，推理成本才是竞争焦点，不是纸面参数。
- **dots3-note 的多模态最全**（四模态），且主打别人没认真做的"长程任务"赛道；GLM 5.3-Flash 在编程与 Agent 上更强；Hy4 preview 在工程与科研场景更重。
- **这不是"谁碾压谁"**，而是分工：一个盯"帮你把麻烦事跑完几天"，一个盯"帮你把代码写对"，一个盯"帮你把工程交付"。

## 六、开发者怎么用、要花多少钱

- **开源权重**：Hugging Face `dots-studio/dots3-note-prev`、GitHub `studio-dots-ai/dots3-note-prev`，Apache 2.0，BF16 / FP8 两版。
- **API 体验**：dots.ai 平台提供限时免费调用；[OpenRouter](https://www.aitoollab.cn/tools/open-router/) 也已接入，可直接在支持 OpenRouter 的产品里调用。
- **本地部署**：FP8 版本 + 单台 8 卡节点是性价比之选；走国产路线则昇腾 0-Day 适配意味着不用等第三方移植。
- **推理栈**：vLLM 主分支原生支持（稳定版尚未包含），Transformers / SGLang 也带 dots3-note 支持。

费用上，开源权重本地部署的成本主要是算力租金；API 侧的正式定价以 dots.ai / OpenRouter 页面为准，预览期免费是试水窗口。

## 七、边界与判断

说边界，官方自己也很坦诚：这是**预览版**，强化学习训练尚不充分，幻觉抑制、多模态平衡、稳定性仍有不足；而且"模型权重 ≠ 完整产品"。真实生活任务的模拟环境跑分，不等于真实产品体验。

对站长、开发者、内容从业者的实际启示有三条：

1. **长程智能体是 2026 下半年的真战场**：从 [OpenAI 的 Codex](https://www.aitoollab.cn/tools/chatgpt/) 到各家 Agent，趋势都是从"写一段代码"走向"替你跑完一个项目"，小红书把这条线用开源权重摆到了社区面前。
2. **国产开源 + 国产算力当天闭环**会成为政企选型的新卖点，自主可控不再是口号。
3. **内容平台自建底座**意味着，未来你用的"种草推荐""攻略生成"，底层可能就是这类长程模型在跑——SEO 和内容策略要考虑"模型怎么理解我的长上下文需求"。

一句话收尾：小红书这头牛，耕的田不是榜单，而是"能不能在真实生活里，替你把麻烦事跑完"。

