project
dots3-note preview - 小红书开源的多模态 MoE 模型
dots3-note preview 是小红书 dots 模型实验室开源的 dots3 系列首个版本,是 IMO 2026 满分模型同系列。模型采用 280B 总参数/16B 激活参数的 MoE 架构,支...
dots3-note preview是什么
dots3-note preview 是小红书 dots 模型实验室开源的 dots3 系列首个版本,是 IMO 2026 满分模型同系列。模型采用 280B 总参数/16B 激活参数的 MoE 架构,支持 512K 超长上下文与文本、视觉、语音多模态理解。模型针对复杂推理、Agent 与多模态感知优化,专攻旅行规划、婚礼筹备等长程开放任务,在多项推理与智能体 benchmark 上可比肩数倍参数的大模型。
dots3-note preview的主要功能
-
长程开放域 Agent:专攻旅行规划、婚礼筹备等无唯一答案、时间跨度长的复杂任务,独立推进并交付结果。
-
复杂推理与数学证明:继承 IMO 2026 满分能力,具备顶尖数学推理与形式化证明水平。
-
多模态理解:支持文本、图像、视频、音频输入,可完成视觉空间判读、文档图表解析与视频问答。
-
端到端软件工程:能独立完成需求分析、技术选型、代码实现、编译构建到验证运行的完整开发流程。
-
自主学习与纠错:在未知规则环境中通过观察假设、验证反馈,出错时启动 Self-Critiquing 修正并写入动态记忆。
-
交互式任务执行:无需专门训练即可接管游戏、破解 ARC-AGI 等需要实时反馈与长程策略调整的任务。
dots3-note preview的技术原理
- MoE 混合专家架构:模型总参数 280B,激活参数仅 16B,采用 256 个路由专家加 1 个共享专家的设计,每层通过 Top-8 路由选择激活专家,并配备 5,120 维隐藏层与 152K 词表,在控制推理成本的同时实现大容量模型的表达能力。
- 多 Token 预测加速:内置 1.13B 参数的共享多 Token 预测层,可在生成当前 token 时并行预测后续最多 3 个 token,无需独立草稿模型即可实现推测解码,有效降低推理延迟并提升吞吐量。
- 多模态编码器融合:视觉信息由 7B 总参数/1.2B 激活的 MoE ViT 编码器处理,音频由 800M 参数的稠密网络编码,各模态特征经投影后与语言模型对齐,实现文本、图像、视频、音频的统一理解与跨模态推理。
- 长程任务认知机制:依托 512K 超长上下文窗口,模型在开放环境中通过观察提出假设并验证,出错时启动 Self-Critiquing 自我批判,将修正后的规则写入外部 memory.md 动态记忆文件,实现跨步骤的知识累积与策略调整。
微信关注回复“开源”,加入AI开源项目交流群
如何使用dots3-note preview
- 访问官方平台:前往 https://dots.ai/platform/ 注册账号并获取 API 密钥,直接通过云端接口调用模型,无需本地部署。
- 下载模型权重:在 Hugging Face 上找到
dots-studio/dots3-note-prev仓库,下载 Apache-2.0 协议下的模型权重文件到本地服务器。 - 安装推理框架:根据硬件环境选择并安装 vLLM、SGLang 或 Transformers 等兼容框架,加载模型以准备推理。
- 配置并行策略:针对 280B 总参数规模,设置张量并行(TP)与专家并行(EP),将计算分布到多块 GPU 上以满足显存与性能需求。
- 启动任务调用:通过 API 或本地接口输入文本、图像、音频等多模态数据,触发长程 Agent 任务、复杂推理或端到端软件工程。
dots3-note preview的核心优势
-
极致参数效率:280B 总参数仅激活 16B,以远低于同性能大模型的算力消耗,实现比肩甚至超越数倍参数模型的推理与 Agent 能力。
-
长程开放域 Agent:区别于数学/代码等标准化场景,专攻旅行规划、婚礼筹备等无唯一答案、时间跨度长的真实复杂任务。
-
顶尖推理基因:继承 IMO 2026 官方认证满分(42/42)的数学推理与形式化证明能力。
-
原生多模态理解:统一处理文本、图像、视频、音频,支持视觉空间判读、文档图表解析与跨模态推理。
-
自主学习与纠错:内置 Self-Critiquing 机制,出错时自动修正并将规则写入 memory.md 动态记忆,实现跨步骤知识累积。
-
端到端工程能力:能独立完成从需求分析、技术选型、代码实现到编译验证的完整软件工程流程。
dots3-note preview的项目地址
- 项目官网:https://studio.dots.ai/dots/dots3-en.html
- GitHub仓库:https://github.com/studio-dots-ai/dots3-note-prev
- HuggingFace模型库:https://huggingface.co/dots-studio/dots3-note-prev
dots3-note preview的同类竞品对比
| 对比维度 | dots3-note preview | DeepSeek-v4-flash-0731 |
|---|---|---|
| 参数规模 | 280B 总参数 / 16B 激活 | 284B 总参数 / 13B 激活 |
| 架构 | MoE(256 路由专家 + 1 共享专家,Top-8) | MoE |
| 上下文窗口 | 512K | 128K |
| 核心定位 | 长程开放域 Agent(旅行、婚礼、经营等无标准答案任务) | 通用高效推理与代码生成 |
| 长程任务 | 专为数小时至数天的复杂任务优化,支持 Self-Critiquing 与动态记忆 | 侧重代码与数学推理,长程开放任务非主攻方向 |
| 多模态 | 文本、图像、视频、音频统一理解(MoE ViT + 稠密音频编码器) | 以文本为主,多模态能力相对有限 |
| 开源协议 | Apache-2.0,权重与代码全量开源 | 开源权重,协议相对受限 |
| 适用场景 | 个人助理、复杂生活规划、端到端软件开发、游戏策略 | 代码生成、数学解题、轻量级推理任务 |
dots3-note preview的应用场景
-
智能装修顾问:用户上传户型图、家电尺寸图并语音描述需求,模型自动计算空间适配性,检索风格案例,生成定制化装修方案网页并提醒现场复尺。
-
独立游戏代练 Agent:接管《杀戮尖塔 II》等策略游戏,根据实时战局学习敌人机制,动态管理牌组、金币与药水,在长程对局中做出全局最优决策。
-
婚礼全流程策划师:从预算分配、场地筛选、宾客名单管理到流程时间表制定,模型在数周内持续跟进,根据突发变动(如天气、人员调整)动态重新规划。
-
visionOS 原生应用开发:参考设计图独立完成 Apple Vision Pro 应用的需求分析、SwiftUI+RealityKit 代码编写、Xcode 工程构建与模拟器验证,实现从 0 到 1 的空间应用交付。
-
跨模态深度研究助手:针对学术或商业课题,自主执行多轮搜索、阅读 PDF 图表、观看视频资料,整合多源信息生成结构化研究报告,并在发现矛盾时启动 Self-Critiquing 修正结论。