今天凌晨,小红书把 IMO 满分夺金模型的同系列版本开源了,这个模型就是 dots3-note preview。

和 GPT-5.6、Claude Fable 5 这样的大参数模型不同,dots3-note preview 是一个非常小、非常轻量的模型。
2026 年 7 月的时候,它的同系列模型曾以 42/42 拿下 IMO 国际数学奥林匹克竞赛官方认证的满分金牌,是 IMO 官方评阅史上第一个满分 AI。同年金牌线是 29 分,全球所有人类选手中,仅有 7 人获得满分。
和常规的 benchmark 不一样,IMO 的赛题都是保密的,无法提前针对性训练,能拿满分就是真有实力。
有意思的地方是,它没有把 IMO 当卖点,反而把重点放在了"生活里没有标准答案,但有真实任务"上。
小模型办大事,靠谱吗?
dots3-note preview 是 dots3 系列里最轻的一个,总参数 280B,激活只有 16B,512K 上下文。
在 dots3-note preview 之前,轻量模型跟 Agent 之间有一道鸿沟。无论是技术社区,还是大众媒体,都普遍认为 Agent 只属于万亿参数的巨无霸模型。
参数量本身就代表了模型的知识储备,这无可厚非。但参数量多少,并不等于完成任务的效果。
结果就是 dots3-note preview 只用那些超大模型成本的零头,就完成了相同的任务。
能做到这些,主要在于 dots3-note preview"解题"的思路很有意思。它是轻量模型,不可能和别的模型比肌肉、硬碰硬。于是它走了一个很"不 AI 的方法"——整体运行逻辑更像是我们小时候刷考试题:
把试卷的每道题都单独拎出来,一道题一道题地看,遇到不会的题就翻开书看一眼,看明白了再做下一道题。一个完整、复杂的任务,就这样被分解成了一道又一道熟悉的题,整个任务便迎刃而解。
从多项主流 benchmark 数据来看,在多项推理及智能体任务上,dots3-note preview 的得分甚至超过了参数规模数倍于自身的大尺寸模型,视觉能力在同尺寸区间表现突出。


dots3-note preview 最大的优势体现在"个人智能体、复杂推理与从环境中学习解决长程问题"上,相关训练方法创新已在技术博客中对应展开。
还有一点,在解决"日常生活"中的难题时,往往追求的并不是谁性能上限更高,而是谁用起来更方便。就像雨伞一样,大模型像超大的庭院伞,覆盖面积大,防晒防雨效果也好,但日常出行,随手能揣在包里的折叠伞才更实用。
这一年有一个很明显的变化:大模型能力的叙事主线不再是"答对一道题",而是比谁更便宜地"完成一件事"。
数学、代码、科学和工程之所以是现阶段最热门的话题,主要是因为它们评分标准清晰,模型效果可以被 verifier 判断,训练系统也因此拿到清晰的奖励信号(reward signal)。
靠着强化学习、test-time scaling 和更长的 rollout,模型逐渐学会规划、执行、检查、修正。
但问题在于,生活并没有那么理性。假如 AI 想要走进人们的现实生活,它需要一套完全不同的评判标准。
现实生活里碰到的问题,很难像数学题那样明确地区分出对与错。比如结婚、旅行这样的经历,就没办法给出直接明了的判断。
所以诸如此类的 long-horizon RL 任务,核心瓶颈从来不是把 rollout 过程拉长,而是奖励模糊、评价主观。需要一套标准,在外部状态持续变化的任务里,建立可扩展的自我评价和学习信号。
小红书 dots 实验室这次开源的 dots3-note preview,本质上就是在做这件事。
self-critiquing + TEMPO:让模型学会"自己掐秒表"
这版模型的训练非常强调 self-critiquing(自我评价),并提出了 TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization)。
自我评价解决的,是"信号来得太晚"的问题。
在训练阶段,自我批评能为长时间 rollout 的中间状态,提供更可扩展的 value 和奖励信号,让模型不再完全依赖可能几十小时后才到来的终局反馈。
到了推理和执行阶段,这套能力又变成一个类似于 Harness 的持续循环:先让模型观察环境,然后评价当前的进展,根据评价结果重新规划,最后采取行动。完成整个循环后,"自我评价"将再次启动评估。
模型会主动获取信息、理解环境变化、评估任务进度、调整计划,再用工具或代码跟环境交互。
就像考试一样,以前是你做完所有题目交上去,老师判完卷子发下来,你才知道哪里做错了。有了"自我评价"之后,你每做一道题,都能立刻知道错了还是对了。
但光有"自我评价"还不够。就像拍蚊子,明明眼睛能看到蚊子的飞行轨迹,可下手拍的时候,却很难精准拍上。
于是小红书 dots 实验室又提出了 TEMPO,它想解决的,正是"评价跟不上行动"这个问题。
TEMPO 的全称是 Test-time-scaled Value Estimation with Macro-step Policy Optimization(测试时扩展的价值估计 + 宏步策略优化)。
它的核心逻辑是通过"自我评价"来进行超长程任务的强化学习。
具体来讲,TEMPO 把一条可能持续几十小时的轨迹,切成若干个 macro-step,每个 macro-step 里模型和环境进行多轮交互。
阶段结束时,同一个模型从 actor 切换成 critic,通过推理、工具调用和 test-time scaling,估算当前状态的预期剩余回报,为还没走完的轨迹构造训练信号。
actor 和 critic 共享完全相同的参数,所以无论是上场做事,还是停下来评价对错,都是同一个模型自己完成的,就像运动员跑步的时候自己给自己掐秒表一样。
所以训练不只是教它怎么行动,也在教它怎么把自己评准:评得越准,训练信号越可靠,学习的过程就会越来越稳。
相比之下,依赖终局奖励的传统范式,一条 rollout 几十小时,信号来得晚,还很难做信用分配。
TEMPO 训练的模型,不仅在测试时评估指标上更好,而且因为它能优化到很靠后的探索步骤,agent 不会像基线方法那样,在高轮数状态下分数不再提升。
目前,这套机制已经初见成效。7 月的 IMO 2026 上,基于 dots3-note preview 分支版本的模型,在推理阶段同时负责生成 proof,并通过工具调用对自己生成的 proof 做迭代式自我评估,最终拿下 IMO 2026 官方认证的满分金牌。
如果你感兴趣,可以自己去体验一把:
从《杀戮尖塔2》到"斩杀线"
现实生活中常见的问题,往往都是持续变化的,尤其像天气、堵车这些临时变更,不可能有人提前跟模型打好招呼。这就使得 AI 的随机应变、临场发挥能力,远比背了多少本书更重要。
dots3-note preview 在这类能力上最直观的展示,是《杀戮尖塔2》。此前模型从未训练过该游戏,连类似环境都没见过。
视频里能看到,它靠持续探索从环境里学习,比如游戏的这张卡有什么作用,那张卡又能打多少伤害。
一开始没有规则,也不会告诉模型如何才能通关。dots3-note preview 只能一点一点摸索:先假设、再尝试、再验证,把假设写进自己的 memory,等到下次做决策的时候再拿出来用。
视频中显示,通过自己的摸索,模型一口气玩到了 33 关。在一个完全陌生的环境里,它证明了"自主学习"这件事本身能成立,而不是只会背题。
完全通过上下文去学习,也是 ARC-AGI 3 这个 benchmark 想测的东西。
ARC-AGI 3 是 ARC Prize 在 2026 年推出的测试,重点从以前 benchmark 常见的静态推理,变成了看 AI 能不能像人一样在陌生环境里自学:先假设通关条件,尝试通关,验证假设,假设不准就自我批评、修正。
举个简单例子,我们在浏览网页的时候,偶尔会有小弹窗遮挡视线。通常的做法是第一时间找到弹窗上的 X 按钮来关掉它。
ARC-AGI 3 里面也有类似的试题:关卡会出现网格内的遮挡色块(类似弹窗挡住可交互区域),必须先点击对应位置消除遮挡,才能继续完成关卡。
简单来说,ARC-AGI 3 就是一个专门为"折腾"模型而生的榜单,上面每一道题,全都是现实生活中真实经历过的。
dots3-note preview 在公开评测上已经和 opus4.8、gpt-5.5 等闭源模型接近。
然而正如前文所提到的,现在已经不流行比上限了,现在比的是在完成任务的前提下,单位智能的成本。
最近有个词很火,叫做"DeepSeek 斩杀线",指的正是此事。
dots3-note preview 在 ARC-AGI 3 上也有自己的"斩杀线":在 500 美元的成本预算内,它是表现最好的那一个。

图源:dots 实验室官方技术博客
而且这次开源的,不只是模型本身。为了让社区能复现、能衡量这类能力,dots 团队还同步开源了两个面向真实生活的 benchmark,分别为 VibeSearchBench 和 VibeLifeBench。
为什么要把这两个 benchmark 单独拿出来说?因为在"真实生活的长程任务"这件事上,过去没有人给过一把统一的尺子。dots 团队只能先自己搭一套复杂场景模拟:覆盖出行、就医、采购、履约、社交这些真实服务,每个场景都带后端状态机、模拟时间线和一堆可调用工具。为了让社区也能复现、也能衡量,他们干脆把这套评测标准本身开源了出来。
VibeSearchBench 考的是"意图逐步披露条件下的多轮搜索",共 20 个领域、200 项任务。每项任务由一个模糊的初始请求和一个 persona 驱动的用户模拟器构成。
用户一开始根本不说清楚自己要什么,在多轮对话里会把约束、条件、需求一点点放出来。Agent 可以用 search、visit、code 三种动作,去搜索、访问页面、写代码。最后把模型预测出的知识图谱和标准答案做节点与三联体匹配,就是本次搜索的最终得分,核心指标是 Triplet F1。
VibeLifeBench 考的是"非静态环境下的跨阶段任务执行",10 个领域、20 项任务,每项横跨 20 到 30 个阶段,带模拟时间线,覆盖大量真实服务环境。但这个 benchmark 不是静态的,用户消息、业务通知、后端状态的变化,都是按阶段发生的,并且不一定会同时发生。
小红书 dots 实验室的愿景
聊到最后,其实 dots 实验室想讲的,是下一代的 Agent,要走进现实生活。
比起更会答题,dots 实验室希望下一代的 Agent,应该是一个真正长期服务每个人的 AI。
它能靠多模态能力感知真实世界,又能通过模型能力和 Agent 能力做复杂推理,最后调用工具解决问题。更重要的是,它需要具备主动性和持续学习能力,会随着世界的变化、对用户理解的加深,不断进化。
dots 实验室在官网(studio.dots.ai)这样写道:创前沿智能,解生活之问。让前沿智能服务于日常生活。从预训练、多模态到后训练、AI Infra,落脚点始终是"生活"本身。
那为什么偏偏从"真实生活长程任务"切入呢?
因为小红书本身就是围绕真实的生活内容分享建立的。这里面也有参数,比如审美、预算、忌口,甚至还有带不带娃等等。
这些事说不清对错,又多模态、动态、主观。
而 dots 实验室想解决的,恰恰正是这些生活任务。
小红书自己就长在这些场景里——旅行、婚礼、开店、选房、养娃……每天有无数用户在这里分享真实偏好和真实经历。所以这不是绕开谁的主战场,而是从自己最熟悉、也最复杂的地方出发,做一件别人还没做明白的事。
dots3-note preview 是坚实的一步,方向立住了,剩下的是耐心。
它把方法、评测和思考,一起摊开在了技术社区面前。至于最后 AI 能不能走进现实生活,接下来,不只是小红书一家的事。在云栈社区里,关于 Agent 与真实场景结合的讨论也在持续升温,这条路值得更多人一起走下去。