小红书旗下dots实验室近日宣布开源轻量级智能体模型dots3-note preview,这款模型凭借独特的任务处理逻辑与低成本优势,在AI领域引发广泛关注。与传统依赖大规模参数的模型不同,dots3-note preview通过分解复杂任务为多个子问题,结合实时环境感知与自我评估机制,实现了在有限资源下的高效运作。
该模型的核心突破在于其"分步解题"策略。面对复杂任务时,系统会将其拆解为多个独立步骤,每完成一个子任务便通过内置的自我评价模块验证结果,并根据反馈调整后续策略。这种模式类似于人类应对陌生问题的思维方式——先理解局部规则,再通过实践积累经验,最终形成完整解决方案。实验数据显示,在多项推理任务中,dots3-note preview的表现已超越参数规模数倍的竞品模型。
技术实现层面,dots实验室创新性地提出TEMPO训练框架。该框架通过将长程任务切割为多个宏观步骤,在每个阶段结束时由同一模型切换角色进行价值评估。这种设计解决了传统强化学习依赖终局奖励导致的信号延迟问题,使模型能在任务执行过程中持续优化策略。以数学证明为例,系统可边生成证明步骤边验证逻辑正确性,避免传统方法需要完整输出后才进行评估的弊端。
在真实场景适应性方面,dots3-note preview展现出显著优势。实验室设计的VibeSearchBench和VibeLifeBench两大评测体系,专门模拟现实生活中的动态环境。前者要求模型在用户需求逐步明确的过程中完成多轮搜索,后者则考验模型在跨阶段任务中应对环境变化的能力。测试表明,该模型在500美元成本预算内,于复杂生活场景任务中的表现优于多数闭源系统,验证了其"低成本高效率"的实用价值。
这款模型的开源包含完整技术文档与训练代码,同时开放两个生活场景评测基准。VibeSearchBench覆盖出行、医疗等20个领域的200项任务,重点考察模型处理模糊请求的能力;VibeLifeBench则模拟真实服务环境,设置包含20-30个阶段的跨时段任务,测试模型应对动态变化的表现。这种开放策略为社区提供了统一的评估标准,推动智能体技术向实用化方向发展。
dots实验室的研发路径与小红书的内容生态密切相关。平台每天产生大量涉及审美偏好、预算限制等主观决策的生活分享,这些数据天然包含多模态、动态变化的特征。实验室选择从这类场景切入研发,既发挥了自身数据优势,也直击当前AI技术落地生活的关键痛点。通过将前沿算法与真实需求结合,该模型为智能体技术开辟了新的发展方向。
目前,dots3-note preview已在数学推理、游戏探索等领域验证技术可行性。在未接触过的《杀戮尖塔2》游戏中,模型通过自主探索环境规则,成功推进至第33关,展现出强大的环境适应能力。这种不依赖特定领域预训练的特性,使其在处理未知任务时具有独特优势,为通用人工智能研究提供了新的参考范式。