小红书近日正式开源了其最新研发的dots3-note preview大模型,该模型作为dots3系列的首个版本,凭借280亿总参数量和16亿激活参数量构建了强大的能力底座。与同类模型相比,其独特之处在于实现了文本、视觉、语音全模态感知理解能力的深度融合,为多模态交互场景提供了更高效的解决方案。
华为昇腾团队在模型发布当日即完成全量适配工作,通过Atlas 800 A3和Atlas 900 A3 SuperPoD超节点与vLLM Ascend推理引擎的协同优化,确保了模型在保持全模态理解能力的同时,推理效率得到显著提升。这项适配成果为金融、医疗、教育等需要处理复杂多模态数据的行业提供了可靠的算力支撑,特别是在长文本分析、音视频内容理解等场景中表现出色。
技术团队针对多模态推理链路进行了系统性优化:在通信层面,通过FlashComm技术将AllReduce操作拆解为ReduceScatter与AllGather的组合,使列向无关算子的计算冗余度降低40%;在计算融合方面,FUSED_MC2技术将MoE层的五个独立算子整合为单一大算子,使Kernel启动次数减少75%,中间张量内存占用降低60%。这些优化措施使模型在保持96%以上精度的情况下,推理时延降低35%。
针对高并发在线业务需求,研发团队原生适配了MTP投机解码机制。该技术通过单次前向计算生成多个候选Token,结合动态校验机制实现解码结果的复用,使单Token生成耗时(TPOT)降低28%。在4卡并行环境下,模型吞吐量达到每秒1200 tokens,能够稳定支持实时语音交互、视频流分析等低时延场景。
目前,开发者可通过华为云社区获取详细的部署指南和模型权重文件。vLLM Ascend框架已开放全模态适配接口,支持快速集成自定义视觉编码器和音频特征提取模块。小红书技术团队在官方博客中详细披露了模型训练数据构成和优化策略,为社区开发者提供了可复现的技术路径。
相关技术文档显示,该模型在法律文书摘要、多语言客服对话、医疗影像报告生成等20余个基准测试中,综合表现超越多数300亿参数量级模型。特别是在中文多模态理解任务中,其图文匹配准确率达到91.3%,较前代模型提升8.2个百分点。华为工程师透露,后续将开放更多硬件加速接口,支持FP8混合精度训练等先进特性。









