ITBear旗下自媒体矩阵:

大连理工与东京大学联合研发:Vinci2让AI助手从“被动应答”到“主动陪伴”

   时间:2026-07-26 04:26:47 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

你是否经历过这样的场景:在厨房手忙脚乱时突然找不到调料,修理物品时发现工具不对,或是被打断后忘记未完成的任务?这些日常困扰往往需要自行解决,因为现有的智能助手大多只能被动响应指令,而非主动提供帮助。针对这一痛点,由大连理工大学、Alaya Lab与东京大学联合研发的Vinci2系统,试图将AI助手从“被动应答者”升级为“主动观察者”。该系统包含评测基准EgoServe与智能模型EgoMemo两大核心成果,其研究论文以预印本形式发布于arXiv平台。

传统AI助手多采用“被动范式”,即用户需明确提问后系统才提供答案。这种模式在用户未意识到自身需求时显得无力,例如错误操作或潜在健康风险。尽管部分系统尝试通过“半主动范式”在特定任务中监控进度,但其局限性在于仅能处理预设指令,且缺乏对用户长期行为模式的理解。Vinci2团队提出的“完全主动范式”则试图突破这一框架:系统无需用户指令,即可通过持续观察判断是否需要介入,并选择合适的时机与方式提供帮助。

为衡量AI主动干预能力,研究团队设计了评测基准EgoServe。该基准整合了三个第一视角视频数据集:EgoLife记录参与者连续数日的日常生活;HoloAssist包含组装设备等任务的操作视频,并标注了关键步骤与错误点;CaptainCook4D则聚焦烹饪场景,涵盖正确操作与刻意设置的错误。EgoServe将助手服务划分为四个时间层次:即时服务针对当前画面(如安全提醒),短期服务涉及几分钟内记忆(如防止重复加盐),情节服务需跨几十分钟推理(如任务衔接),长期服务则跨越数日(如习惯养成)。服务类型细分为安全提醒、工具建议、错误纠正等十个子类,覆盖日常需求全场景。

EgoMemo作为实现主动干预的核心模型,采用“三层记忆系统”模拟人类认知过程。第一层为片段级描述库,每30秒生成一次详细文字记录与关键画面截图;第二层为活动级摘要,每五分钟整合近期细节形成连贯描述;第三层为会话级摘要,每小时提炼高层次行为模式。除文字记忆外,系统还维护视觉档案与语义关系图:前者通过数字向量存储画面特征,后者动态构建人物、物品、地点的关联网络。这种设计使EgoMemo无需专门训练,即可通过检索历史信息支持实时决策。

当新视频片段输入时,EgoMemo首先判断是否需要主动介入。若需介入,系统通过三条并行通道检索背景信息:文字相似度通道匹配语义相关描述,关系图通道挖掘隐含关联(如“刀”与“切割工具”),图像通道比对视觉特征。检索结果经描述重建步骤转化为统一文本格式后,与当前画面描述共同输入推理模块,最终决定是否开口及具体内容。该架构同时支持被动模式,用户提问时可直接调用历史信息作答。

实验数据显示,EgoMemo在EgoServe上的整体F1得分达8.0,显著优于GPT-5-mini的4.7分与Qwen3-VL-Plus的接近零分。尤其在跨日关联与日常优化等长期服务类别中,EgoMemo得分分别为4.9与11.8,而基准模型均得零分。拆解实验表明,移除任何记忆层级或检索通道均会导致性能下降,例如仅保留片段级记忆时整体得分降至7.0,跨日关联得分锐减至1.9。在检索效率方面,EgoMemo处理每分钟视频仅需13.11秒,较VideoAgent快5.1倍,较Video-RAG快1.6倍。

该研究在通用视频理解任务中亦表现突出。在ESTP-Bench主动问答基准上,EgoMemo得分超越有监督训练模型EyeWO;在OVO-Bench实时理解任务中,其感知得分超过GPT-4o与LLaVA-OneVision;在EgoSchema长时间推理任务中,得分较此前最优模型EgoThinker提高7.2分。这些成果验证了分层记忆与多通道检索架构的泛化能力。

EgoServe的标注流程采用半自动化方法:HoloAssist数据通过转化现有结构化标注生成服务实例;EgoLife数据由模型生成候选实例后经人工核查;CaptainCook4D则直接利用食谱步骤与错误标签。最终3437条标注通过审核,通过率85.1%,其中安全提醒类通过率最高,资源提示类因视觉识别难度较大通过率最低。研究团队承认,当前系统仍存在文字描述丢失视觉细节、实体识别依赖名称匹配等局限,整体得分处于中等水平,表明主动干预需同时解决时机判断、类别识别与内容生成三重挑战。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version