日本NTT公司研究人员开发出一套名为“AI Tour Meeting”的创新系统,通过模拟人类群体决策过程,帮助不同偏好的用户协商制定旅行计划。该系统以预印本形式发布于arXiv平台,论文编号为arXiv:2607.18806。研究团队表示,这项技术不仅适用于旅行规划,还可作为观察AI群体行为规律的实验平台,为团体推荐系统设计提供参考。
系统运作机制借鉴了真实会议流程,每个AI参与者被赋予完整“人设”,包括姓名、背景、性格、旅行偏好、目标角色及说服风格。说服方式分为“主观表达型”和“对比分析型”两种,前者通过感性描述推荐方案,后者则基于数据事实进行论证。参与者可接入不同语言模型,支持商业模型与开源模型混合部署,模型参数配置灵活度高。
会议流程采用“对话-投票”循环机制。对话阶段,参与者按预设规则轮流发言,可查询信息、提问或提出新方案;投票阶段,非提案人对方案进行表决。系统通过计数器记录连续满意人数,当该数值等于总参与人数时会议结束。为防止无限循环,设置了最大发言轮数与时间上限。测试显示,50场三人会议中,Qwen3.5-9B模型平均仅需12.8轮即可达成共识,违规率为零。
研究团队通过50组场景测试验证系统性能,发现模型能力直接影响协商效果。能力最弱的Qwen3.5-2B模型完成率仅82%,且14.2%的方案违反约束条件;而Qwen3.5-9B模型实现100%完成率,违规率与失败率均趋近于零。成本分析表明,Qwen3.5-9B单场会议消耗约13.4万输入token,仅为2B模型的五十分之一,显示出高效模型在降低计算成本方面的优势。
针对偏好冲突场景的实验揭示了AI协商的动态规律。在“冲突型”会议中,AI平均需要25.9轮讨论、6.5次提案才能达成共识,满意度降至7.13分,11.3%参与者成为“受害者”。具体案例显示,AI会通过被动妥协或主动调解两种路径解决分歧:首尔会议中Elena在连续九次提案被拒后选择让步;马拉喀什会议中Leila则提出融合多方需求的新方案打破僵局。
发言顺序对协商结果具有显著影响。混合型会议中,首位发言者提案接受率仅43%,而末位发言者接受率达73%。数据分析表明,首位发言者需主动提问才能提高成功率,而后位发言者可利用前期讨论信息优化方案。这种“后来者优势”在冲突型会议中更为明显,首位与末位接受率差距扩大至16个百分点。
系统支持人机混合模式,真实用户可通过聊天界面参与讨论,执行与AI相同的操作。在五人小组中两人缺席的场景下,用户可为缺席者创建AI替身,确保其偏好被纳入决策。可扩展性测试显示,十人会议共识率仍达96%,但发言轮数增至68.6轮,token消耗量是三人会议的20倍,提示大规模应用需权衡效率与成本。
该系统提供图形界面与Python代码接口两种使用方式。图形界面可直观配置参与者信息与会议规则,实时显示对话记录与分析仪表盘;代码接口则便于研究人员批量生成会议数据。系统内置监控模块可追踪token消耗、违规情况等20余项指标,为分析AI群体行为提供数据支持。研究团队强调,这项工作为探索AI社会性行为开辟了新路径,其结论对优化推荐算法具有潜在价值。











