语言模型在开放式任务中的表现如何评判?这一问题长期困扰着人工智能领域。传统评测方式依赖人类或AI裁判的主观判断,但不同个体口味差异大,AI裁判也可能存在偏见,导致评测结果难以客观公正。近期,一项名为FlavourBench的评测系统提出新思路:通过一套可被计算机精确执行的烹饪算法替代人工评判,为语言模型在开放式任务中的表现提供客观评分。
FlavourBench的核心是名为Epicure的烹饪算法系统。该系统将1790种食材映射到300维空间,通过计算食材间的相似度、搭配度及饮食限制可行性等指标,输出确定性数值评分。这一设计避免了主观判断的干扰,使评分过程如同编程测试用例般客观可复现。例如,在“从八种食材中选三种组成搭配”的任务中,系统会预先计算所有56种组合的分数并存储为“分数地图”,模型回答后只需查表即可得出分数,无需任何主观评判环节。
为验证系统有效性,研究者对27个主流语言模型展开测试,涵盖GPT、Gemini、Claude、Grok等知名系列。测试任务分为三类:替代类要求选出与给定食材相似且搭配合理的选项;搭配类需选择与指定食材风味互补的组合;约束类则增加素食、加工等级等硬性限制。每类任务各编制178道题目,形成两套独立题库,确保评测结果的稳定性。最终,534道被全部模型成功回答的题目构成“共同核心”考卷,保证所有模型在相同条件下竞争。
评测结果显示,Grok 4.6以65.1分位居榜首,Gemini 3.1 Pro以65.0分紧随其后,但两者差距在统计上无显著差异。GPT-5.6 Sol Pro、Muse Spark 1.2等模型分数集中在60至65分区间,形成竞争激烈的“第一梯队”;而Cohere的Command R+仅获47.9分,明显落后于其他模型。值得注意的是,所有模型得分均显著高于随机选择基线(约31.5分),表明语言模型已具备基础烹饪常识,但在处理约束类任务时表现较弱,反映出其在逻辑推理能力上的不足。
为确保结果可信度,研究者采用多重统计方法。通过5万次自助抽样计算置信区间,明确分数波动范围;对27个模型进行351次两两比较,并运用Holm校正控制假阳性风险。结果显示,仅101对比较能确认显著差异,其余250对因统计不显著被标记为“未解决”。这一设计避免了传统榜单“排名即实力”的误导性结论,更真实地反映了模型间的实际差距。
FlavourBench的突破不仅在于评测方法创新,更在于其潜在应用价值。由于所有组合分数已预先计算,该系统可直接作为训练素材:通过监督学习优化模型选择,利用分数差异进行偏好训练,或将其作为强化学习奖励函数提升决策能力。不过,研究者强调,此次实验仅用于评测,未将分数表用于训练,以避免模型“死记硬背”而非真正掌握烹饪逻辑。
尽管FlavourBench为开放式任务评测提供了新范式,但其局限性同样明显。首先,评分依据Epicure系统的理解,若该系统对特定菜系或小众食材存在偏差,可能影响排名公正性;其次,当前任务仅涉及有限选择,未涵盖完整菜谱生成、烹饪操作等复杂场景;“共同核心”机制虽保证公平,却牺牲了部分数据,未被全部模型回答的题目被排除在主榜单外。这些挑战为未来研究指明了方向:如何扩展系统覆盖范围,提升对多元文化的适应性,以及优化数据利用效率,将是进一步优化评测体系的关键。











