ITBear旗下自媒体矩阵:

蚂蚁百灵发布首个金融增强模型,AI开始进入真实投研工作流

   时间:2026-09-09 13:37:04 来源:互联网编辑:汪淼 IP:北京 发表评论无障碍通道

外滩大会前夕,记者获悉,蚂蚁集团百灵首个金融增强开放模型 Ling-3.0-flash-Fin发布。与传统金融大模型主要解决问答、摘要等单点任务不同,Ling-3.0-flash-Fin进一步瞄准真实金融工作流,尝试让AI从“回答一个问题”走向“完成一项工作”。目前,该模型已经正式开源。

与此同时,蚂蚁百灵还同步开放金融搜索Agent评测基准FinFIRST,逐步开放模型、工具和评测体系。模型目前重点切入投资研究场景,覆盖信息检索、研究推理、估值建模、研报撰写等环节,尝试打通从找资料、做分析到形成研究成果的完整任务链。

金融是验证模型专业能力的重要场景。业内看来,Ling-3.0-flash-Fin 的推出,是蚂蚁百灵从通用模型能力向专业场景的一次重要探索。蚂蚁集团在金融场景有深厚的积累,这使得百灵能够依托复杂真实场景验证模型能力,并持续迭代。

金融AI的竞争,从“会回答”走向“能干活”

金融一直被视为AI走向专业生产力的高难度场景。

一份研究报告背后,需要从年报、财报、公告、监管文件和研究材料中寻找信息,核对不同报告期和统计口径,再进行计算、估值建模,最终形成能够被专业人士审核和复用的研究成果。

金融AI面对的并不是一个简单的“知识问答”问题。它不仅要知道答案从哪里来,还要知道数据能不能用、计算是否正确,以及最终结论能否被复核。

Ling-3.0-flash-Fin此次瞄准的,正是这一完整工作链路。

该模型基于Ling-3.0-flash打造,延续124B总参数、5.1B激活参数配置,并具备256K长上下文能力,兼顾复杂金融内容处理和实际部署效率。模型通过金融语料持续预训练、领域后训练和工具使用优化,进一步强化对年报、财务工作簿、多份研究材料等复杂内容的处理能力。

从模型定位上看,Ling-3.0-flash-Fin更强调面向长链路Agent工作的能力:让模型不再把信息检索、证据审查、计算、建模和报告准备看成彼此孤立的任务,而是尝试将它们连接起来,完成一项完整的金融研究工作。

四项能力,打通一条投研工作链

目前,Ling-3.0-flash-Fin率先从投资研究场景切入,重点强化四项能力:信息检索、研究推理、估值建模和研报撰写。

其中,信息检索强调优先定位官方、一手及高可信数据源,并关注信息时点和统计口径;研究推理则通过多步计算和交叉验证,厘清事实与假设,构建可复核的证据链;估值建模进一步进入真实工作簿,支持公式切换、跨表依赖和异常排查,让AI生成的结果能够继续进入专业人员原有工作流程;在此基础上,模型进一步组织事实、数据和判断,生成可编辑、可审核的研究材料。

四项能力并非简单的功能罗列,而是对应一条从找信息、验信息,到做计算、建模型、形成研究成果的完整投研链路。这也意味着,金融AI正在从单点能力的比拼,走向完整工作流的比拼。

不只发布模型,也尝试建立金融AI的“评分尺”

此次与模型同步推进的FinFIRST,则瞄准了金融AI发展中的另一个关键问题:如何判断一个金融Agent到底做得好不好。

FinFIRST(Financial Information Retrieval, Sourcing and Traceability)由蚂蚁集团构建并开源,中金公司投行团队提供专业支持,并有50余位金融专业人士参与设计,重点评测金融搜索Agent在信息检索、信源选择、口径判断和推导过程等方面的能力。

在这一评测体系下,一个好的金融AI不仅需要给出正确答案,还需要回答三个问题:信息从哪里来、口径是什么、结论如何得出。

在数据组成上,FinFIRST 覆盖中国内地、美国、中国香港及其他市场,其中中文题占 60.2%,英文题占 39.8%。超过五分之四的题目包含多个相关子问题,61.8% 要求显式计算,32.5% 需要多个信源,75.6% 不直接指定信源,需要 Agent 自主搜索和判断。所有题目均使用公开可访问的信源。

FinFIRST 提供了一套更贴近真实金融需求的搜索任务、标准与评测方法,它并不只是一个模型排行榜,而是试图把金融研究中的专业判断转化为可验证、可复用的评测标准。

目前,Ling-3.0-flash-Fin已在FinFIRST、FinSearchComp Verified、Finance Agent、APEX-Agents、SpreadsheetBench、τ³-Banking等多个金融智能体基准上进行测试,覆盖金融信息检索、投资研究、长程任务执行、估值建模和银行业务等场景。评测显示,模型综合表现超过部分大尺寸旗舰模型,在同尺寸模型中具备较强竞争力。

从一个金融模型,到一套开放能力

此次Ling-3.0-flash-Fin的另一个特点,是“模型+工具+评测”的同步开放。

相比单纯发布一个行业模型,百灵希望进一步把模型能力放到真实任务中验证,并通过开放评测让金融机构、研究团队和开发者共同参与迭代。

目前,Ling-3.0-flash-Fin已开放模型权重,并面向开发者提供API体验;FinFIRST也同步开放,进一步降低金融AI研究和应用开发的门槛。对于金融行业而言,这种开放也意味着更多真实业务反馈能够反哺模型能力。

金融只是百灵此次探索真实世界AI的一个切入口。

随着AI从聊天、搜索逐渐走向Agent,模型真正的价值正在从“生成多少内容”,转向“能够承担多少工作”。在金融、医疗、企业服务等专业领域,AI最终能否形成生产力,不仅取决于模型本身的智能程度,也取决于它能否理解行业规则、调用专业工具,并真正嵌入一项工作的完整流程。

从“回答一个问题”到“完成一项工作”,这可能正是大模型从能力走向生产力的下一步。

未来,蚂蚁百灵将继续探索更大规模模型底座上的金融增强,提升长链路复杂任务处理能力,并从投资研究进一步拓展至更多金融业务场景。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version