在人工智能应用领域,过去两年形成了一种默契的分工模式:大型科技企业投入巨资进行预训练模型开发,持续提升模型性能上限;应用类公司则通过调用API接口,结合提示工程、检索增强生成(RAG)技术和工具链,将通用智能转化为具体产品。这种清晰的边界划分正在面临挑战——随着用户规模扩大,应用公司发现自身陷入"为模型公司打工"的困境:既要支付高额的获客成本,又要承担每轮模型调用产生的费用,用户使用频率越高,支付给模型供应商的费用越庞大。
这种商业模式困境促使行业探索新路径。以Genspark为代表的平台给出了创新方案:该平台日均生成PPT达12万份,在保证成品质量的同时,通过基于开源MiniMax M3模型的垂直领域后训练,将单份PPT的模型调用成本从4.16美元降至0.44美元,降幅近九成。这项突破的关键在于将完整工作流拆解为2000个具体业务任务,通过强化学习让模型在模拟真实场景中持续优化,特别在训练目标中加入"自检修改"环节,使模型具备主动纠错能力。
成本控制的突破源于对任务特性的深度理解。制作商业PPT看似简单,实则包含资料收集、大纲构建、内容撰写、排版设计、图表生成、质量检查等十余个环节,每个步骤都涉及模型调用。通用模型虽然单步表现优异,但多轮调用中容易累积误差,导致后期修正成本激增。Genspark的测试数据显示,其优化后的Gen-1模型在视觉设计维度超越Claude Opus 5,虽然内容深度和任务完成度仍存差距,但用户实际评分已从3.8星提升至4.25星,低分率从18%降至3.6%,与顶级模型持平。
这种转型正在多个垂直领域上演。法律AI公司Harvey通过重构任务编排方式,在保持模型配置不变的情况下,将虚拟资料室审查任务的合格率大幅提升,同时降低综合成本。代码生成平台Cursor则构建了独特的训练飞轮:其Composer 2引擎基于Kimi K2.5模型,在沙盒环境中进行强化学习,并将开发者采纳/撤销操作作为奖励信号,实现每5小时快速迭代一轮。这种将真实用户反馈直接注入模型训练的机制,使系统能持续适应项目架构变化。
行业共识逐渐形成:应用层的核心竞争力在于构建"工程飞轮"。这需要建立三个关键能力:从用户交互中精准识别问题、构建科学的评测体系验证改进效果、保持模型训练与产品迭代的同步更新。Harvey公司开发的Tenet模型通过拆解法律文书的专业指标,在公开判例和合伙人标注数据上进行后训练,创造出不接触客户数据的"模拟考场",使报表审查成本较Claude Sonnet 5降低50%。这些实践表明,业务经验正在从提示词优化层面深入到模型开发内核。
开源模型与垂直应用的共生关系成为新焦点。Genspark选择MiniMax M3作为基础模型,看中其多模态能力、百万级上下文窗口和工具调用稳定性,特别是MoE架构带来的训练效率优势——相比其他开源模型,M3的后训练计算资源需求降低40%。这种选择折射出行业趋势:应用公司不再盲目追求模型参数规模,而是更关注基础模型与特定任务的匹配度,以及定制化开发的成本效益比。
在这场转型中,红杉资本合伙人Sonya Huang提出的"权重即产品"理念引发共鸣。这并非倡导与闭源巨头脱钩,而是强调应用公司需要掌握模型定制能力:根据成本约束、响应速度和业务需求,决定哪些任务继续依赖通用模型,哪些场景值得投入后训练。当开源底座成为行业基础设施,真正的竞争焦点转向如何构建持续进化的工程体系——这个体系既要能捕捉用户反馈中的微妙需求,又要具备将业务洞察转化为模型优化的技术路径。











