据财经领域独家消息,人工智能大模型企业DeepSeek已正式启动第二轮融资计划,目标募资规模达500亿元人民币,投前估值跃升至约5000亿元。若融资顺利完成,该公司两轮累计融资额将突破千亿元大关。值得注意的是,今年6月其刚完成首轮500亿元融资,创下国内大模型领域单轮融资纪录,投后估值超3500亿元,短短两个月估值增幅达43%。
支撑其估值飙升的核心竞争力,源于该企业颠覆性的定价策略。权威测试机构Artificial Analysis近期发布的对比数据显示,在完成相同基准测试任务时,DeepSeek V4-Flash模型平均单次任务成本仅3美分,仅为Anthropic旗舰模型Claude Fable 5的百分之一,较GPT-5.6 Sol低98.4%。更令人瞩目的是,该模型在保持成本优势的同时,输出速度达113tokens/秒,较Claude Opus 5快53%,意味着完成相同任务时,竞品模型仅完成半数工作量。
这种极致性价比的实现,源于技术创新与架构优化的双重突破。V4-Flash模型虽拥有2840亿参数,但每次推理仅激活130亿参数(不足5%),配合自主研发的CSA(压缩稀疏注意力)与HCA(重度压缩注意力)混合架构,使百万token上下文场景下的单token计算量较前代降低90%,KV缓存需求减少93%。该架构模拟人类记忆规律,对近期信息保持高精度处理,对远期信息自动模糊化,显著提升长文本处理效率。
在模型训练方面,DeepSeek独创的两阶段后训练方法引发行业关注。第一阶段采用"分科培养"策略,针对数学、代码、指令跟随等细分领域训练专家模型,每个专家模型通过监督微调与GRPO强化学习(该算法省去传统PPO算法的价值函数模型训练环节)进行优化。第二阶段通过"融会贯通"策略,运用在线策略蒸馏技术将多领域能力整合至单一模型,确保模型在保持专业能力的同时实现跨领域通用性。测试数据显示,该方法使Terminal Bench 2.1测试得分从61.8分提升至82.7分,GitHub真实Issue解决能力基准测试得分暴涨645%。
这种技术突破正在重塑企业AI采购逻辑。Artificial Analysis提出的"每次任务成本"评估体系显示,某企业若每日处理100万次API调用,采用Claude模型年成本达1.13亿元,而使用DeepSeek仅需1095万元,成本差距超十倍。对于电商客服、代码审查等高频次场景,这种成本差异已构成生存级影响。Menlo Ventures调研显示,37%企业已在生产环境部署5个以上模型,LMSYS团队研究证实智能路由策略可在保持95%任务质量的前提下削减85%成本。
行业格局因此加速分化。Artificial Analysis绘制的模型性价比坐标系显示,DeepSeek V4-Flash正式版划定的"斩杀线"将全球70%现有模型纳入高成本低效区间。即便调整推理强度参数,仍有90%模型无法突破其性价比壁垒。更值得关注的是,该企业即将发布的V4-Pro旗舰模型配合自研Harness框架(该框架可优化Agent任务执行路径,减少token浪费),可能进一步抬高行业门槛。Harness内测参与者透露,该框架可使相同模型在任务成功率提升的同时,实际成本再降15%-20%。
这种技术-成本双重碾压正在催生"哑铃型"市场结构:少数旗舰模型专注极限智能场景,DeepSeek占据通用基础设施市场,中间层产品面临生存危机。某闭源模型厂商内部文件显示,其已调整战略方向,计划放弃中端市场,集中资源攻坚自动驾驶、生物医药等高价值垂直领域。行业分析师指出,当模型性价比差距突破数量级阈值时,技术迭代将不再是线性竞争,而是形成"赢家通吃"的生态重构。











