Neon 和 Castform 两家公司联手干了一件让人重新打量"小模型"的事——用强化学习后训练了一个4B 参数的开源模型,在文档搜索任务上准确率不仅不低于 GPT-5.6Sol,甚至更高,而单次推理成本只有后者的约百分之一。
背后是对搜索范式的重新理解。目前文档检索主流做嵌入式搜索,把文档转成数值化向量再找相似内容,但随着 AI 智能体的普及,搜索流程正转向智能体式搜索:模型把大问题拆成多个小问题,自主决定搜索查询、检视结果、再发起下一轮搜索,循环往复直到集齐所需信息。这套思路能处理更复杂的问题,代价是每次搜索都要调一次高性能模型,耗时和成本都不低——按 Neon 给出的典型请求口径,GPT-5.6Sol 一次搜索请求耗时超10秒,成本约0.03美元。
Neon 和 Castform 各司其职:Neon 提供文档存储位置和搜索能力,Castform 负责训练模型判断"该搜什么"。训练用的是强化学习,模型先尝试完成任务,系统给结果打分,评分直接反馈进下一轮试验。评估维度不只看最终答案对错,还会看是否找到了正确文档、是否引用了合适段落。最终,Castform 后训练的模型在 Neon 的验证中拿到平均评估分1.447,超过 GPT-5.6Sol 的1.369,也高于作为对照的 GPT-5.4的1.377,刷新了该验证的最高纪录。
成本差才是真正的杀手锏:这个4B 小模型单次推理成本0.000929美元,而 GPT-5.6Sol 是0.087338美元,差了约94倍。用4B 参数吃掉 GPT-5.6Sol 级搜索精度,同时把推理开销压到几乎可以忽略不计,这对高度依赖反复调模型做多轮检索的智能体应用来说,意味的是单位成本结构被彻底改写。











