近期,大模型领域悄然兴起一股“匿名测试”风潮,两款神秘模型引发广泛关注与热议。一款名为Ox Alpha的匿名模型现身OpenRouter平台,因其出色表现迅速成为焦点。
Ox Alpha具备100万token上下文处理能力,支持文本、图片和视频输入,还能调用工具,且目前完全免费。上线后不久,开发者便将其接入编码Agent,投入真实代码仓库进行测试。初步结果显示,这款来历不明的模型,代码能力已接近当前顶级水平。
开发者Ben Davis从DeepSWE中抽取10项任务对Ox Alpha进行测试,它完成了其中8项,通过率达80%。在对比结果中,Fable 5 Max通过率为65%,GLM-5.3 Max和Grok 4.6 xhigh均为62%,GPT-5.6 Sol Max为52%。不过,由于10项任务样本量较小,后续其他开发者在另一组DeepSWE子集上测试,Ox Alpha结果约为63%,两次测试任务范围和运行配置不同,暂时无法确定其准确排名,但已初步展现出强大的长程编码潜力。
关于Ox Alpha的身份,目前众说纷纭,流传最广的说法是它属于智谱尚未发布的GLM-5.3 Flash,或GLM-5.3的多模态版本。有网友从多方面进行分析:在视频编码器方面,四段不同帧率、时长和分辨率的视频中,Ox Alpha消耗的视觉token与GLM-5V-Turbo完全一致,而MiMo、Qwen和GLM-4.6V结果明显不同;文本tokenizer也高度吻合,研究者测试25组提示词,Ox Alpha与GLM-5.3的token数量始终保持固定75 token差值;其他特征也指向智谱,如Ox Alpha拒绝处理音频,与GLM-5V的路由方式相同,回答风格、Agent执行步数和推理接口也很接近GLM,且智谱此前有用Pony Alpha匿名测试GLM-5的先例。Ben Davis认为99%确定这就是GLM-5.x,但截至目前,OpenRouter和智谱均未公开回应。
无独有偶,在Code Arena平台上,一款名为korrine的匿名模型也在接受测试。最初,不少人猜测它是Kimi K3.1,原因是Kimi K3发布前曾被认为以kivine的代号接受测试,kivine与korrine结构相近。不过,最早传播消息的爆料者随后补充称,此前获知的Moonshot新模型可能对应另一个代号adamant-ananke,korrine也可能来自Qwen等其他中国团队,评论区还有人将它指向MiMo V3,其身份同样扑朔迷离。
大模型厂商热衷于“挂马甲”进行匿名测试,背后有着多重考量。在Arena中隐藏厂商和型号信息,能削弱品牌带来的先入为主印象,用户只能依据实际输出进行选择,积累的对战结果更接近真实用户体验。OpenRouter提供的测试环境则不同,开发者将模型接入各种编码Agent,让其进入真实仓库,连续调用工具处理长达数小时的软件工程任务,上下文能否保持稳定、工具调用是否可靠、模型在长程任务中是否会循环或跑偏等问题,都能在高强度使用中迅速暴露。对模型厂商而言,这相当于一次公开压力测试,团队可提前观察失败案例,验证推理服务的承载能力,还能在正式发布前积累真实口碑。“猜模型”也逐渐成为一种营销手段,身份悬念能够拉长讨论周期。










