神秘“牛来大模型”Ox Alpha 火爆外网:实测超 Claude 与 GPT-5.6

AI趋势

8 月 20 日,AI 模型聚合平台 OpenRouter 悄然上线一款代号为 Ox Alpha 的匿名新模型。官方未披露开发方,仅将其描述为面向编码、长时间智能体任务和实际生产环境的前沿模型,免费调用期间已吸引大量开发者密集测试。

模型基本规格

公开参数并不多:

  • 上下文窗口:约 104.8 万 token
  • 最大输出长度:13.1 万 token
  • 输入模态:文本、图像、视频
  • 调用方式:预览期间免费
  • 配套容量:开源终端编程智能体 OpenCode 同步接入,并为其准备每日 100 万亿 token 的调用容量

跑分表现

上线数小时后,多位开发者展开密集测试。独立研究员 Ben Davis 选取软件工程基准 DeepSWE 中的 10 个子任务,Ox Alpha 的通过率约 80%,高于 Claude Fable 5 的 65%、GLM-5.3 与 Grok 4.6 的 62%,以及 GPT-5.6 Sol 的 52%。这组结果来自个人测试,DeepSWE 官方排行榜尚未收录 Ox Alpha。

对于一款上线不到 12 小时的匿名模型,这样的数据足以引发集体好奇:Ox Alpha 到底是谁家的?

社区的四类猜测

讨论初期,社区的猜测主要集中在四个方向:

  • 小米 MiMo:8 月 18 日小米 CFO 林世伟透露新一代 MiMo 正在训练,且小米今年 3 月曾以 Hunter Alpha 的名字匿名上线 MiMo-V2-Pro。
  • 智谱 AI:100 万 token 上下文、多模态输入和智能体定位,与智谱近来的模型路线接近;今年 2 月上线 OpenRouter 的 Pony Alpha 事后也被证实是 GLM-5。
  • 腾讯混元:有 Reddit 用户直接猜测是“HY 4”,理由是能撑起如此大规模免费调用的厂商并不多。
  • Google Gemini:百万上下文加原生视频输入的组合此前更常见于 Gemini 系列——但有测试者试图从 Ox Alpha 口中“套话”,问及身份时它自称为 Gemini;模型可能从训练数据、系统提示或对话上下文里生成看起来合理却完全失实的答案,同一个模型在不同问法下也常常反复横跳。

猜模型变成了一门技术

匿名可以隐藏品牌,却很难完全掩盖工程实现上的特征。社区判断模型身份的方式越来越技术化:

分词器指纹

每一款大语言模型处理输入时,都需先经过分词器把字符串切分成 token。不同厂商的词表和切分策略不同,面对同一段文本切出的 token 数也往往不同。一位分析者用 25 组不同提示词分别测试 Ox Alpha 和 GLM-5.3,发现两者的原始 token 数完全一致,只是 Ox Alpha 每次都会固定多出 75 个 token。

视觉编码器 token 预算

多模态模型处理视频输入时,会用一个视觉编码器把画面帧转化为 token,这一步消耗的 token 数由采样帧率、时长缩放系数、分辨率处理策略等多个独立设计决定。有人用四段参数固定的测试视频依次发送给 Ox Alpha 和各候选模型,结果显示 Ox Alpha 在四段视频上的视觉编码器净消耗与智谱的 GLM-5V-Turbo 完全一致,并同时匹配三个独立的编码器设计选择:帧率无关的采样、约每秒 147 token 的时长缩放、逐帧的分辨率缩放。

脏 token 碰撞

某些 token 由于在训练数据中出现频率低或分布异常,会成为模型的敏感点,不同模型家族的脏 token 分布也不相同。有测试者观察到,Ox Alpha 在同一批对抗字符串上的反应模式与 GLM-5.3 高度重合,与 Gemini、DeepSeek、Kimi 的匹配度仅为 18%~22%。

行为风格与执行节奏

Ox Alpha 在输出综合性回答时的 emoji 密度约为每千字符 1.3 个,与 GLM 系和 Qwen 系模型的典型风格(章节 emoji、红黄绿三色状态点、勾选列表)一致;Claude、GPT-5.6 和 Grok 在同类任务上的密度接近于零。DeepSWE 跑分也显示 Ox Alpha 平均每个任务执行 117 个智能体步骤,与 GLM-5.3 的排行榜数据(124 步)几乎一致,而 GPT-5.6 Sol 通常只用 61 步、Claude 系是 88~99 步。

排除法

小米 MiMo V2.5 的标志性能力是原生音频输入,反观 Ox Alpha 在音频请求上的拒绝方式与 GLM-5V 完全一致;DeepSeek 通常不绕弯子、直接开源权重;通义 Qwen 3.8 刚刚公开发布,编码器签名对不上;xAI、OpenAI、Anthropic、Gemini 等在分词器、风格、编码器等特征上也都不匹配。

综合以上证据,Ben Davis 推测 Ox Alpha 有约 99% 的概率属于智谱 GLM-5.x 系列,具体可能是多模态旗舰 GLM-5.3V(视觉版)或下一代 GLM-5.5;另一份独立分析给出的置信度约为 90%。

匿名通道:中国模型的出海标配?

Ox Alpha 是 OpenRouter 上线的第五款“Stealth Model”。此前几款最终公开身份的 OpenRouter 匿名模型,背后都来自中国团队:

  • Pony Alpha:今年 2 月上线,首日调用量达 400 亿 token,5 天后确认为智谱 GLM-5。
  • Hunter Alpha:3 月 11 日上线,具备万亿参数级规模和 100 万 token 上下文,一度被猜测为 DeepSeek V4,随后小米确认其为 MiMo-V2-Pro。
  • Elephant Alpha:4 月上线,主打效率的文本模型,约两周后由蚂蚁集团旗下 Inclusion AI 公布身份。
  • Owl Alpha:4 月底上线,主打智能体和工具调用能力,直到 6 月 30 日才正式确认来自美团,对应模型为 LongCat-2.0。

顺着这条线索再看 Ox Alpha:上次的马甲是“马”,这次是牛,无论从分类学还是“牛马”的隐喻来看都很合理。

为什么偏爱“假面舞会”?

匿名发布的好处首先是减少品牌本身对测试结果的影响——开发者不知道模型来自哪家公司,更容易直接根据实际表现作出判断。对于希望进入海外开发者市场的中国模型厂商来说,这种方式能降低新品发布时的品牌门槛,也更容易激发社区的测试和讨论。等到模型积累一定关注后再公布身份,相当于形成两轮传播:先讨论模型本身,再讨论背后的厂商。

匿名测试还有一个更实际的价值:获得真实使用环境下的反馈。开发者会把模型接入不同的编程工具、智能体框架和代码仓库,用它处理远比公开 benchmark 更复杂的任务——长上下文是否稳定、工具调用是否可靠、连续执行几十甚至上百步后还能不能保持目标,这些问题只有在大规模真实调用中才能暴露出来。OpenCode 此次宣称为 Ox Alpha 准备每日 100 万亿 token 的服务容量,也说明这轮测试规模并不小。

按照此前几款匿名模型的发布节奏,Ox Alpha 的免费测试可能在 8 月 27 日前后结束。现有技术分析普遍将它指向智谱 GLM 系列,更具体的猜测包括尚未发布的多模态旗舰模型,但在官方公布之前,这一判断仍只能算是推测。

参考资料

评论

登录后参与评论 登录

加载中…

返回 AI News