匿名牛来大模型被扒出智谱血缘,也有人怀疑Cursor拿开源GLM训的

引言
一个匿名却表现亮眼的多模态大模型,悄然在 OpenRouter 上线,引发全网“鉴定血统”的全民运动。社区把它称作“牛来大模型”(实际名为 Ox Alpha),凭借超长上下文、强代码与视频理解能力迅速出圈。随之而来的,是围绕其身世的两大猜想:智谱 GLM 系列与谷歌(尤其是 DeepMind 与尚未正式公开的 Gemini 3.5 Pro)。更有开发圈传言,部分产品可能借开源 GLM 体系做了私有训练或适配。围绕这场“模型取证”,可以看到方法论的成熟,也折射出当下大模型竞争的技术与策略博弈。
核心内容
线索一:Tokenizer 指纹与“固定偏移”

- 测试者在多组 Prompt 上对比 Ox Alpha 与多款模型的 token 计数,发现其与 GLM-5.3 呈现高度一致的关系。
- 一段混合中英、代码与 emoji 的文本,GLM-5.3/5.2 计算为 68 个 token,而 Ox Alpha 显示 143 个,恰好多出 75 个。这种稳定的“固定偏移”,很像在同一套分词器基础上,额外叠加了一段隐藏的系统提示(System Prompt)。
- 更系统的 25 组 Prompt 验证中,也出现类似的稳定偏移。这类证据通常被视为“工程指纹”:分词器(词表与切分算法)一旦定型,在特定文本上的 token 分布具有高度可重现性。
解读:分词器是模型家族的底层基因之一。相对回答风格、技能微调等“表层习惯”,tokenizer 的一致性更难伪装,因而具有较强指纹价值。“固定偏移”则暗示匿名模型在输入前增加了稳定长度的系统模板。
线索二:视频 token 预算与多模态编码

- 研究者用 4 段受控视频对比 Ox Alpha 与业界多款多模态模型,观察输入 token 的消耗曲线。
- 结果显示,Ox Alpha 与 GLM-5V-Turbo 的多项特征高度一致:视频时长每秒约增加 147 个 token;帧率变化对采样策略影响不大;分辨率变化呈现相同的 token 缩放方式。甚至在控制视频上的额外预算,逐项能对上。
- 同期对比的其他模型(如 MiMo、Qwen、GLM-4.6V 等)则表现出不同的预算策略。
解读:视频进入模型前的编码、采样与打包,是多模态系统的工程“黑箱”。预算曲线与缩放逻辑的重合,往往意味着编码管线、特征序列化协议乃至输入适配器的相近或同源,是比“回答风格”更难伪造的指纹。
线索三:API 服务层痕迹与历史背景
- 社区通过异常参数触发到报错信息,如 “[1210] The temperature parameter is illegal” 之类的编码与中英文混排格式,被指出与智谱相关服务风格相似。
- 还有用户称在推理输出中捕捉到“trained by Z.ai”残留,但目前多为截图与二手转述,证据等级显著低于 tokenizer 与视频预算测试,更适合当作彩蛋。
- 关键背景是 OpenRouter 过去曾匿名上线 Pony Alpha,最终揭晓其为 GLM-5 的早期版本。这让“智谱说”更显顺理成章。
解读:服务层报错属于“外观指纹”,容易被复用或快速修改,证据力弱于分词与多模态预算。但与既有历史相叠加,指向性加强。
另一派猜测:谷歌系与“迟到”的 Gemini 3.5 Pro
- 持谷歌猜想者主要基于 DeepMind 员工近期发言与 Gemini 3.5 Pro 尚未完整公开的时间窗口,结合 Ox Alpha 的长上下文与多模态表现。
- 不过,与 GLM 系列在中文理解、多模态工程实践上的现有共性相比,谷歌线索更偏舆情与时间点层面的揣测,硬证据不足。
番外:Cursor 与“开源 GLM 训出来”的猜想
- 开发工具圈长期存在“用开源底座+私有数据/技巧微调”的做法,GLM 开源系(不同尺寸、不同任务)具备被二次开发的技术可行性。
- 若产品选择与 GLM 家族 tokenizer/多模态管线保持兼容,的确会在分词统计、输入预算等处留下相似轨迹。
- 但要从“相似轨迹”直接推断“训练来源”,证据链仍不足。在闭源产品与开源底座之间,合规、许可与数据治理问题也需要更透明的披露。
影响与展望
对产业与发布策略
- 匿名灰度发布正在成为高端模型的“路测”模式:借 OpenRouter 这样的聚合平台,以海量真实任务测稳多模态与长上下文性能,再决定品牌化上线。
- Ox Alpha 在 OpenCode Go 上几乎不限量开放,外界甚至流传“日服务百万亿 token”的量级说法,暗示其后端算力与路由调度能力不俗。若属实,意味着国内外头部厂商都在加速“高吞吐、长上下文”的工程军备竞赛。
对技术方法与透明度
- “模型取证学”正在走向系统化:从 tokenizer 指纹、多模态预算曲线,到 API 报错与日志痕迹,社区已经形成一套可复现的方法论。
- 对厂商而言,提高模型卡透明度、明确 tokenizer/多模态接口、标注版本迁移日志,反而有助于建立信任,降低无谓猜测。对平台而言,匿名测试与合规披露需要更清晰的边界。
对开发者工作流
- 100 万+ token 上下文意味着“整库即上下文”的代码协作范式:无需频繁检索-聚合,直接在超长记忆中推理与编辑,更适合长周期 Agent 与复杂链路。
- 但成本、延时与“长上下文幻觉”的新问题也会出现。实践层面需要搭配结构化记忆、摘要刷新与检索校正,避免把超长上下文当作“无需工程化”的灵丹妙药。
- 匿名服务的风险在于可用性与兼容性的不确定性。对关键业务,最好保留回退路径与多模型路由策略。
竞争格局与下一步
- 若 Ox Alpha 最终被证实与 GLM 家族同源,这将是中文生态在多模态与长上下文上的一次有力示范,有望推动更多国际化落地与跨平台分发。
- 若另有其人,亦说明头部厂商在工程层面已达收敛:先进模型在 tokenizer、视频编码与 token 打包上的最佳实践,正在形成“行业共识”,这会加速产品迭代,也抬升基础设施门槛。
- 无论归属如何,可以预期未来数月将迎来更多“匿名-公测-官宣”的节奏,以及围绕视频理解、长周期 Agent 与开发工具链的密集竞争。
结语:当模型能力逐渐同代化,工程细节成为新的“差异化战场”。Ox Alpha 的这场“指纹追踪”,不仅是一次圈内猜谜,更是一堂关于透明度、方法论与工程化边界的集体课程。真正重要的,或许不是“它是谁”,而是“它把行业往哪里推”。
标签: 牛来大模型 GLM Tokenizer指纹 多模态 OpenRouter