当前位置:首页 > AI资讯 > 正文内容

17比特到2MB:隐空间直连让4B爆分

admin5小时前AI资讯3

17比特到2MB:隐空间直连让4B爆分

引言

一边是能在手机上跑的 4B 小模型,一边是云端 753B 级别的巨无霸;中间没有文本接力,只有“隐空间”的直接对话。结果,在 ARC-AGI 3 这类强调系统性推理的评测上,小模型在桥接方案加持下“爆分”,追平了原本望尘莫及的性能区间。这背后的团队给出了一个尖锐判断:多模型协作长期以来都在用极其低效的方式交流——只用下一个 token 这区区十几比特的信息,而丢掉了中间层里以兆字节计的深层计算。

这一次,核心创新不在于训练出更大的模型,而是搭建了一座“桥”:让大模型把尚未说出口的内部状态,直接传给小模型使用;大模型负责理解,小模型负责落笔,成本却被压到了令人意外的水位。更耐人寻味的是,团队成员中出现了菲尔兹奖得主的身影——“在两个模型之间找到数学上的共同基础其实非常困难”。这句话点出了技术的真正难点:两个异构模型的表示空间如何对齐,如何安全、稳定、高效地传递“思考的中间产物”。

17 比特 vs 两兆字节:被忽视的“隐形通道”

隐空间高带宽与 token 瓶颈的抽象示意

当一个大模型生成下一个 token 时,内部会构建上百个隐藏向量,累计约百万个数值,信息量以两兆字节计;但最终对外输出,只是从十几万词表里采样出的一个 token,信息量大约 17 比特。其余隐空间的丰富结构被抛弃,再也不被利用。

  • 可解释性研究的启示:在输出出现之前,模型内部常已形成明确的“未说出口”的表征。比如在选词前几个 token,正确的词项、韵脚、语法选择已在隐空间中“成形”。这意味着,文本只是深层计算的投影,而非计算本身。
  • 多模型协作的现状:多数系统通过“文本”沟通——无论是子智能体、模型委员会,还是路由与编排,信息带宽都被限制在 token 输出这一窄口。
  • 直接后果:当一个模型想把“推理链”和“局部计划”移交给另一个模型时,最核心的计算被压缩成了极度稀疏的离散符号,信息损失巨大。

换言之,长期以来的模型协作像是用电报传输交响乐的谱子——听众拿到的是简谱,而不是正在回响的乐音与音色。Mostik 的“桥”试图改写这个前提。

架桥:大模型只“预填充”,小模型来“落笔”

大模型预填充经桥传递隐状态到小模型的流程示意

桥的思想很直接:让发送方模型把自己的隐藏状态经过一个小型、可训练的“桥”变换后,直接喂给接收方模型使用;两个大模型本体权重冻结,只有桥被训练。演示中,大模型是 GLM-5.2(753B),小模型是 Qwen-3.5(4B,手机可跑)。流程具有几个关键设计点:

  • 早交接、免文本:大模型读取输入,进行一次性“预填充”(prefill),但不解码、不输出任何文字;隐空间状态穿过“桥”传给小模型。小模型据此完成后续解码与答案生成。
  • 成本杠杆:推理中最贵的是“逐 token 解码”,而“预填充”相对便宜。让大模型只做预填充,把昂贵的生成交给便宜的小模型,云侧成本被压到原本的约二十分之一。
  • 性能收益:在多项测试中,小模型在桥加持下可弥补与大模型约 50% 的性能差距,自身准确率提升约 25%;在难题子集上提升可达 2 倍。若用传统方案达到同等成绩,需要上马一个中等规模模型,而桥方案只需其约 2/5 的计算成本。
  • 早期最优:当“交接点极早”时,文本接力尚无内容可传,但隐空间里已积累了大量与问题处理相关的信息。桥正是把这些“未说出口”的计算交接出去。

从系统角度看,这像是一种“隐空间蒸馏”的在线版本:不去重训接收模型,而是在运行时提供强模型的思考中间态作为条件,显著提升小模型的即时能力。

难点何在:对齐两种表示空间的“共同基础”

“在两个模型之间找到数学上的共同基础其实非常困难。”这不是客套,而是核心挑战。不同模型在架构、预训练目标、词表、层数、归一化与位置编码等方面存在系统差异,导致隐空间的几何结构、尺度与统计性质并不一致。要把发送方的状态注入到接收方并被“正确理解”,至少要解决三类问题:

  • 表示几何对齐:隐藏状态可能位于不同的流形与子空间,线性映射未必足够,非线性桥如何在保证稳定性的同时保留任务相关结构?常见的思路包括子空间投影、正交对齐、对比学习与互信息最大化等。
  • 时序与语义同步:大模型的预填充进度、注意力分布与局部计划如何与小模型的解码步同步?桥是否直接生成接收方的 KV-cache、残差流或中间激活?如何避免相位漂移与累积误差?
  • 安全与鲁棒性:隐空间携带强表达能力,同时也是潜在的“越权通道”。如何在不泄露训练数据与安全约束的情况下传递“有用且必要”的计算?如何防止被对抗攻击利用?

在只训练“桥”、冻结两端模型的前提下,上述目标更难:桥既要学会“翻译”语义,又要学会“接入”工程接口。团队中有顶尖数学家参与,某种程度上也印证了这里面存在非平凡的几何与统计对齐问题。

和现有多模型协作的差异与边界

  • 与文本接力/委员会:后者依赖离散 token 交流,带宽低、噪声大;桥提供连续隐空间的高带宽信道,信息更接近“思考过程”本身。
  • 与传统蒸馏:离线蒸馏把能力“烙进”学生模型权重;桥是在线、条件化的能力注入——小模型在任务时刻“借力”而非永久继承。
  • 与推测解码(speculative decoding):推测解码是加速同一模型族的生成;桥关注跨模型、跨架构的能力转移,可与推测解码叠加。
  • 潜在边界:跨厂商、跨架构的通用性仍待验证;隐空间带宽与网络传输成本需权衡;当任务强依赖长链推理且上下文动态刷新时,桥的持续同步策略与误差控制仍是开放问题。

影响与展望

这一方案直指“设备-云协同”的新范式:大模型做理解与规划的重活,但只承担便宜的预填充;终端小模型负责生成与交互。未来可能的方向包括:

  • 隐空间 API 标准化:若隐状态交换成为常态,行业或将探索“隐空间协议”(类似 ONNX 之于算子),定义可互操作的 KV-cache/残差接口与安全边界。
  • 训练与部署的新工艺:出现专门的“桥训练”流水线,包含表征对齐、时序同步、压缩编码与噪声鲁棒;在推理侧引入隐状态压缩与纠错编码,降低带宽需求并提升稳定性。
  • 安全与合规:隐空间可能包含对齐与安全相关信号,也可能被用作旁路通道。需要开发可审计的桥、可控的信息泄露上限与对抗防护机制。
  • 多模态与跨语言:把视觉/音频模型的隐空间注入文本小模型,或跨语言对齐,形成“通用理解 + 轻量生成”的组合式智能体。
  • 经济与能耗:若云侧解码被大幅削减,能耗与延迟可显著下降,进一步释放端侧计算潜力,推动“轻端 + 强云”的规模化落地。

过去十年,模型能力的提升大多来自“更大、更久、更贵”的训练;而这次的信号是:把模型之间的“语言”从文本切换到隐空间,也许同样能带来数量级的效率与效果提升。若桥的工程方法被证实可复制、可工业化,协作式智能的下一个拐点,或许不是更大的参数,而是更高效的“共同基础”。

标签: 大语言模型 隐空间通信 设备云协同 模型对齐 ARC-AGI

相关文章

字节跳动补强AI Agent底层架构

字节补上AI Agent的“底层骨架” 在AI大模型竞争进入深水区的2026年,人才争夺战早已不是简单的薪资比拼,而是战略卡位的关键一步。当DeepSeek前核心成员郭达雅的去向尘埃落定,字节跳动成为...

AI编程助手竟成黑客入口

当AI开始“听话”:一场由PR标题引发的安全风暴 在AI编程助手逐渐渗透开发流程的今天,我们正面临一个令人不安的现实:最危险的攻击,可能不是来自代码本身,而是来自一条看似无害的Pull Request...

智能体时代的安全挑战与破局之道

智能体时代的安全挑战与破局之道 人工智能的发展正迎来关键转折点。从“能对话”的大模型,到“能执行”的智能体,技术的演进不仅改变了人机交互的边界,更深刻影响着产业形态与组织逻辑。在4月19日召开的中国互...

GPT-5.5重塑工作范式:智能跃迁新纪元

智能的跃迁:GPT-5.5如何重塑工作范式 当一位英伟达工程师在短暂失去GPT-5.5访问权限后,用“像被截肢”来形容那种感受时,这已不再是简单的工具依赖,而是一种认知延伸的断裂。2026年4月,Op...

OpenAI七周一更重塑AI竞争格局

七周一更,OpenAI 的“节奏霸权”正在重塑 AI 竞争格局 七周,一个版本。当 OpenAI 在 4 月 23 日发布 GPT-5.5(内部代号“Spud”)时,距离 GPT-5.4 的亮相仅过去...

PPIO上线DeepSeek-V4:百万上下文AI新纪元

百万上下文时代到来:PPIO率先上线DeepSeek-V4,开源大模型迈入“即拿即用”新纪元 在AI大模型竞争日益激烈的当下,开源模型正以前所未有的速度推动技术民主化与产业落地。4月24日,DeepS...

发表评论

访客

◎欢迎参与讨论,请在这里发表您的看法和观点。