Spatial-TTT:流式空间记忆让小模型逆袭

引言
在文本时代,“拉长上下文”曾被视作万能钥匙:窗口越大,能读入的信息就越多。然而一旦走向真实世界的连续视频流,事情立刻变得棘手。具身机器人、自动驾驶与智能硬件面临的是无边界的动态输入:视角变化、遮挡频繁、几何线索依赖连续视差。单靠堆长序列,不仅算力与显存成本按平方级攀升,还会稀释注意力,导致关键时空证据丢失。清华、腾讯混元与南洋理工提出的 Spatial-TTT,正是在此背景下给小模型装上一套“流式空间记忆”,以小博大,在空间智能基准上超越了更大体量的模型。
核心内容
从拉长上下文到在线自适应:TTT 的空间记忆

Spatial-TTT 的关键转向是:不再把推理阶段视为“参数冻结”的单向前向计算,而是引入测试时训练(Test-Time Training, TTT)作为在线记忆机制。具体做法是为部分网络层配置小型“快权重”,在视频流到来时通过自监督损失即时求梯度、在线更新。快权重相当于压缩、可写入的非线性记忆,使模型在不增加全局注意力开销的前提下,持续整合新帧的几何与时序线索,计算与存储随序列长度线性增长。
这类自监督目标可围绕“空间一致性”构建,例如:
- 多视角重投影/深度一致性:强制不同时间帧对同一空间点预测一致;
- 时序可逆性与遮挡恢复:利用前后帧互证,缓解短时遮挡带来的信息断裂;
- 几何先验正则:引导快权重承载3D关系而非噪声细节,降低漂移风险。
3:1 混合架构:保住语义,对准空间

纯 TTT 虽能省算,但会削弱多模态语义对齐与全局推理。Spatial-TTT 采用“3:1 层级交织”的混合设计:在解码器中,每四层里三层为 TTT 层,负责流式时空压缩与记忆写入;保留四分之一“全注意力锚点层”,维持图文对齐、长程逻辑推理与稳定的语义全局视野。
消融结果显示,若全部改为 TTT,综合表现会明显下降(例如在 VSI-Bench 上从约64%降至约54%,多选题准确率大幅下滑)。而保留25%锚点层后,既守住了预训练模型的语义根基,又让 TTT 在空间、时序维度发挥长项。据此,团队仅用约20亿参数的小模型,凭借流式空间记忆,在空间智能基准上超过了更大体量的通用模型(包括 GPT-5)——这正是“以小博大”的内涵:不是盲目扩参,而是让模型在推理时“会记、会变”。
工程落地:大块更新 + 滑动窗口
流式场景还需工程层面的平衡。逐帧更新虽连续,但 GPU 吞吐差;大批量更新高效,却打断局部因果。Spatial-TTT采取“两段式”策略:
- 大块更新:把视频切成较大的计算块,批量前向和梯度计算,充分利用并行度;
- 滑动窗口:块与块之间设置小幅重叠,保证连续几何线索与短时依赖不断裂。
配合低秩适配器等轻量快权重形式,KV Cache 不再随着时长平方膨胀,整体复杂度近似线性。同时,引入记忆衰减与重置策略,避免快权重在长时间运行中的漂移与灾难性遗忘。
影响与展望
Spatial-TTT 把“更长上下文”转化为“更强在线适应”,这是范式级的变化。对具身智能而言,模型不再被动堆帧,而是主动将过去凝结为可更新的空间记忆;对端侧设备而言,线性开销与块状并行意味着真正可在受限硬件上跑长时视频。
短期看,家庭服务机器人、巡检无人机、车载系统与AR眼镜都将直接获益:在有限算力下保持对环境的持续感知与稳定定位。中期看,这一思路可与经典 SLAM、NeRF/GS 等显式地图融合:显式地图提供可解释结构,TTT 负责快速适配与补全动态细节,二者优势互补。长期看,推理即适应的范式会走向更稳健的安全边界:需要在线更新的可追溯日志、可回滚机制与漂移检测;也需要更强的 OOD 防护与多代理共享记忆协议。
仍有开放问题值得关注:
- 快权重容量与鲁棒性的刻度:多大记忆足够、如何防过拟合与噪声放大;
- 自监督目标的选择与权衡:几何一致性、语义约束与任务奖励如何协同;
- 记忆生命周期管理:何时衰减、重置、合并与迁移,才能兼顾稳定与敏捷。
从“卷上下文”到“卷记忆结构”,Spatial-TTT 展示了空间智能的新路线:在合理的结构设计与工程取舍下,小模型也能把长时视频“记在心里”,并在真实世界的连续变化中做出可靠决策。
标签: 流式空间记忆 测试时训练 空间智能 具身智能 混合架构