当前位置:首页 > AI资讯 > 正文内容

Spatial-TTT:流式空间记忆让小模型逆袭

admin1小时前AI资讯1

Spatial-TTT:流式空间记忆让小模型逆袭

引言

在文本时代,“拉长上下文”曾被视作万能钥匙:窗口越大,能读入的信息就越多。然而一旦走向真实世界的连续视频流,事情立刻变得棘手。具身机器人、自动驾驶与智能硬件面临的是无边界的动态输入:视角变化、遮挡频繁、几何线索依赖连续视差。单靠堆长序列,不仅算力与显存成本按平方级攀升,还会稀释注意力,导致关键时空证据丢失。清华、腾讯混元与南洋理工提出的 Spatial-TTT,正是在此背景下给小模型装上一套“流式空间记忆”,以小博大,在空间智能基准上超越了更大体量的模型。

核心内容

从拉长上下文到在线自适应:TTT 的空间记忆

流式视频与快权重在线更新的空间记忆示意

Spatial-TTT 的关键转向是:不再把推理阶段视为“参数冻结”的单向前向计算,而是引入测试时训练(Test-Time Training, TTT)作为在线记忆机制。具体做法是为部分网络层配置小型“快权重”,在视频流到来时通过自监督损失即时求梯度、在线更新。快权重相当于压缩、可写入的非线性记忆,使模型在不增加全局注意力开销的前提下,持续整合新帧的几何与时序线索,计算与存储随序列长度线性增长。

这类自监督目标可围绕“空间一致性”构建,例如:
- 多视角重投影/深度一致性:强制不同时间帧对同一空间点预测一致;
- 时序可逆性与遮挡恢复:利用前后帧互证,缓解短时遮挡带来的信息断裂;
- 几何先验正则:引导快权重承载3D关系而非噪声细节,降低漂移风险。

3:1 混合架构:保住语义,对准空间

三层TTT与一层锚点交织的解码器结构示意

纯 TTT 虽能省算,但会削弱多模态语义对齐与全局推理。Spatial-TTT 采用“3:1 层级交织”的混合设计:在解码器中,每四层里三层为 TTT 层,负责流式时空压缩与记忆写入;保留四分之一“全注意力锚点层”,维持图文对齐、长程逻辑推理与稳定的语义全局视野。

消融结果显示,若全部改为 TTT,综合表现会明显下降(例如在 VSI-Bench 上从约64%降至约54%,多选题准确率大幅下滑)。而保留25%锚点层后,既守住了预训练模型的语义根基,又让 TTT 在空间、时序维度发挥长项。据此,团队仅用约20亿参数的小模型,凭借流式空间记忆,在空间智能基准上超过了更大体量的通用模型(包括 GPT-5)——这正是“以小博大”的内涵:不是盲目扩参,而是让模型在推理时“会记、会变”。

工程落地:大块更新 + 滑动窗口

流式场景还需工程层面的平衡。逐帧更新虽连续,但 GPU 吞吐差;大批量更新高效,却打断局部因果。Spatial-TTT采取“两段式”策略:
- 大块更新:把视频切成较大的计算块,批量前向和梯度计算,充分利用并行度;
- 滑动窗口:块与块之间设置小幅重叠,保证连续几何线索与短时依赖不断裂。

配合低秩适配器等轻量快权重形式,KV Cache 不再随着时长平方膨胀,整体复杂度近似线性。同时,引入记忆衰减与重置策略,避免快权重在长时间运行中的漂移与灾难性遗忘。

影响与展望

Spatial-TTT 把“更长上下文”转化为“更强在线适应”,这是范式级的变化。对具身智能而言,模型不再被动堆帧,而是主动将过去凝结为可更新的空间记忆;对端侧设备而言,线性开销与块状并行意味着真正可在受限硬件上跑长时视频。

短期看,家庭服务机器人、巡检无人机、车载系统与AR眼镜都将直接获益:在有限算力下保持对环境的持续感知与稳定定位。中期看,这一思路可与经典 SLAM、NeRF/GS 等显式地图融合:显式地图提供可解释结构,TTT 负责快速适配与补全动态细节,二者优势互补。长期看,推理即适应的范式会走向更稳健的安全边界:需要在线更新的可追溯日志、可回滚机制与漂移检测;也需要更强的 OOD 防护与多代理共享记忆协议。

仍有开放问题值得关注:
- 快权重容量与鲁棒性的刻度:多大记忆足够、如何防过拟合与噪声放大;
- 自监督目标的选择与权衡:几何一致性、语义约束与任务奖励如何协同;
- 记忆生命周期管理:何时衰减、重置、合并与迁移,才能兼顾稳定与敏捷。

从“卷上下文”到“卷记忆结构”,Spatial-TTT 展示了空间智能的新路线:在合理的结构设计与工程取舍下,小模型也能把长时视频“记在心里”,并在真实世界的连续变化中做出可靠决策。

标签: 流式空间记忆 测试时训练 空间智能 具身智能 混合架构

相关文章

极氪8X量产中国首款Grok+FSD车型

从实验室到方向盘:中国首个“Grok+FSD”体验正式落地 2026年4月17日,极氪全新旗舰SUV极氪8X正式量产上市,一个更具里程碑意义的消息随之揭晓——搭载阶跃Step 3.5 Flash等核心...

Cursor 3重塑开发范式:智能体成代码主力

从“写代码”到“管智能体”:Cursor 3 如何重塑开发范式 当开发者还在适应 AI 辅助编程的“副驾驶”模式时,Anysphere 已经将 Cursor 推向了一个更激进的阶段——智能体优先。最新...

广州共识开启AI开源新纪元

开源共生:人工智能生态的“广州共识”开启新纪元 4月20日,广州的一场研讨会悄然点燃了人工智能开源生态的燎原之火。在广东省高级人民法院主办的“司法护航创新·开源共治共赢”主题研讨会上,来自全国24家人...

Token成本飙升,企业AI如何提升性价比

Token膨胀时代:企业AI转型的“性价比”新考题 过去一年,大模型推理成本每百万Token下降约75%,但企业Token消耗量的增长斜率却远超成本优化曲线。OpenRouter数据显示,截至2026...

库克卸任CEO转任执行董事长,苹果平稳过渡

苹果权力交接平稳过渡,库克称将长期担任执行董事长 4 月 21 日,苹果公司召开全体员工大会,即将于今年 9 月卸任 CEO 的蒂姆·库克罕见现身并回应了外界对其健康状况的关切。据彭博社报道,库克在会...

DeepSeek V4开源模型性能突破闭源垄断

打破闭源垄断,DeepSeek V4 开启国产大模型新纪元 在人工智能领域,闭源模型长期占据性能高地,开源阵营虽不断追赶,却始终难以触及顶尖水平。然而,这一格局正在被打破。4月24日,DeepSeek...

发表评论

访客

◎欢迎参与讨论,请在这里发表您的看法和观点。