每题360美元!GPT-6打穿ARC-AGI-3
引言
OpenAI 发布的 GPT-6 Astra 在 ARC-AGI-3 测试上接近满分,伴随的是“每题狂烧 360 美元”的高昂推理成本与“AGI 已至”的喧哗。是符号世界模型的技术飞跃,还是靠堆算力与工程技巧“刷分”?这一次,讨论的焦点不只是分数,而是智能的成色与可迁移性。
ARC-AGI-3:更像智商考核,而非套路刷题
ARC-AGI-3 被视为“AI 门萨考”,由一系列不断变化的图形/规则谜题构成,不提供可复用模板,也难以靠记忆题库取巧。模型需要在陌生环境下自行探索、抽象规则、规划操作路径,考察的是泛化推理与目标建模能力。相比传统基准,它更接近“见新题、立新模、当场解”的真实智力评估。
值得注意的是,GPT-6 Astra 相比上一代在该基准上从约三成多跃迁到近乎“打穿”,并在 96% 的关卡中操作效率优于人类,平均动作步数少约 51.7%。若这些能力具有广泛可迁移性,意义非凡。
符号世界模型:从像素到逻辑,到自造工具链
过去不少模型在这类任务上依赖“暴力试错”,把画面切成像素块胡乱尝试;即便走运过关,也谈不上理解。而 GPT-6 Astra 的关键在于“符号世界模型”:将环境抽象为清晰的逻辑符号与因果关系,再进行形式化推演与决策。
- 自创 DSL 表达世界:进入新关卡后,先用专属代数符号系统记录隐含规则、对象状态与变换关系,把像素运动映射到坐标与约束,尽量消除自然语言的歧义。
- 预写程序、脑内仿真:将“若按 A 左转 90 度”这类规则写成可执行的伪代码/脚本,在“虚拟沙盒”里先演练多步计划,校验闭环后再落子。这样能显著减少无效尝试。
- 自建工具链:在允许代码执行的环境下,为特定关卡快速定制导航、碰撞/战斗规则模拟、巡逻路径预测等工具,形成闭环验证。据称,这些本由外部 harness 承担的工程能力,已部分内化到模型权重中,显著降低来回通信与延迟。
这套路线的价值在于:把“看见—理解—计划—验证—执行”做成高带宽、低歧义的闭环,避免被自然语言的模糊与纯像素的盲试束缚。符号世界模型因此被视为迈向高阶推理的必经之路。
分数爆表=AGI?“出题人泼冷水”的技术要点
当“AGI 已来”的口号在社交媒体刷屏时,ARC 方的声音却更为克制:高分并不自动等价于通用智能的全面达成,尤其在测试治理与资源约束不严格时。
关键质疑点在于:
- 计算预算与“钞能力”:每题 360 美元意味着重度测试时算力与搜索;若不与人类同尺标约束(时间、成本、可用工具),分数可比性有限。
- 工具与权重的边界:当模型可自写工具、运行代码,评分可能更多反映“工程外骨骼”的强度,而非纯粹的内在通用能力。
- 分布外鲁棒性:ARC-AGI-3 仍是规则明确、观测完备的栅格类任务。将其能力迁移到嘈杂传感、长尾不确定、高延迟反馈的真实场景(无人车、机器人、网络攻防)仍待证明。
- 可复现与可解释:近满分的背后,需要开放评测日志、限制外设与 API、归一化 compute 才能让同行审视“是否过拟合于评测协议本身”。
因此,与其说“AGI 已来”,不如说“符号化推理+内化工具”的范式打通了一条通往通用智能的更清晰路径,但距离全面通用仍隔着多维度的考验。
影响与展望
短期看,Astra 的范式对产品与研究的启示非常直接:
- 智能体落地:软件自动化、科研助理、网络安全防御等领域,将因“计划-仿真-执行”闭环而更稳健,特别是在陌生任务与快速定制工具上。
- 评测重构:未来基准应同时约束算力/时间/工具权限,强调跨模态、跨域迁移与对抗式出题,并公开审计轨迹,降低“刷分工程学”的空间。
- 安全与治理:当模型能快速自写并运行代码,符号化推理带来能力跃迁的同时,也放大了越权与误用风险;需要更细粒度的权限沙箱、策略验证与责任追踪。
- 成本与端侧:若更多 harness 能力被“权重化”,延迟与依赖将下降,为边缘部署打开可能;但要把“每题 360 美元”压到可用区间,还需在推理算法、缓存与蒸馏上深耕。
更长远地看,符号世界模型可能成为通用智能堆栈中的“中间件”:下接感知,上承规划,把概率学习与逻辑约束融合。真正的突破不在某一次“榜单封神”,而在穿越任务分布、约束资源、复杂反馈与安全边界后,仍能稳定、可解释、可控地解决开放世界问题。
标签: 符号世界模型 ARC-AGI 通用人工智能 AI评测 测试时算力