当前位置:首页 > AI资讯 > 正文内容

每题360美元!GPT-6打穿ARC-AGI-3

admin1小时前AI资讯4

引言

OpenAI 发布的 GPT-6 Astra 在 ARC-AGI-3 测试上接近满分,伴随的是“每题狂烧 360 美元”的高昂推理成本与“AGI 已至”的喧哗。是符号世界模型的技术飞跃,还是靠堆算力与工程技巧“刷分”?这一次,讨论的焦点不只是分数,而是智能的成色与可迁移性。

ARC-AGI-3:更像智商考核,而非套路刷题

ARC-AGI-3 被视为“AI 门萨考”,由一系列不断变化的图形/规则谜题构成,不提供可复用模板,也难以靠记忆题库取巧。模型需要在陌生环境下自行探索、抽象规则、规划操作路径,考察的是泛化推理与目标建模能力。相比传统基准,它更接近“见新题、立新模、当场解”的真实智力评估。

值得注意的是,GPT-6 Astra 相比上一代在该基准上从约三成多跃迁到近乎“打穿”,并在 96% 的关卡中操作效率优于人类,平均动作步数少约 51.7%。若这些能力具有广泛可迁移性,意义非凡。

符号世界模型:从像素到逻辑,到自造工具链

过去不少模型在这类任务上依赖“暴力试错”,把画面切成像素块胡乱尝试;即便走运过关,也谈不上理解。而 GPT-6 Astra 的关键在于“符号世界模型”:将环境抽象为清晰的逻辑符号与因果关系,再进行形式化推演与决策。

  • 自创 DSL 表达世界:进入新关卡后,先用专属代数符号系统记录隐含规则、对象状态与变换关系,把像素运动映射到坐标与约束,尽量消除自然语言的歧义。
  • 预写程序、脑内仿真:将“若按 A 左转 90 度”这类规则写成可执行的伪代码/脚本,在“虚拟沙盒”里先演练多步计划,校验闭环后再落子。这样能显著减少无效尝试。
  • 自建工具链:在允许代码执行的环境下,为特定关卡快速定制导航、碰撞/战斗规则模拟、巡逻路径预测等工具,形成闭环验证。据称,这些本由外部 harness 承担的工程能力,已部分内化到模型权重中,显著降低来回通信与延迟。

这套路线的价值在于:把“看见—理解—计划—验证—执行”做成高带宽、低歧义的闭环,避免被自然语言的模糊与纯像素的盲试束缚。符号世界模型因此被视为迈向高阶推理的必经之路。

分数爆表=AGI?“出题人泼冷水”的技术要点

当“AGI 已来”的口号在社交媒体刷屏时,ARC 方的声音却更为克制:高分并不自动等价于通用智能的全面达成,尤其在测试治理与资源约束不严格时。

关键质疑点在于:
- 计算预算与“钞能力”:每题 360 美元意味着重度测试时算力与搜索;若不与人类同尺标约束(时间、成本、可用工具),分数可比性有限。
- 工具与权重的边界:当模型可自写工具、运行代码,评分可能更多反映“工程外骨骼”的强度,而非纯粹的内在通用能力。
- 分布外鲁棒性:ARC-AGI-3 仍是规则明确、观测完备的栅格类任务。将其能力迁移到嘈杂传感、长尾不确定、高延迟反馈的真实场景(无人车、机器人、网络攻防)仍待证明。
- 可复现与可解释:近满分的背后,需要开放评测日志、限制外设与 API、归一化 compute 才能让同行审视“是否过拟合于评测协议本身”。

因此,与其说“AGI 已来”,不如说“符号化推理+内化工具”的范式打通了一条通往通用智能的更清晰路径,但距离全面通用仍隔着多维度的考验。

影响与展望

短期看,Astra 的范式对产品与研究的启示非常直接:
- 智能体落地:软件自动化、科研助理、网络安全防御等领域,将因“计划-仿真-执行”闭环而更稳健,特别是在陌生任务与快速定制工具上。
- 评测重构:未来基准应同时约束算力/时间/工具权限,强调跨模态、跨域迁移与对抗式出题,并公开审计轨迹,降低“刷分工程学”的空间。
- 安全与治理:当模型能快速自写并运行代码,符号化推理带来能力跃迁的同时,也放大了越权与误用风险;需要更细粒度的权限沙箱、策略验证与责任追踪。
- 成本与端侧:若更多 harness 能力被“权重化”,延迟与依赖将下降,为边缘部署打开可能;但要把“每题 360 美元”压到可用区间,还需在推理算法、缓存与蒸馏上深耕。

更长远地看,符号世界模型可能成为通用智能堆栈中的“中间件”:下接感知,上承规划,把概率学习与逻辑约束融合。真正的突破不在某一次“榜单封神”,而在穿越任务分布、约束资源、复杂反馈与安全边界后,仍能稳定、可解释、可控地解决开放世界问题。

标签: 符号世界模型 ARC-AGI 通用人工智能 AI评测 测试时算力

相关文章

PPHermes让AI Agent部署更便捷

云端智能新范式:PPIO 推出 PPHermes,让 Agent 部署触手可及 在人工智能技术迅猛发展的当下,AI Agent(智能体)正从实验室走向实际应用,成为提升生产力的重要工具。然而,对于大多...

字节跳动补强AI Agent底层架构

字节补上AI Agent的“底层骨架” 在AI大模型竞争进入深水区的2026年,人才争夺战早已不是简单的薪资比拼,而是战略卡位的关键一步。当DeepSeek前核心成员郭达雅的去向尘埃落定,字节跳动成为...

李力耘跨界加盟众擎加速具身智能发展

从自动驾驶到具身智能:李力耘的跨界跃迁与AI新赛道的加速 当人形机器人与自动驾驶在技术底层悄然交汇,一场关于“物理世界AI”的变革正在加速。4月21日,一则人事变动引发行业广泛关注:前小鹏汽车自动驾驶...

Hermes Agent:首个能自主成长的AI员工

一个会“长大”的 AI 员工:Hermes Agent 如何打破记忆与成长的边界 你是否有过这样的体验:花了一整个下午教 AI 助手理解你的项目结构、代码风格,甚至反复纠正它缩进用空格还是制表符。可第...

DeepSeek V4野心:从模型到生态的突破

从模型到生态:DeepSeek V4 的真正野心 当大多数大模型厂商仍在追逐参数规模与跑分榜单时,DeepSeek 的每一次发布都像一次冷静的提醒:技术的价值,最终要落回成本与可用性。 4月24日,D...

neueHCT品牌焕新:智驾新征程开启

从“大陆”到“新程”:neueHCT的品牌进化论 2026年北京车展的聚光灯下,neueHCT以一场名为「新大陆・新征程」的品牌焕新发布会,正式宣告其从“智驾大陆”迈向“智驾新程”的战略跃迁。这不仅是...

发表评论

访客

◎欢迎参与讨论,请在这里发表您的看法和观点。