全球开源前二,阶跃终于回来了

引言
Step 5 Preview 把“阶跃”重新拉回了聚光灯下。它在 AAI 指数中拿到 44 分、位列全球开源前二,证明旗舰基座模型的能力上限并未因押注端侧与 Agent 而掉队。更关键的是:从只会“答题”的 Benchmark 模式,迈向能把一件复杂事“做成”的工程模式——这正是下一阶段模型竞争的真正赛道。
核心内容
1) 从规模竞赛到“能做成事”的范式切换
两年前,Step 1/1V/2 代表着“更大更强”的 Scaling Law 方向;过去一年,焦点转向多模态、端侧与 Agent。Step 5 Preview 的回归,意味着另一条线索开始清晰:顶级基座模型不仅比拼常规基准分数,更要在推理、规划、工具使用与长程执行上给出答案。44 分的成绩说明底座扎实,但真正的价值,是把这些能力转化为“可交付”的工程产物。
2) 一次长链路实测:从建模到可玩的 3D 网页游戏

一次具有代表性的测试,把任务放进真实生产链路:Claude Code CLI 作为 Agent 工作台,Blender 负责 3D 资产制作,Three.js/Vite 承担网页端呈现。目标是原创迷你游戏《星跃岛:能量快递》——在 Blender 中创建角色“菇噜”、6 个浮空平台、5 个能量球与终点信标,导出 .blend/.glb;随后在 Three.js 中实现移动/跳跃、坠落重生、收集计数、计时、重开与通关提示,并生成测试脚本与构建产物。
为了降低失败率,任务被拆成四个阶段:先做角色,再搭关卡,再导出资产,最后整合前端工程。Step 5 Preview 在每个阶段完成代码编写、工具调用、文件生成与调试,能根据中间结果持续修正,而无需推倒重来。最终产物是可运行的 Demo:角色与场景、碰撞与交互、资产与工程全部打通。虽然视觉与操控细节仍有粗糙之处,但它跨越了“能写段代码”的门槛,进入“能交付一个可玩的版本”的层级。
这背后折射出几项关键能力:
- 目标分解与层级规划:把复杂目标拆成可验证的里程碑
- 工具使用与文件系统操作:可靠地调用 Blender/CLI,正确产出 .glb/.log 等工件
- 上下文承接与容错:在错误与不确定性中继续迭代而非归零
- 工程化闭环:引入测试与构建,形成可再现、可验收的结果
3) 从基准到生产:长任务可靠性的真正考题

AAI 指数让模型获得“入场券”,而长链路任务决定能否“通关”。长任务的难点在于幂次衰减:若单步可靠率为 98%,经过 100 步后整体成功率可能只剩约 13%。因此,想把能力转化为生产力,必须在工程层面补齐“可靠性机制”:
- 可观测性与可追溯:标准化日志、工件与验收报告,便于回溯与定位
- 工具协议的确定性:通过结构化参数、Schema 校验与结果验证(如 GLB 合规检查),减少非确定性
- 计划-执行-反思:层级规划、检查点与回滚策略,避免全局重跑
- 测试优先与自动化门禁:在 npm test/build 等环节设置“硬闸”,把错误截留在早期
评测维度也应升级:不仅看题库分数,还要看端到端工件质量、复现稳定性、平均修复时间与资源开销。
影响与展望
- 对开发者:大模型从“代码补全器”进化为“全栈实习生”,能把创意快速变成资产与原型。IDE/CLI 与 DCC 工具(如 Blender)的深度集成,将成为新一代开发工作台的标配。
- 对行业:内容生产(游戏、影视、数字孪生)将显著提速;企业自动化从 RPA 走向 AgentOps;端侧模型与云端代理的协同,使低延迟与高能力兼得。
- 关键挑战:版权与风格一致性、物理与碰撞真实性、环境漂移下的脚本脆弱性以及工具调用的安全沙箱化,仍需系统性解决。
- 展望:Step 5 正式版若在推理、记忆与工具生态上继续加强,并引入更完善的可靠性指标与社区复现案例,开源前二将成为新起点。真正的竞争,将落在“可控、可复现、可度量的交付率”与“单位成果的总成本”上。
标签: 开源大模型 Agent 工具调用 生成式游戏 多模态