当前位置:首页 > AI资讯 > 正文内容

Step 5:八分之一成本的主力模型

admin2小时前AI资讯8

Step 5:八分之一成本的主力模型

引言

一款面向真实世界任务的新一代基座模型正在把行业竞争焦点从“堆算力”转向“智能效率”。9月20日,阶跃星辰发布旗舰模型 Step 5 Preview,定位为可持续处理复杂任务的“主力工作模型”,在AA综合智能指数中进入全球开源前三,并宣布将于10月15日正式开源。更具冲击力的是,官方称其单任务成本约为 Claude Opus 5 的八分之一。这一组数据背后,映射出大模型从“更大”向“更省、更稳、更用得上”的范式迁移。

技术与架构:用稀疏激活把“能力密度”拉满

稀疏 MoE 架构与长上下文的概念图

Step 5 Preview 的技术画像很清晰:稀疏 MoE 架构、总参数量约 600B、激活参数仅 27B,支持 100 万 Token 的超长上下文,并原生支持文本与视觉输入。核心指向,是用“稀疏激活 + 长上下文 + 多模态”在成本受控的前提下,提升任务完成质量与范围。

  • 稀疏 MoE 的意义
    稀疏专家网络通过对每个Token仅路由少数“专家”,以较小的激活规模换取大容量参数空间。这种设计的价值不只是降本,更是“能力密度”的提升:在不同任务子域,专家集群可提供更合适的表征与推理路径,从而在复杂、异构场景中保持稳定输出。27B 的激活规模意味着推理成本接近单体 30B 级模型,但可调用的“潜在能力”则远超这一量级。

  • 100万 Token 长上下文
    对软件工程与专业知识工作,长上下文常常比“更强推理”更重要:它能把大型代码库、跨部门规范、审计报告、市场研究与图表直接纳入同一会话。长上下文并不等于一劳永逸,如何在百万级窗口内保持注意力衰减可控、关键信息高权重,是工程难点。Step 5 Preview 在此维度的落地,意味着更少的“拆分/检索”工程、更多的端到端推理与规划能力。

  • 原生多模态
    视觉理解的原生接入使其适配金融图表解读、产品文档与界面分析、图文并重的知识工作流。对Agentic场景而言,这让“观察—推理—行动”的闭环更完整,避免在多工具间频繁转换带来的性能损耗。

从 Step 3.5 Flash、Step 3.7 Flash 延续到 Step 5 Preview,可以看到厂商在“把计算转化为智能”的效率曲线上持续迭代:不是简单追求更大的 FLOPs,而是在路由、专家容量、对齐与工具调用中挖掘单位计算的边际收益。

面向 Agent 的能力:从“能写”到“能交付”

官方定位明确强调真实世界的 Agentic 任务。这一范式的关键,不只是语言生成质量,更是长程规划、工具协作、状态管理与稳健性。Step 5 Preview 的能力布局指向以下维度:

  • 长期规划与任务分解
    在复杂软件工程任务(特别是跨多模块、长时程的规划)与专业知识工作中,模型需要能生成可执行的计划、在执行中自检与纠偏,并在上下文内维护“项目态势”。百万上下文与稳健的规划策略,使其更适合跨天/周的持续任务。

  • 工具与函数调用
    面向工程与金融,函数调用/工具链接入是必备。关键在于:调用决策是否可解释、错误是否可快速收敛、跨工具的状态是否一致。MoE 结构在多子域任务上的“专家化”倾向,理论上有利于提升工具选择的准确性与一致性。

  • 专业工作流覆盖

  • 软件工程:仓库级代码检索与重构、跨语言迁移、CI/CD 配置与测试修复。
  • 专业知识:法规/合规审查、标准操作规程生成与对齐、科研文献综述与对比分析。
  • 金融场景:文本与图表混合的研报解读、策略归因分析、风控条款审阅与异常检测。

与“能写代码”的常规能力相比,“能交付”的关键是稳定性、可追踪性与成本控制。Step 5 Preview 的设计重心,正是将这些工程属性变成模型能力的一部分。

成本、效率与帕累托前沿:把“单位任务智价比”拉直

成本与智能效率帕累托前沿的抽象示意

AA 综合智能指数进入开源前三,说明其综合能力已可与一线开源阵营比肩。更具争议但也更有讨论价值的是“单任务成本为 Claude Opus 5 的 1/8”这一表述。抛开不同厂商的计费与硬件差异,讨论更有意义的指标是“单位任务智价比”——在给定预算下,能交付多少具备SLA的真实任务。

  • 稀疏 MoE 的经济性
    激活参数 27B 的推理负载,使其在企业级部署中更具可行性:
  • 更容易在中等规模集群上线,降低吞吐扩展门槛;
  • 在长上下文场景下,结合分块路由与高效KV缓存策略,整体成本可控;
  • 对比同等能力的致密大模型,MoE 架构在吞吐/延迟之间提供更具弹性的选择空间。

  • 帕累托前沿外推
    将 intelligence index 与单任务成本的平衡向外推,相当于让“同样的钱,买到更多可靠智能”。这不仅意味着单点能力强,还意味着在多场景、多时程任务上的稳定可用。对企业而言,关键不在峰值分数,而是“长期任务的交付曲线是否平稳”。从连续三代模型的策略来看,这条曲线正在变得更可预期。

  • 成本与风险提示
    长上下文并非万能解药:

  • 文档越长,错误聚焦与幻觉的风险也可能放大,需要在检索与长窗之间动态权衡;
  • MoE 的专家平衡与路由稳定依赖良好的训练与对齐,边界场景下仍需工程监控与回退策略。
    这类工程现实并不削弱其“智价比”的提升,反而提示采用方在部署时应将评测从“基准分数”扩展到“全链路SLA”。

开源与生态:把能力变成可复用的基础设施

正式开源的承诺意味着更多团队能够在相对低成本下获得强基座,并在此之上构建垂直能力。对生态的潜在推动包括:

  • 提升开源阵营的高端供给,缩小与闭源旗舰在复杂任务上的差距;
  • 促进工具链、Agent 框架与评测基准的“以终为始”迭代,围绕长时程任务与多模态场景重构范式;
  • 让中小团队以“开源基座 + 领域微调 + 工作流工程”的方式获得可交付的智能体系统。

如果开源不仅包含权重,还涵盖推理优化、长上下文策略与安全对齐细节,生态正反馈会更快,评测与生产的距离也会缩短。

影响与展望

Step 5 Preview 把“能力、成本、效率与场景覆盖”作为同一条曲线来优化,向外推动了行业的帕累托前沿。对于企业与开发者,这意味着:

  • 以可承受的成本上线可交付的 Agent,缩小从 Demo 到生产的落差;
  • 在长上下文与多模态驱动下,更多真实工作流可被端到端自动化;
  • 开源推进带来更丰富的工具链与评测方法,逐步以“智价比”和“SLA稳定性”作为核心指标。

仍需关注的挑战包括:长时程任务的鲁棒性边界、跨工具状态一致性、对齐与安全策略的可审计性,以及在高负载下的吞吐/延迟管理。但趋势已然清晰:下一阶段的竞争不再只比“更大”,而是比“更省、更稳、更可落地”。当“智能效率”成为主赛道,Step 5 Preview 这类面向 Agent 的主力工作模型,将成为企业智能化基础设施的重要一环。

标签: 大语言模型 MoE 长上下文 AI编程 开源模型

相关文章

上海发力新一代通用人工智能技术突破

上海加速布局人工智能新赛道:从技术攻关到产业落地的全面突围 在数字经济浪潮席卷全球的当下,人工智能已成为城市竞争的核心引擎。近日,上海市人民政府办公厅正式印发《国家数字经济创新发展试验区(上海)实施方...

AI主机一键部署龙虾,三年省48%成本

AI 边缘计算的“龙虾革命”:从云到端,成本与效率的博弈 当“一键部署‘龙虾’”成为AI主机的营销话术,我们意识到,AI的落地正从云端走向边缘,从抽象概念变为可触摸的生产力工具。4月22日,Think...

PPIO上线DeepSeek-V4:百万上下文AI新纪元

百万上下文时代到来:PPIO率先上线DeepSeek-V4,开源大模型迈入“即拿即用”新纪元 在AI大模型竞争日益激烈的当下,开源模型正以前所未有的速度推动技术民主化与产业落地。4月24日,DeepS...

华为乾崑2026技术大会:安全智能汽车新纪元

安全为锚,智能为帆:华为乾崑2026技术大会的深层启示 2026年4月23日,北京。当“安全有乾崑 安心赴美好”这句主题在华为乾崑技术大会的舞台上亮起时,一场关于智能汽车未来的技术浪潮正悄然掀起。这不...

轻舟智航迈向物理AI新纪元

从“无人驾驶”到“物理AI”:轻舟智航的范式跃迁 当整个行业还在为算力数字、激光雷达数量和城市NOA开通城市数“内卷”时,轻舟智航在北京车展首日完成了一次更具战略意义的转身——它不再只是一家自动驾驶公...

AI狂奔背后的能源与芯片挑战

当AI狂奔时,谁在托住它的“电”与“芯”? 在人工智能浪潮席卷全球的当下,技术的每一次跃迁都伴随着对底层基础设施的极致压榨。从大模型的训练到边缘设备的推理,AI正以前所未有的速度重塑世界,但其背后隐藏...

发表评论

访客

◎欢迎参与讨论,请在这里发表您的看法和观点。