9 月 20 日,上海大模型公司阶跃星辰发布新一代旗舰基座 Step 5 Preview:总参数量 6000 亿,每生成一个词元只激活 270 亿参数,支持 100 万 token 上下文,原生吃文本和视觉两种输入。在 Artificial Analysis 的 Intelligence Index 里拿到 44 分,进入全球开源模型前三;而最抓人眼球的是成本——官方测算单任务成本约为 Claude Opus 5 的 1/8,定价每百万 token 输入 7 元、输出 20 元。模型已全面开放第三方接口,完整权重定档 10 月 15 日开源

这不是又一颗"参数更大"的卫星,而是国产旗舰第一次把"稀疏激活"这件事做得足够成熟,以至于能把推理成本压到闭源第一梯队的一个零头。

6000 亿总参,为什么只唤醒 4.5%?

MoE(混合专家)的核心思想并不新鲜:模型由很多个"专家"子网络组成,每次推理只让少数几个专家工作,其余沉睡。总参数量决定了模型"知道多少",激活参数量决定了"算得有多贵"。Step 5 的 6000 亿总参对位的是闭源旗舰的体量,但 270 亿激活意味着每一次前向,真正参与计算的参数只有 4.5%。

这个配比的精妙之处在于:它用"大底座 + 小激活"同时保住了两件事——知识的广度和推理的便宜。阶跃并没有在公开材料里披露专家数量和路由策略的细节,但从激活比例反推,其稀疏度已经玩到了相当激进的程度。换句话说,Step 5 敢把成本打到 1/8,底气不是砍能力,而是唤醒得足够少。

横向看,44 分的 Intelligence Index 与 Kimi K3 处在同一档,但 Step 5 的参数规模大约只有后者四分之一。同等智能水平下更省,这正是稀疏架构想要的结果。

1/8 的成本,意味着什么

先说清楚"1/8"是怎么来的。对比锚点是 Claude Opus 5——Anthropic 的闭源旗舰,企业级定价高昂。Step 5 的单任务成本官方给到约 0.71 美元,而同等复杂度的 Opus 5 任务要高出一个数量级。对开发者来说,这不是"便宜一点",而是"能不能把 Agent 跑在成本模型里"的差别。

一个有意思的信号是定价策略:输入 7 元、输出 20 元每百万 token,直接对位国产头部模型的高峰时段价格。这说明阶跃并没有走"低价亏本换份额"的极端路线,而是把稀疏架构省下来的钱,一部分让给用户、一部分留在毛利里。对一家要证明 PMF(产品市场契合)的模型公司,这种定价比"免费"更健康。

更关键的是 Agentic 任务的适配。Step 5 重点瞄准编程(SWE-bench)、软件工程、金融等需要多步工具调用的场景——这些场景 token 消耗大、调用频次高,成本曲线每降一档,落地可行性就上一个台阶。

开源权重,是赌注也是底气

10 月 15 日开源完整权重,是这则新闻里最重的注脚。开源意味着三件事:

第一,榜单跑分和独立复测是两回事。44 分是厂商方在 Artificial Analysis 上的成绩,社区拿到权重后会用自己的任务重新测。阶跃敢开源,等于把验证权交出去——这在国产旗舰里是少见的态度。

第二,开源能换粘性。模型公司的护城河正在从"参数多大"转向"生态多厚"。权重开放后,云厂商、私有化部署、二次微调都会围绕 Step 5 长出工具链,这种绑定比 API 调用更牢。

第三,它把"国产开源前三"的牌打到了桌面。在 GLM-5.3、Qwen 系列之外,Step 5 补上了又一个能打的开源旗舰,国产模型在开源榜单的存在感进一步集中。

冷静的判断

需要泼一点冷水:Preview 阶段不等于成品,很多能力要等 10 月权重开源后才有定论。稀疏 MoE 的路由质量、长上下文下的事实一致性、视觉输入的细粒度理解,这些都不会写在发布稿里,要靠社区的真实负载去压。

另外,"1/8 成本"是官方在自家任务上的测算,落到你的业务里未必是整齐的八分之一——激活参数省的是算力,但 KV cache、上下文长度、工具调用次数照样花钱。把它当成"上限参考"更稳妥。

但方向是清楚的:当国产旗舰能把 6000 亿参数的智能,装进 270 亿激活的推理账单里,前端模型的竞争就从"谁更聪明"切到了"谁更划算"。这一步,Step 5 走得相当实。