返回模型列表

Step 5 Preview深度评测:600B稀疏MoE旗舰,百万Token上下文与1/8成本优势

AI科技编辑部
RSS 订阅
Step 5 Preview深度评测:600B稀疏MoE旗舰,百万Token上下文与1/8成本优势 官方截图
(图片来源官方截图)

导读摘要:

Step 5 Preview是阶跃星辰(StepFun)推出的新一代旗舰基座模型,面向真实世界Agentic任务设计。该模型基于稀疏MoE架构,总参数达600B但每次推理仅激活27B参数,支持100万Token超长上下文窗口,并实现文本与视觉的原生多模态融合。在全球权威的Artificial Analysis Intelligence Index评测中,Step 5 Preview以44分位居开源...

1. Step 5 Preview是什么

Step 5 Preview是阶跃星辰(StepFun)推出的新一代旗舰基座模型,面向真实世界Agentic任务设计。该模型基于稀疏MoE架构,总参数达600B但每次推理仅激活27B参数,支持100万Token超长上下文窗口,并实现文本与视觉的原生多模态融合。在全球权威的Artificial Analysis Intelligence Index评测中,Step 5 Preview以44分位居开源模型前三,性能表现仅次于GPT-6 Astra和Claude Opus 5,单任务成本仅为后者的1/8。2026年10月15日将释放完整权重,成为开源社区中少数兼具旗舰级性能与高推理效率的基座模型。

step-5-preview 官网截图
图片来源为官方文章

技术定位与领域: 属于自然语言处理与多模态AI领域,定位于通用Agentic任务执行引擎,覆盖AI编程、金融分析、科研工程、前端开发等跨行业复杂场景。其在"能力—成本—效率"三角关系上的均衡表现,是区别于同类开源旗舰模型的核心特征。

研发背景: 由阶跃星辰(StepFun)团队开发,延续自Step 3.5 Flash的技术思路,核心命题聚焦于如何更高效地将计算转化为模型能力,通过架构设计持续将能力与成本的帕累托边界向外推进。

核心价值: 解决开源模型在长周期自主任务中"能力不足"与"成本过高"的双重痛点。模型可在24小时内持续执行复杂任务,如GPU内核优化、自动化后训练数据流程等,同时在单任务成本上达到仅为闭源旗舰Claude Opus 5的1/8,为企业和研究者提供了高性能、可负担的Agent基础设施。

技术特点: 亮点在于稀疏MoE架构(600B总参/27B激活)、100万Token上下文窗口、原生多模态输入处理以及自主"规划—执行—观测—修正"的Agentic工具调用闭环。这三项技术的组合使Step 5 Preview在长任务链中维持持久规划能力,并保持低成本推理。

2. 主要功能

  • AI编程与软件工程: 覆盖553个代码仓库、33种编程语言的Bug修复、功能开发、重构等真实开发任务,还能操作真实硬件设备进行超3小时的持续调试,在SWE-bench等编程基准中展现出接近专业开发者的任务完成能力。

  • 长周期自主任务执行: 可在24小时内持续执行复杂任务而不中断,例如从零优化GPU内核直至达到508 TFLOPS(超越Claude Opus 5的493 TFLOPS),并自动化后训练数据流程。这得益于100万Token上下文窗口对历史执行记录、工具返回结果和调试反馈的完整保留。

  • 前端与创意开发: 能调用Blender生成3D资产并接入Three.js交互应用,实现从自然语言描述到可视化交互原型的高效转换,极大缩短了设计与创意工作者的开发周期。

  • 金融分析与投资研究: 具备信息检索验证、企业估值建模、深度研究报告产出三类核心能力,并通过外部FrontierFinance评测验证。可面向投研人员提供金融数据核实、估值模型构建与研究报告生成等专业服务。

  • 超长上下文理解与追踪: 支持100万Token上下文窗口,可在长任务链中持续追踪上下文、多次调用工具完成交付,有效解决传统模型在长对话场景下的信息遗忘与任务漂移问题。

  • 原生多模态融合处理: 文本与视觉输入在同一基座中原生处理,模型既能理解文档、截图等视觉信息,也能生成和迭代视觉内容,为跨模态推理与多模态Agent任务提供统一基座支撑。

  • 硬件设备操作与调试: 具备自主阅读设备文档、操作串口和摄像头的能力,可根据真实硬件返回的报错持续修改代码直至任务完成,适用于嵌入式开发板调试与IoT设备验证场景。

3. 如何使用

  1. 在线体验: 访问Studio平台((链接待官方发布后更新) 5 Preview,适合快速验证模型能力与场景适配性。

  2. 国内API接入: 前往阶跃星辰开放平台((链接待官方发布后更新) Key后按官方接口文档调用Step 5 Preview。适合需要将模型集成到自身业务系统的企业开发者。

  3. 海外API接入: 海外用户可访问国际版开放平台((链接待官方发布后更新) Key后可集成到应用或Agent工作流中。注意国内与海外平台账号体系不互通,需分别注册。

  4. 配置Agent任务参数: 在API调用中,需显式设置长上下文参数(如max_tokens与上下文窗口大小)以及工具调用相关配置(tool_use参数),以激活模型的Agentic执行模式,从而支持编程、金融研究等复杂多轮任务。

  5. 环境兼容性验证: API方式接入无本地硬件要求,但需注意网络延迟与限流策略;若计划在本地私有化部署,需等2026年10月15日权重释出后,根据官方文档评估多卡推理集群配置(具体硬件清单待官方公布)。

  6. 最佳实践建议: 长周期任务中将任务拆解为阶段性子目标,配合工具调用反馈循环使用;在Agent场景中建议开启流式输出以实时观测模型决策过程;生产环境应配置错误重试机制与任务超时中断保护。

4. 优缺点分析

优点
性能与成本最优平衡: Artificial Analysis Intelligence Index达44分位居开源前三,单任务成本仅为Claude Opus 5的1/8,显著推进智能效率的帕累托前沿,是成本敏感型Agent场景的理想选择。
超长上下文窗口: 支持100万Token上下文,在数十小时的长任务链中完整保留历史记录并持续理解上下文,适合复杂多轮工具调用与长文档分析场景。
Agentic工具调用闭环: 具备自主"规划—执行—观测—修正"循环能力,可访问串口、摄像头、API等外部工具,根据真实环境返回的状态和报错持续修改代码直至任务完成。
多模态原生融合: 文本与视觉输入在同一基座中原生处理,支持文档、截图等视觉信息理解及视觉内容生成迭代,为跨模态Agent任务提供统一基座支撑。
持续长周期任务能力: 可在24小时内持续执行复杂自主任务,如GPU内核优化(508 TFLOPS超越Claude Opus 5)与自动化数据流程,展现持久规划和自我纠错能力。

5. 同类工具对比

对比维度 Step 5 Preview Claude Opus 5 GPT-6 Astra
研发方 阶跃星辰(StepFun) Anthropic OpenAI
模型架构 稀疏MoE(总参600B/激活27B) 未公开 未公开
Intelligence Index 44分(全球开源前三) 略高于Step 5 Preview 领先
单任务成本 基准成本(最低) 约为Step 5 Preview的8倍 约为Step 5 Preview的8倍
上下文窗口 100万Token 200K Token 400K Token(预估)
输入模态 原生文本+视觉 文本+视觉 文本+视觉+音频
长周期Agent任务 支持24小时持续执行 支持但持续时间短 未公布
开源情况 2026年10月15日释放完整权重 闭源,仅API 闭源,仅API

选型建议: 对于追求极致推理成本效率并需要超长上下文支持的企业级Agent应用,Step 5 Preview是目前开源体系中最具竞争力的选择,特别是在金融分析、科研工程、硬件调试等需要长时间自主迭代的领域。其1/8的单任务成本优势使得大规模并行Agent调度成为可能。

对于数据安全要求极高、必须完全私有化部署的机构,在当前Step 5 Preview权重尚未开放的时间窗口内,DeepSeek-V3(Apache 2.0许可)仍是可立即投入生产的最优开源替代方案。若团队预算充足且优先考虑全球最强性能表现而不计成本,可评估闭源的GPT-6 Astra与Claude Opus 5,但需接受10倍以上的单位任务成本差异。

6. 编辑总结

Step 5 Preview的发布标志着开源基座模型在"智能效率"这一维度上的重要进展。其核心创新在于通过稀疏MoE架构和大规模上下文窗口的组合,将旗舰级模型能力与极致推理成本同时纳入一个可实际落地的产品形态。600B总参数配合仅27B激活参数的设计,使模型在保持高性能的同时将单任务成本压缩至闭源竞争对手的1/8——这一差距在规模化Agent部署中意味着数量级的总体成本差异,具有真实的生产环境经济价值。

从技术演进脉络看,Step 5 Preview延续了阶跃星辰在Step 3.5 Flash阶段确立的"效率Scaling"路线,将优化目标从单纯的能力提升转向"能力—成本—效率"的多目标帕累托推进。这种思路符合行业从"参数竞赛"向"效率竞赛"转变的整体趋势,而模型在GPU内核优化(508 TFLOPS)、AIME24后训练(53.3%→60%,token消耗更少)等硬核任务上的实测表现,也验证了该技术路线的可行性。

需要理性看待的是,模型权重尚未开放、生态工具链处于早期阶段,当前只能通过API方式体验其能力。对于追求快速商业集成、希望以低成本获得长上下文Agent能力的开发团队,Step 5 Preview无疑值得尽快纳入技术选型评估;而对于有本地化部署刚需的用户,则需等待2026年10月15日权重释出后进一步验证部署可行性。

综合来看,Step 5 Preview具备较强的实用价值和差异化的市场竞争定位,其后续开源生态建设值得持续关注。

7. 应用场景

  • AI编程与软件开发: 日常承载代码编写、Bug定位修复、功能开发、重构及环境配置等任务,支持33种编程语言,覆盖553个代码仓库的真实开发需求,可作为开发者的主力编码辅助模型。其长上下文能力使多文件级代码库理解与修改成为可能。

  • 长周期科研与工程任务: 适用于GPU内核调优、自动化后训练数据流程、模型压缩等需要长时间连续运行和自主迭代的研究型工作。Step 5 Preview可24小时持续执行任务,并根据中间结果自适应调整策略,将研究人员从重复性调参工作中解放出来。

  • 硬件开发与嵌入式调试: 在ESP32开发板改造等IoT项目中,模型可自主阅读设备文档、操作串口和摄像头、根据真实硬件返回的报错持续修正代码,显著降低嵌入式开发者的调试负担。此项能力也适用于智能硬件产品原型的快速验证。

  • 金融分析与投资研究: 面向投研人员提供金融信息检索与验证、企业估值建模、深度研究报告撰写三类支撑能力,通过外部FrontierFinance评测验证了其在真实金融任务中的可用性,适合券商、基金及企业战略部门的智能化升级。

  • 前端与创意内容开发: 从网页界面设计、数据可视化开发到Blender 3D资产生成与Three.js交互应用搭建,设计创意工作者可通过自然语言描述驱动Step 5 Preview完成多步骤开发任务,实现从灵感到可交互原型的高效落地。

8. 常见问题FAQ

Q:Step 5 Preview与上一代Step 3.5 Flash有什么区别?
A:Step 5 Preview是定位旗舰的新一代基座模型,总参数从上一代的1T级别调整为600B稀疏MoE(激活27B),上下文窗口扩展至100万Token,并引入更强的Agentic工具调用闭环能力。在Intelligence Index上,Step 5 Preview(44分)显著高于Step 3.5 Flash,同时单任务成本维持在较低水平。

Q:模型声称支持100万Token上下文,实际使用中有性能下降吗?
A:根据官方公布的信息,Step 5 Preview在设计层面针对超长上下文进行了专门优化,能在长任务链中完整保留历史执行记录并持续理解上下文。但具体的长上下文衰减曲线尚未发布独立评测数据,建议在真实业务场景中通过压力测试评估。

Q:600B总参数量是否需要极高的硬件配置才能推理?
A:稀疏MoE架构下每次推理仅激活27B参数,因此实际显存和算力消耗远低于600B密集型模型。但在未开放权重的当前阶段,推理由阶跃星辰云端提供,用户无需自备硬件。待2026年10月15日权重释出后,本地部署的具体硬件需求需参考官方发布的部署文档。

Q:Step 5 Preview是否适合作为企业的私有化部署方案?
A:目前不适合。权重尚未开放,只能通过API方式使用,相关数据需经阶跃星辰云端处理。对于数据安全要求严格的企业,建议关注2026年10月15日权重开源后的部署可行性评估,或现阶段考虑DeepSeek-V3等已开放权重的开源替代方案。

Q:模型在金融分析方面的能力是否经过专业认证?
A:Step 5 Preview的金融分析能力覆盖信息检索验证、企业估值建模、深度研究报告产出三类,并通过外部FrontierFinance评测验证。但这属于第三方评测机构的验证,并非金融监管机构的官方认证,实际应用中仍需要专业人员的最终审核。

9. 项目地址

相关 AI 模型文章

DeepSeek Harness 桌面版评测:官方 GUI 客户端如何降低 Agent 使用门槛

DeepSeek Harness 桌面版评测:官方 GUI 客户端如何降低 Agent 使用门槛

DeepSeek Harness 桌面版是 DeepSeek 官方推出的图形化客户端,旨在为原本基于命令行的 DeepSeek Harness 框架提供可视化操作界面。用户登录 DeepSeek 账号或配置 API Key、选定本地工作区后,即可像使用普通桌面 AI 应用一样,以自然语言向 Agent 布置任务。该客户端支持标准、PTC、极简、创造四种工作模式,内置多 Agent 协作、语音输入、...

Step Code – 阶跃星辰开源的终端编程智能体深度评测

Step Code – 阶跃星辰开源的终端编程智能体深度评测

Step Code 是阶跃星辰推出的开源终端编程智能体,采用 MIT License 许可,允许开发者在终端环境中直接完成代码编写、调试、执行与交付的完整工作流。该智能体在 Terminal Bench 2.1 评测中以 80.9% 的通过率并列第一,且 Token 消耗为并列者中最低;在自建 Multi-Frame 长程基准中同样排名第一。Step Code 内置 StepPage 一键发布静态...

Claude Opus 5.5 深度评测:Anthropic 旗舰模型的编程效率与安全范式革新

Claude Opus 5.5是Anthropic于2026年6月推出的Claude 5.5系列首款旗舰模型,定位为面向企业级智能体编程、复杂知识工作与自动化业务流的高端AI模型。该模型在Terminal-Bench 4.0编程基准上取得66.4%的成绩,在GDPval-AA v2.1知识工作基准上达到1846 Elo,双双领先OpenAI同期旗舰GPT-6 Astra。除性能提升外,Opus 5...

GPT-6 Sol 深度评测:OpenAI 中高端大模型的性价比革新

GPT-6 Sol 是 OpenAI 推出的中高端大模型,源自 GPT-6 Astra 底座,将 Astra 的推理、编程、事实性与 Agent 能力下放至更低价层级。模型 API 定价为输入 2 美元、输出 10 美元每百万 token,较上一代降价 50%。模型 Agent 与编程表现接近 Claude Fable 5.1,单任务成本仅为其约十分之一,主打"单位智能成本"优势。

版权声明:本文部分内容由 AI 辅助生成并经人工校准,版权归本站所有,未经允许禁止任何形式的转载。