10B击败200B!阶跃星辰10B视觉语言SOTA模型开源

简介: 阶跃星辰发布开源多模态小模型Step3-VL-10B,仅10B参数却媲美百亿级大模型,在视觉感知、逻辑推理、数学竞赛等任务中达同规模SOTA,支持端侧部署,推动智能终端交互革新。

性能超越 20 倍大模型,阶跃星辰多模态“小核弹” Step3-VL-10B 开源!

仅用 10B 参数量,Step3-VL-10B 在视觉感知、逻辑推理、数学竞赛以及通用对话等一系列基准测试中均达到同规模 SOTA 水平,并且解决了参数量小和智能水平高难以兼优的行业难题。

团队在多项关键评测中观察到,Step3-VL-10B 媲美甚至超越规模大 10-20 倍开源模型(如 GLM-4.6V 106B-A12B、Qwen3-VL-Thinking 235B-A22B)以及顶级闭源旗舰模型(如 Gemini 2.5 Pro、Seed-1.5-VL)。

基于这样一个小而强底座,原本只能在云端运行的复杂多模态推理(如 GUI 操作、复杂文档解析、高精度计数)能够下沉到手机、电脑甚至工业嵌入式设备中。

Base 和 Thinking 模型同时开源,欢迎下载体验!

  • 项目主页:https://stepfun-ai.github.io/Step3-VL-10B/
  • 论文链接:https://arxiv.org/abs/2601.09668
  • ModelScope:https://modelscope.cn/collections/stepfun-ai/Step3-VL-10B
  • HuggingFace:https://huggingface.co/collections/stepfun-ai/step3-vl-10b


10B参数,200B性能

Step3-VL-10B 具备三大核心亮点:

  • 极致视觉感知标杆:在同参数量级中展现出顶尖的识别与感知精度。通过引入 PaCoRe(并行协调推理) 机制,模型在复杂计数、高精度 OCR 及空间拓扑理解等高难度任务上的可靠性实现了质的飞跃。
  • 深层逻辑推演与长程推理:得益于规模化强化学习(RL)的持续迭代,Step3-VL-10B 在 10B 规模上实现了跨任务推理能力的阶跃。无论是竞赛级数学难题、真实编程环境还是视觉逻辑谜题,模型均能通过严密的多步思维链推导出最终答案。
  • 强大端侧 Agent 交互:基于海量 GUI(图形用户界面)专用预训练数据,模型能够精准识别并操作复杂界面,成为端侧 Agent 的核心引擎。

Step3-VL-10B 提供 SeRe(顺序推理)和 PaCoRe(并行协调推理)两种范式,在STEM 推理、识别、OCR & 文档、GUI Grounding、空间理解、代码等核心维度,都取得了千亿级别模型的优秀分数,PaCoRe范式表现更优。

1、STEM /多模态推理

STEM(科学、技术、工程、数学)与多模态推理(Multimodal Reasoning)是衡量模型“深度智能”的核心维度。

Step3-VL-10B 在 MMMU、MathVision 中超越 GLM-4.6V、Qwen3-VL 等模型。

2、竞赛数学

在数学维度上,Step3-VL-10B 表现尤其突出。在 AIME 25/24 等数学竞赛测试题上以几乎满分的成绩达到世界第一梯队水平。

这意味着 Step3-VL-10B 已具备了顶尖人类数学竞赛选手的思维能力,在逻辑严密性上甚至优于许多千亿级模型。


3、2D/3D空间推理

Step3-VL-10B 在多个空间推理基准中都表现出优异水平,尤其是在需要精细感知与复杂逻辑结合的 BLINK、CVBench、OmniSpatial 及 ViewSpatial 等测试中,其性能显著超越了同规模模型。


4、代码

在真实、动态编程环境下,Step3-VL-10B 超越诸多世界一流多模态模型。


真实案例

在真实使用场景中,Step3-VL-10B 的多模推理能力覆盖 GUI 感知、视觉识别和推理等。

  • 案例一:莫尔斯推理

  • 案例二:GUI 感知

  • 案例三:图推理

为什么能做到?三项关键设计

能够达到以上性能,得益于 Step3-VL-10B 在三方面独特设计:

1.全参数端到端多模态联合预训练:摒弃了传统分阶段冻结模块的训练范式,直接在 1.2T 高质量多模态数据集上进行全参数联合训练。这种方式实现了视觉特征与语言逻辑在底层语义空间的深度对齐,为模型构建了极致的感知能力与复杂的跨模态推理基石。

2.大规模多模态强化学习(RL)演进:率先将大规模强化学习引入多模态领域,历经超过 1,400 次迭代优化。模型在视觉识别、数理逻辑推理及通用对话等维度的能力均实现质的飞跃,且实验数据表明,模型性能仍处于上升通道,尚未触及饱和边界。

3.并行协调推理机制(PaCoRe):创新性地引入 PaCoRe 机制,支持推理阶段的动态算力扩展。通过并行探索多个感知假设并进行多维证据聚合,该机制显著提升了模型在竞赛级数学、复杂 OCR 识别、精准物体计数及空间拓扑推理中的准确度。

得益于“三位一体”架构,Step3-VL-10B 证明智能水平并不完全取决于参数规模。

依托更高质量、更有针对性的数据构建,以及系统化的后训练与强化学习策略,10B 级模型同样有能力在多项基准测试中与 10–20 倍体量的模型正面竞争,甚至实现反超

这也意味着:世界一流的多模态能力有望以更低成本、更少算力获得;与此同时,过去主要集中在云端超级智能将逐步向端侧下沉,推动终端走向“主动理解与可执行交互”,从而重塑人机交互体验。

目前,团队已开源 Step3-VL-10B(包括 Base 模型和 Thinking 模型),欢迎大家与团队讨论交流,也欢迎开源社区来微调模型,共同推动小模型实现智能跃迁!

点击即可跳转模型链合集~

https://modelscope.cn/collections/stepfun-ai/Step3-VL-10B

目录
相关文章
|
21天前
|
测试技术 API
小而强,GLM-4.7-Flash开源
GLM-4.7-Flash正式开源,30B总参、3B激活参数,兼顾性能与效率,支持免费调用。在编程、中文写作、翻译等多场景表现优异,已上线智谱平台,替代GLM-4.5-Flash,提供全新轻量化部署选择。
871 1
|
22天前
|
人工智能 决策智能
多智能体军事协同系统:智能化防务体系中的关键技术框架
多智能体军事协同系统是智能化防务的重要理论方向,通过分布式感知、决策一致与协同控制,构建高效、鲁棒的系统协同模型。本文从概念、技术基础到发展趋势进行系统解析,探讨其在提升整体作战效能、推动系统智能演进中的理论价值,为相关研究提供参考。(238字)
145 2
|
19天前
|
自然语言处理 监控 物联网
大模型微调参数设置 —— 从入门到精通的调参指南
本文系统解析大模型微调核心参数:学习率、批次大小、训练轮次、权重衰减、LoRA秩等的作用机制与设置技巧,结合LLaMA-Factory实战演示,帮助初学者避开“黑箱”误区,在有限算力下实现高效、稳定微调。
|
20天前
|
机器学习/深度学习 人工智能 JSON
大模型微调实战:从原理到落地的完整指南
本文系统讲解大模型微调的原理与实战,涵盖LoRA等高效方法,手把手教你用少量数据定制专属模型,结合数据准备、训练策略与效果评估,助力开发者低成本实现AI应用落地。
|
18天前
|
存储 人工智能 安全
推荐一款可以简单快速部署开源AI模型的桌面软件 Doo AI
Doo AI是一款简洁易用的开源AI模型本地部署工具,支持通义千问3/VL、LLaMA3.1等主流HF格式模型。下载即用,扫描→点击“加载”,可以快速、轻松完成部署;纯本地运行,隐私安全;支持文本对话、图像识别、RAG、角色提示词等实用功能。(239字)
301 4
推荐一款可以简单快速部署开源AI模型的桌面软件 Doo AI
|
23天前
|
机器学习/深度学习 安全 测试技术
美团 LongCat-Flash-Thinking-2601 发布,工具调用能力登顶开源 SOTA!
美团LongCat团队发布并开源LongCat-Flash-Thinking-2601,升级支持“重思考模式”,在智能体搜索、工具调用等任务中达开源SOTA。具备强泛化与抗噪能力,支持在线免费体验,助力开发者高效落地复杂应用场景。
171 1
美团 LongCat-Flash-Thinking-2601 发布,工具调用能力登顶开源 SOTA!
|
19天前
|
人工智能 搜索推荐 API
FlashLabs 正式发布 Chroma 1.0 - 全球首个开源、端到端、实时语音到语音 AI 模型 → 支持个性化语音克隆
FlashLabs 发布全球首个开源、端到端、实时语音到语音 AI 模型 Chroma 1.0,支持低延迟(TTFT \x26lt; 150ms)、高保真语音克隆与强对话能力,旨在成为 OpenAI Realtime API 的开源替代方案。
259 3
|
23天前
|
机器学习/深度学习 存储 人工智能
国内首个全国产化千亿参数细粒度 MoE:开源!
TeleChat3-105B-A4.7-Thinking,国内首个全国产化千亿参数细粒度MoE大模型,开源!代码、数学、Agent等多能力比肩头部,支持高效任务拆解与代码生成。
160 2
国内首个全国产化千亿参数细粒度 MoE:开源!
|
26天前
|
人工智能 机器人 程序员
去年我用一张Excel表"规划"学习,结果把自己逼进了ICU——直到我学会让AI帮我排兵布阵
本文以作者因"完美计划表"累倒入院的亲身经历切入,分享了一套让AI担任私人学习规划师的完整指令模板。通过"目标拆解""遗忘曲线复习""弹性时间"三大机制,解决目标模糊、复习逃避、计划崩溃等常见学习痛点,并提供上班族、学生、转行者三种典型场景的实战案例。
289 18
|
23天前
|
编解码 物联网 测试技术
FLUX.2-Klein 4B/9B开源:亚秒级统一图像生成与编辑
Black Forest Labs开源FLUX.2 [klein]模型家族,兼具文生图、图像编辑与多参考生成能力,端到端推理低至0.5秒,4B版本仅需13GB显存,支持消费级GPU高效运行,量化后速度提升最高2.7倍,Apache 2.0许可商用友好。
771 1

热门文章

最新文章