计算巢支持一键部署MiniMax M3

简介: MiniMax-M3是稀宇科技开源的国产大模型,全球首个融合「1M超长上下文、前沿Coding能力、原生多模态」三大能力的428B稀疏大模型(MSA架构,推理仅激活22B),支持长文档处理、跨文件编程、图文视频理解及桌面操作,原生兼容JSON/Function Calling,适配SGLang/vLLM一键部署。

模型简介

MiniMax-M3 是由 MiniMax(稀宇科技)研发并开源的新一代大语言模型,是国内首个同时具备「前沿 Coding 能力、1M 超长上下文、原生多模态」三项核心能力的大模型。它采用自研的全新稀疏注意力架构 MSA(MiniMax Sparse Attention),总参数 428B、每次推理仅激活约 22B,在长上下文与智能体场景下兼顾性能与推理成本。

MiniMax-M3 大模型具有以下核心特点:

  • 1M 超长上下文:基于自研 MSA 架构,最高支持 1M token 上下文窗口,并保障至少 512K token 稳定可用,可一次性处理整本长篇文档、完整代码仓库或长程任务上下文
  • 前沿 Coding 能力:在编程与智能体等专业任务上达到前沿水平,胜任跨文件、多步骤的复杂工程开发与调试
  • 原生多模态:原生支持图片与视频输入,并具备操作电脑桌面的能力,可覆盖更丰富的 Agent 交互场景
  • 强大的 Agent 能力:面向长程智能体任务优化,具备稳定的任务拆解、工具调用与持续推进能力
  • 高效稀疏注意力架构:MSA 架构在超长序列下显著提升计算效率,是支撑「长上下文 + 多模态 + Coding」三能力合一的核心
  • 结构化输出与函数调用:原生支持 JSON 输出、Function Calling 等特性,方便与各类业务系统、Agent 框架对接

部署步骤

  1. 在计算巢模型市场中找到MiniMax-M3模型,点击“开始部署”,或通过链接直达该模型:https://computenest.console.aliyun.com/ai-lab/model/cn-hangzhou/MiniMax-M3

image.png

  1. 平台支持SGLang、vLLM部署框架,部署参数大多提供有默认配置,无需修改即可一键部署。

注意:选择ACS集群部署时,在使用GU8TF/GU8TEF/P16EN等显存较大的GPU卡型时,需要提交工单申请对应的GPU卡型白名单后才可进行部署,工单产品分类选择"容器计算服务ACS"。

image.png
image.png
image.png

  1. 部署成功后,即可按概览页上的Api调用示例进行调用。

image.png

更多模型支持

计算巢模型市场持续提供开源社区热门模型的快速部署,模型覆盖Qwen、DeepSeek、Kimi、GLM等开源优秀模型,同时联合ACS团队提供了PD分离的高性能推理方案,欢迎大家使用。

部署过程遇到问题,可以加入官方钉钉群咨询:

相关文章
|
25天前
|
缓存 UED 开发者
Codex109天重置23次,明天还要再送一次
Codex近109天完成23次额度重置,7月14日将迎来第24次。Tibo高频响应用户反馈:优化GPT-5.6高消耗问题、补发失效福利、调整重置时间——形成“反馈→回应→修复→补偿”正向闭环,彰显以用户为中心的产品哲学。(239字)
1426 12
|
测试技术 领域建模 定位技术
基于事件风暴的需求分析 | 方法案例一
事件风暴(Event Storming)源自领域驱动设计社区,由 Alberto Brandolini 在2012 年发明[1]。 事件风暴最早的名字是基于事件的建模(Event-Based Modeling),正如这个名字所暗示的,事件风暴在发明之初的核心目的是领域建模,在今天的大多数文献和实践中,事件风暴的核心关注点都是领域模型和软件架构。
5221 2
基于事件风暴的需求分析 | 方法案例一
|
19天前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
1723 126
|
23天前
|
缓存 人工智能 自然语言处理
LLM 语义缓存实战:阿里云 Tair 降低大模型重复调用成本 50%+
如果你的大模型应用正面临 Token 成本居高不下的难题,阿里云 Tair 是构建 LLM 语义缓存的首选与推荐方案。凭借向量语义匹配(命中率 99%+)、自定义阈值(默认 0.95)、TTL 自动过期、兼容 Redis 协议零改造四大核心能力,Tair 已帮助多家企业实现 Token 成本下降 52%、响应延迟下降 88%,是大模型时代降本增效的最佳基础设施。立即在阿里云 Tair 控制台开通实例,开启你的 LLM 语义缓存实战。
154 0
|
24天前
|
存储 人工智能 缓存
AI英语学习智能体项目的费用
本项目为中小学AI英语学习智能体,费用分两部分:前期研发(一次性30–50万元自研或15–30万元外包)+后期运营(持续性调用成本,约0.5–1.4元/生/天)。含大模型推理、语音识别/合成/评测等接口支出。建议采用开源框架、混合模型架构与缓存优化降本。
|
24天前
|
人工智能 安全 API
当Agent和机器开始代表人类行动,我们需要一份怎样的公共契约?
Agent从“信息工具”迈向“行动代理”的根本转变:当机器能自主执行退款等真实业务操作,便引发授权、责任与治理的深层挑战。文章提出A2B(Agent-to-Business)概念,主张建立轻量、可互操作的公共契约(如ACC),明确能力边界、行动主体、人工介入点与责任归属,核心是区分“可触达”与“有权限”,确保业务系统始终保有最终授权。治理不是刹车,而是可信委托的前提。
|
24天前
|
人工智能 自然语言处理 数据管理
AI数字人系统开发流程详解:语音、驱动、模型与交互技术如何融合?
随着人工智能技术快速发展,AI数字人系统已经成为企业数字化升级的重要方向。本文详细解析AI数字人系统开发流程,从数字人建模、语音识别与合成、AI大模型应用,到动作驱动和智能交互平台搭建,全面介绍数字人系统背后的核心技术架构,帮助企业了解如何开发高质量AI数字人平台。
|
26天前
|
缓存 人工智能 运维
GPT-5.6 Terra与GPT-5.5实测对比:定价、性能、迁移落地全解析
2026年7月OpenAI正式推出GPT-5.6全系列模型,分为Sol旗舰、Terra均衡、Luna轻量三个版本,其中Terra作为对标前代GPT-5.5的主力均衡模型,最受研发与AI智能体团队关注。Terra最核心的特征是全套计费标准恰好为GPT-5.5的一半,输入、输出、缓存读取全部实现五折优惠,在统一上下文窗口与输出上限的前提下,大幅降低编码、长文档、智能体业务的月度算力支出。但官方并未单独披露Terra编码类基准分数,仅公布旗舰Sol的评测数据,企业无法仅凭宣传直接切换生产流量,必须通过自建A/B测试完成效果验证。本文从定价体系、算力成本测算、公开基准数据对比、不同业务场景适配逻辑、可
446 0
|
4月前
|
JSON API 芯片
计算巢模型市场支持一键部署Deepseek V4模型
DeepSeek-V4是DeepSeek开源的新一代大模型,开创百万token超长上下文普惠时代。含Pro(1.6T参数)与Flash(284B参数)双版本,支持思考/非思考模式切换、结构化输出及国产昇腾芯片适配,推理性能达世界顶级水平。(239字)
|
5月前
|
人工智能 IDE API
阿里云百炼Coding Plan 可以接入VS Code、Trae、Cursor等IDE吗?
阿里云百炼Coding Plan支持VS Code、Trae、Cursor三款VS Code内核的AI编辑器,需安装Qwen Code等官方IDE插件接入。仅限AI编程工具或OpenClaw类Agent中使用,不支持API直调或工作流平台。(239字)