模型简介
DeepSeek-V4.1-Flash 是由 DeepSeek(深度求索)团队于 2026 年 9 月开源的新一代多模态 MoE 大模型,采用 5520 亿参数骨干与 Causal Encoder-Decoder(因果编码-解码)架构,每 token 仅激活 80 亿(输入 prefill)/ 160 亿(输出 decode)参数,原生支持文本与图像的统一理解。模型以 MIT 协议开源,支持免费下载与商业使用;原生上下文达 1M token,并借助 CSA2 压缩稀疏注意力与 FP4 KV 缓存,将单 token 的 KV 显存占用压缩至约 890 字节(约为上代 DeepSeek-V4-Flash 的 1/4),在超长上下文与高并发 Agent 场景下显著降低显存开销与推理成本。
DeepSeek-V4.1-Flash 具有以下核心特点:
- 极致 KV 缓存压缩:通过 CSA2(为每层分配 Full / Reindex / Reuse 三种静态模式,跨层共享 KV 与稀疏注意力索引)叠加 FP4(E2M1)KV 量化,单 token KV 占用降至约 890 字节,约为 V4-Flash 的 1/4、V1 的 1/437,长上下文推理的显存与成本大幅下降
- 稀疏激活、低成本高吞吐:552B 总参数,MoE 每 token 仅激活 6/384 个路由专家 + 1 个共享专家,配合 8B(prefill)/16B(decode)的非对称激活,在保留大模型能力的同时显著降低单次推理算力开销
- 1M 超长上下文:原生支持 1M token 上下文窗口(64K 稀疏注意力训练 + 34T token 长文外推),轻松应对长文档、代码库级与多轮 Agent 任务
- 原生多模态理解:自研 DeepSeek-ViT 视觉编码器 + MLP 投影,从预训练阶段即深度融合图文,端到端支持图像与文本的联合理解
- 领先的 Agent 与 Coding 能力:在 Terminal-Bench 2.1(90.6)、DeepSWE v1.1(74.2)、CyberGym(88.1)等智能体与代码执行基准上对标前沿模型,Codeforces 评分达 3471,专为工具调用与 Agent 工作负载调优
- 思考深度可调:内置 reasoning effort 参数,支持 1–100 连续调节,按任务难度在延迟/成本与精度之间平滑权衡,无需在多个模型档位间切换
私有化部署:模型跑在你自己的 VPC 里
计算巢模型市场提供的不是共享的公共推理 API,而是私有化部署——服务创建在你自己的阿里云账号下,运行在你指定的 VPC、交换机与安全组内,GPU 实例、存储与网络全部归属客户自有资产,用完即可自行释放。
- 数据不出域:推理请求与生成内容仅在客户 VPC 内流转,不经过平台侧或第三方转发,便于满足企业内的数据隔离与合规要求
- 算力独占、配置自主:GPU 卡型、节点/副本数、上下文长度、并发与显存策略均可按业务负载自行调整,不与其他租户争抢算力
- 网络可控:服务端点默认在 VPC 内网提供,可直接与现有微服务、网关、Agent 框架内网直连,也可按需开放公网访问
- 开箱即用的部署链路:底层集群、GPU 环境、推理引擎(vLLM)、模型权重拉取与健康检查均已在部署模板中固化,部署完成即可获得 OpenAI 兼容接口
部署步骤
- 在计算巢模型市场中找到 DeepSeek-V4.1-Flash 模型,点击“开始部署”,或通过链接直达该模型:https://computenest.console.aliyun.com/ai-lab/model/cn-hangzhou/DeepSeek-V4.1-Flash
- 平台支持 vLLM 推理框架,部署参数均已给出经过验证的默认配置,只需选定地域与 VPC 即可一键部署。
注意:选择ACS集群部署时,在使用GU8TF/GU8TEF/P16EN等显存较大的GPU卡型时,需要提交工单申请对应的GPU卡型白名单后才可进行部署,工单产品分类选择“容器计算服务ACS”。
- 部署成功后,在服务实例概览页即可看到服务地址与 API 调用示例,按示例直接从 VPC 内发起调用即可。
更多模型支持
计算巢模型市场持续提供开源社区热门模型的私有化快速部署,覆盖 Qwen、DeepSeek、Kimi、GLM 等优秀开源模型,并联合 ACS 团队提供了 PD 分离的高性能推理方案,欢迎大家使用。
部署过程遇到问题,可以加入官方钉钉群咨询:
