大模型迭代节奏持续加快,在V4‑Flash、V4‑Pro大规模落地之后,DeepSeek放出限时中间内测版本DeepSeek‑V4.1‑Flash,模型内部标识为deepseek‑v4.1‑flash‑expires‑on‑0910。该版本采用全新CED因果编码器‑解码器非对称MoE混合专家架构,原生内置多模态图文理解能力,推理吞吐速度得到大幅提升。内测阶段无需修改API接口地址,仅仅更换模型名称就可以完成调用,接入改造成本极低。同时官方设置账号并发限流,计费规则沿用V4‑Flash标准,版本具备明确的过期时间,仅用于开发者提前验证能力,收集真实业务反馈。不少开发者体验之后发现,虽然模型本身原生支持图片输入,但部分Agent客户端工具不会自动识别多模态能力,会出现“当前模型不支持图片”的拦截提示,需要手动修改配置才能解锁视觉能力。本文完整梳理模型架构特性、接口调用代码、DeepSeek Harness接入流程、第三方Agent平台配置方法,同时汇总内测阶段高频踩坑点,帮助开发者快速完成内测体验。详情👉访问阿里云百炼大模型服务平台页面 了解。


一、内测版本基础信息与底层架构解析
1.1 内测关键限制说明
内测模型完整调用ID:deepseek‑v4.1‑flash‑expires‑on‑0910。
- API base_url保持不变,不需要修改原有接口域名;
- 计费标准与deepseek‑v4‑flash保持一致;
- 单账号并发限流20,不适合高并发生产业务,仅限测试验证;
- 属于限时过期版本,到达时间节点之后模型ID自动失效,不可继续调用;
- 官方同步发放反馈问卷,收集开发者真实体验,用于评估该版本是否可以全面替代旧版V4‑Pro。
重要提醒:该版本只适合开发测试、能力验证,严禁直接接入线上生产业务,到期之后调用会直接报错,业务会出现中断。正式业务请等待后续正式发布版本。
1.2 CED非对称MoE架构核心特性
DeepSeek‑V4.1‑Flash整体总参数量552B,属于混合专家MoE架构,采用Causal‑Encoder‑Decoder非对称设计,40层网络拆分为20层编码器、20层解码器。编码器负责输入内容处理压缩,每token仅激活8B参数;解码器负责生成输出内容,每token激活16B参数,输入输出阶段采用差异化算力开销,相比上代模型大幅降低KV Cache显存占用,KV Cache体积压缩至旧V4‑Flash的1/4,长上下文Agent循环任务中,可以显著降低显存压力,提升接口吞吐速度。
经过多轮预训练与大规模强化学习后训练,该模型在Terminal‑Bench、CyberGym、Automation‑Bench等智能体评测基准取得亮眼成绩,原生支持百万token上下文窗口,原生多模态,不需要外挂独立Vision模型,文本、图片输入统一在同一套模型链路处理,在代码编写、GUI截图理解、图表解析、长周期工具调用任务综合表现提升明显。实测推理输出速度平均稳定在300+ tokens/s,对比旧V4‑Flash有2‑3倍的速度提升。
二、原生API调用实战:curl、Python完整可运行示例
原有项目已经对接DeepSeek接口,只需要替换model字段的模型ID即可,其余鉴权、base_url全部复用原有配置。
2.1 curl命令调用示例(纯文本对话)
curl https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer 你的DEEPSEEK_API_KEY" \
-H "Content‑Type: application/json" \
-d '{
"model":"deepseek‑v4.1‑flash‑expires‑on‑0910",
"messages":[
{"role":"system","content":"你是一名技术助手,回答简洁清晰。"},
{"role":"user","content":"简单介绍CED非对称MoE架构的特点"}
],
"max_tokens":4096,
"temperature":0.7,
"stream":false
}'
2.2 Python SDK纯文本调用示例
首先安装依赖包:
pip install openai python‑dotenv
Python完整代码:
import os
from openai import OpenAI
from dotenv import load_dotenv
load_dotenv()
client = OpenAI(
api_key=os.getenv("DEEPSEEK_API_KEY"),
base_url="https://api.deepseek.com"
)
resp = client.chat.completions.create(
model="deepseek‑v4.1‑flash‑expires‑on‑0910",
messages=[
{
"role":"system","content":"你是技术研发助手。"},
{
"role":"user","content":"简单介绍CED非对称MoE架构的特点"}
],
max_tokens=4096,
temperature=0.7,
stream=False
)
print(resp.choices[0].message.content)
2.3 Python多模态识图调用示例
内测模型原生支持图片输入,content字段使用数组格式,同时传入文本与图片URL。注意图片仅允许放在user角色消息内,system、assistant消息携带图片会返回400参数错误。支持JPEG、PNG、GIF、WebP格式。
import os
from openai import OpenAI
from dotenv import load_dotenv
load_dotenv()
client = OpenAI(
api_key=os.getenv("DEEPSEEK_API_KEY"),
base_url="https://api.deepseek.com"
)
resp = client.chat.completions.create(
model="deepseek‑v4.1‑flash‑expires‑on‑0910",
messages=[
{
"role":"user",
"content":[
{
"type":"text","text":"请描述这张图片,提取图片当中关键信息。"},
{
"type":"image_url","image_url":{
"url":"https://xxx/test.png"}}
]
}
],
max_tokens=4096,
temperature=0.4
)
print(resp.choices[0].message.content)
三、DeepSeek Harness接入内测模型实操与多模态坑点处理
DeepSeek Harness(DSH)作为官方开源Agent运行时框架,可以接入该内测模型,但存在一个高频问题:虽然模型后端原生支持图片,但是Harness本地模型配置清单默认标记该内测ID为纯文本模型,上传图片会弹出提示“当前模型不支持图片,请切换支持图片的模型”,直接拦截图片提交请求,并不是后端模型能力问题,属于前端配置元数据没有开启图片输入标记。
3.1 Web图形界面添加内测模型
- 正常启动DeepSeek Harness,可以使用npx快速拉起:
浏览器打开npx @deepseek‑ai/dsh webhttp://127.0.0.1:3080,进入Web页面; - 页面左下角点击【设置】,切换至【模型】标签页,找到DeepSeek供应商,点击编辑;
- 点击【+添加模型】,模型ID完整填写:
deepseek‑v4.1‑flash‑expires‑on‑0910,填写展示名称; - 保存配置,在会话右上角模型下拉框选中刚刚添加的内测模型,就可以执行文本对话测试。
此时直接粘贴图片发送依然会被拦截,需要修改底层配置文件,手动声明输入模态。
3.2 修改配置文件开启Harness图片支持
找到Harness配置文件settings.yaml,修改providers下面对应模型定义,手动增加input: [text, image]声明。配置片段参考:
providers:
deepseek‑official:
apiKeyEnv: DEEPSEEK_API_KEY
baseURL: https://api.deepseek.com
models:
- id: deepseek‑v4.1‑flash‑expires‑on‑0910
name: DeepSeek‑V4.1‑Flash‑Exp
input: [text, image]
保存配置文件,完全关闭Harness进程,重新启动服务。重启之后,该模型就可以正常接收图片输入。
原理说明:DSH属于BYO自带模型模式,不会自动向API后端拉取模型能力元信息,所有输入输出能力全部依靠本地yaml配置文件声明,如果没有声明image输入类型,Web界面会在请求发出前直接拦截图片消息。
3.3 使用Python‑SDK方式在DSH外部调用内测模型
如果你使用DSH的Python SDK做程序化Agent任务,可以直接在业务代码指定model ID,SDK层面不会做输入模态拦截,多模态请求可以直接透传到API后端。
from deepseek_harness import DeepSeekHarness
def agent_task():
with DeepSeekHarness(
provider="deepseek‑official",
model="deepseek‑v4.1‑flash‑expires‑on‑0910",
cwd="/tmp/test_workspace",
session_root="/tmp/dsh_log"
) as agent:
res = agent.run("读取目录文件,统计py代码行数")
print(res.get("final_response"))
if __name__ == "__main__":
agent_task()
四、其他第三方Agent工具接入要点(ZCode类自定义供应商场景)
市面上大量第三方AI Agent工具支持自定义OpenAI兼容供应商,接入该内测模型的通用流程:
- 添加模型供应商,base_url填写
https://api.deepseek.com,填入自己的API Key; - 添加自定义模型,模型ID完整填入
deepseek‑v4.1‑flash‑expires‑on‑0910; - 关键步骤:输入类型勾选【文本】+【图片】,如果工具没有自动识别多模态,必须手动勾选图片输入能力,否则图片上传会被客户端拦截;
- 设置上下文窗口1000000,最大输出token设置128000;
- 保存配置,新建会话,选择该模型进行图文测试。
验证多模态是否生效的最简测试方法:传入一张包含文字截图,指令为“描述这张图片的全部内容”。模型正常输出图片内容代表多模态配置生效;返回不支持图片,则回到模型配置检查输入类型是否勾选。
五、内测版本高频踩坑汇总
坑点1:模型ID复制不全,调用返回404模型不存在
错误写法简写deepseek‑v4.1‑flash,内测阶段必须完整填写deepseek‑v4.1‑flash‑expires‑on‑0910完整ID,少字符、少后缀都会报模型不存在错误。正式发布后才会使用简短ID。
坑点2:客户端提示不支持图片,但是API直接调用识图正常
现象:DSH或者第三方工具上传图片被拦截,但是把相同payload直接curl调用API可以正常返回图片解析结果。
根因:客户端本地模型元配置没有开启image输入标记,不是后端模型问题。处理:修改yaml配置或者工具模型表单,手动勾选图片输入类型,重启会话服务。
坑点3:并发超过20直接返回限流429
内测版本账号全局并发限制20,仅适合小规模开发测试,不适合压测、大批量离线任务。遇到429需要降低并发请求数量。
坑点4:到达过期时间之后调用全部报错
该模型是限时内测版本,到期之后ID失效,测试业务务必做好记录,到期之后迁移到正式发布的模型ID,不能继续沿用expires后缀的内测ID。
坑点5:图片格式报错,明明后缀是jpg依然拒绝
模型校验图片实际文件编码,不是只看文件名后缀,HEIC修改后缀为jpg依旧会被拒绝。处理:图片另存为标准JPG、PNG格式再提交。图片仅允许放在user角色消息内。
坑点6:直接把内测模型投入线上生产
该版本仅用于测试,没有生产级SLA保障,到期自动下线,线上业务一旦使用,到期会全量接口报错。
六、能力测试建议与反馈收集
内测版本的目标是收集真实业务场景反馈,官方提供问卷收集体验,开发者可以从下面几个维度做验证测试:
- 文本长任务:长文档总结、复杂代码生成,对比旧V4‑Flash推理速度、输出质量;
- Agent工具调用:Function‑Calling工具调用稳定性,长循环任务的自我纠错表现;
- 多模态识图:UI截图解析、表格图表识别、扫描文档OCR识别效果;
- KV缓存收益:带固定system prompt的多轮会话,观察缓存命中率、token消耗变化。
测试完成之后,根据自己实际体验填写反馈问卷,反馈内容包含能力优点、存在缺陷,是否可以替代V4‑Pro等信息,帮助官方迭代正式版本。
七、总结
DeepSeek‑V4.1‑Flash限时内测版本,依托CED非对称MoE架构,实现原生多模态、百万上下文、推理速度大幅提升,同时保持原有V4‑Flash的计费标准,接入只需要替换完整模型ID,base_url无需改动,对于开发者来说试错成本很低。详情👉访问阿里云百炼大模型服务平台页面 了解。


但需要区分API后端能力和Agent客户端配置:模型本身原生支持图片,但是Harness以及很多第三方Agent工具不会自动识别该内测ID的多模态属性,需要手动修改配置开启图片输入标记,否则会出现客户端拦截图片的现象。同时该版本有明确过期时间、20并发限流,只适合开发测试,禁止接入正式线上业务。
开发者可以通过curl、Python SDK直接调用API做基础验证,再结合DeepSeek Harness、第三方Agent工具开展智能体任务测试。体验完成之后提交反馈问卷,等待官方正式版本发布,再迁移业务流量到正式模型ID,享受新架构带来的速度与成本收益。