通义千问Qwen3.7-Plus是Qwen3.7系列中定位高性价比的主力多模态模型,采用35B稠密参数架构,原生统一文本、图片、截图、短视频、网页五大输入形态,打通GUI可视化界面与CLI命令行双操作环境,实现“看、想、写、做、验”全流程闭环。它不仅是多模态理解工具,更是可独立执行复杂任务的混合智能体,在Vision Arena全球多模态评测中跻身前五、国产登顶,成为企业开发、自动化办公、行业数字化的工程级AI基座。
一、技术架构:稠密参数+多模态融合,构建全能智能体基座
Qwen3.7-Plus采用35B稠密参数设计,区别于旗舰版Qwen3.7-Max的万亿级MoE架构,以更轻量化的参数规模实现全场景能力覆盖,兼顾性能与成本。模型基于Qwen3.7强大文本基座深度优化,将视觉、语言、代码生成能力整合为统一基座,打破单一能力割裂痛点,支持图形界面操作、命令行工具调用、自主编程与结果验证的多元协同。详情👉访问阿里云百炼大模型服务平台页面 了解。


在上下文处理上,Qwen3.7-Plus标准上下文窗口达128K,可拓展至100万Token,最长支持64K Token输出,能一次性处理整本书籍、整套代码仓库或数百页文档,彻底解决长文本处理的信息割裂问题。视觉能力方面,单图支持1600万像素解析,一次最多处理2048张图片;视频处理最长支持2小时,可同时输入64个视频素材,实现长视频关键帧提取、内容理解与字幕生成。
模型内置双模式推理机制,思考模式专注深度逻辑推演,适用于数学计算、代码编写、长文档分析;快速模式保障实时响应,适配轻量化批量生成与对话场景。同时支持上下文缓存功能,隐式缓存命中成本大幅降低,长对话与连续任务的性价比显著提升。
二、核心能力:四大硬核突破,实现从感知到执行的全链路闭环
Qwen3.7-Plus的核心价值在于将视觉感知与代码生成、工具调用、GUI操控深度融合,形成完整的智能体工作流,四大能力构成其核心竞争力。
1. GUI屏幕智能操控:看懂界面,自主执行操作
作为国内首款实现看图、识屏、编程、自主操控软硬件一体化的模型,Qwen3.7-Plus具备强大的GUI感知与交互能力。它能精准识别桌面端、移动端界面元素,理解UI布局与功能逻辑,模拟人类操作完成点击、输入、滑动、截图等动作,实现应用自动化测试、流程自动化执行。
在桌面端应用复刻测试中,模型基于GUI感知能力,自主分析macOS Stocks应用界面,理解功能细节,自动生成SwiftUI代码并接入实时行情API,完成10项核心功能测试,实现原生应用的完整复刻。在移动端场景,可端到端导航App,完成注册、登录、数据查询、表单提交等全流程操作,无需人工干预。
2. 视觉编程:从截图/草图到可运行代码,一键生成工程
视觉编程是Qwen3.7-Plus的差异化优势,可直接基于图片、截图、草图生成完整代码,实现“所见即所得”的开发体验。上传产品设计图、网页截图或手绘原型,模型可自动解析视觉元素、布局结构与交互逻辑,输出HTML、CSS、JavaScript、SwiftUI等前端代码,包含响应式适配与交互逻辑。详情👉访问阿里云百炼大模型服务平台页面 了解。


更强大的是,模型支持视觉反馈闭环,可观察生成的页面效果,自动识别布局错乱、样式异常等问题,修改代码并重新生成,直至达到预期效果。在后端开发场景,可基于数据库设计图、接口文档截图,生成完整的API接口代码、数据库操作逻辑与业务逻辑层代码,实现前后端一体化开发。
以下是基于Qwen3.7-Plus的视觉编程命令行工具调用示例,实现截图转前端工程:
# 安装Qwen视觉编程CLI工具
npm install -g qwen-vision-cli
# 配置API密钥与模型
qwen config set api_key $DASHSCOPE_API_KEY
qwen config set model qwen3.7-plus
# 上传设计截图,生成前端工程
qwen vision codegen ./design-screenshot.png \
--framework react \
--output ./frontend-project \
--responsive true
# 自动修复代码问题并生成测试用例
qwen code fix ./frontend-project --test true
3. 全栈编程与代码执行:自主开发,端到端交付项目
Qwen3.7-Plus的编程能力看齐旗舰模型,在CodeArena等权威榜单中表现优异,支持全栈开发、代码调试、漏洞修复与单元测试生成。模型可基于空文件夹,独立完成中小型软件工程项目开发,覆盖需求分析、架构设计、编码实现、测试部署全流程,实测可稳定运行11小时,生成超万行代码,完成1000+次顺序工具调用。
在数学推理场景,AIME竞赛测试中与旗舰模型答对相同题目,但单题耗时仅113秒,速度提升近3倍。代码修复测试中,实现100%漏洞修复率,表现超越旗舰模型。同时支持Code Interpreter代码执行功能,可直接运行Python代码进行计算、数据处理与可视化,以下是调用示例:
import os
from openai import OpenAI
# 初始化OpenAI兼容客户端
client = OpenAI(
api_key=os.getenv("DASHSCOPE_API_KEY"),
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
# 调用Qwen3.7-Plus并启用代码解释器
completion = client.chat.completions.create(
model="qwen3.7-plus",
messages=[{
"role": "user", "content": "分析销售数据,生成可视化报表"}],
extra_body={
"enable_code_interpreter": True,
"enable_thinking": True
},
stream=True
)
# 流式输出结果
for chunk in completion:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
4. 长时自治与工具协同:数千轮交互,自主完成复杂任务
Qwen3.7-Plus具备超长时长稳定运行能力,官方标称35小时自治运行,可独立承接万行代码级别的大型软件开发项目,完整覆盖需求分析、代码开发、测试部署、迭代更新全流程。在长周期任务中,模型可自主拆解目标、规划步骤、调用工具、处理异常、验证结果,历经数千轮交互实现闭环执行。
在浏览器自动化场景,依托Chrome插件实现网页全流程自动化,可自主完成数据采集、表单填写、内容发布、报表生成等操作。在办公自动化场景,可独立完成200余种高频任务,包括合同审阅、财报分析、邮件分发、会议纪要整理,将法务团队一周的合同审阅量压缩至一小时。
三、多模态输入与处理:五大形态统一解析,覆盖全场景数据
Qwen3.7-Plus原生支持文本、图片、截图、短视频、网页五大输入形态,实现多模态数据的统一理解与处理,无需切换模型即可完成复杂多源数据任务。
- 图片处理:支持1600万像素高清图片解析,可识别文字、图表、场景、物体,理解复杂布局与视觉逻辑,适用于图纸分析、设计图转代码、票据识别、文档扫描等场景。
- 视频处理:最长支持2小时视频,可同时处理64个视频,提取关键帧、分析内容、生成字幕、追踪人物与事件,适用于视频内容审核、教学视频解析、监控视频分析等场景。
- 网页处理:可直接解析网页内容,理解DOM结构、交互逻辑与数据格式,实现网页数据提取、自动化操作、前端代码生成。
- 混合输入:支持文本+图片+视频的混合输入,模型可同步理解多源信息,进行跨模态推理与整合,输出更精准的结果。
以下是多模态混合输入的API调用示例,实现图片+文本的联合分析:
import os
import dashscope
# 配置API密钥
dashscope.api_key = os.getenv("DASHSCOPE_API_KEY")
# 构建多模态消息
messages = [
{
"role": "user",
"content": [
{
"image": "https://example.com/product-design.png"},
{
"text": "基于这张设计图,生成完整的React前端代码,并编写接口文档"}
]
}
]
# 调用Qwen3.7-Plus多模态对话接口
response = dashscope.MultiModalConversation.call(
model="qwen3.7-plus",
messages=messages
)
# 输出结果
print(response.output.choices[0].message.content[0]["text"])
四、性价比与生态:低成本接入,无缝兼容主流开发框架
Qwen3.7-Plus的核心优势之一是极致性价比,Token调用成本仅为旗舰模型的1/6,同时保持接近旗舰的能力水平。国内定价为每百万Token输入3元、输出9元,隐式缓存命中0.3元;海外定价为每百万Token输入0.4美元、输出1.6美元,缓存命中0.08美元,在同级别多模态模型中极具竞争力。
模型原生兼容OpenAI、Anthropic双API协议,原有基于主流模型开发的Agent、业务系统无需大幅修改代码,直接切换即可获得多模态能力,迁移零成本。同时支持Partial Mode、Context Cache等高级功能,可进一步优化推理性能与成本。
在生态方面,Qwen3.7-Plus已上架阿里云百炼平台与千问云,开发者可通过API、SDK、命令行工具等多种方式接入,配套Qoder IDE插件、视觉编程CLI工具、浏览器自动化插件等开发工具,形成完整的开发生态。模型还通过严格的安全与合规测试,内置内容安全审核机制,保障输出内容的合规性与安全性。
五、应用场景:赋能全行业,重塑数字化生产力
Qwen3.7-Plus的全链路能力可深度适配开发者、企业、个人等不同用户群体,覆盖软件开发、企业办公、金融服务、教育科研、内容创作、工业设计等全行业场景。
- 开发者场景:作为全栈开发助手,快速搭建项目框架、编写核心代码、修复漏洞、生成测试用例,大幅缩短开发周期;视觉编程能力让前端开发效率提升数倍,从设计到代码一键完成。
- 企业办公场景:实现办公流程自动化,合同审阅、财报分析、数据处理、报表生成等任务自主完成,解放重复性劳动;GUI操控能力实现系统自动化测试与流程自动化,提升运营效率。
- 金融服务场景:自动分析财报、合同、票据,识别风险点,生成分析报告;量化策略生成、市场数据监控、客户服务智能化,为金融机构提供高效AI支持。
- 教育科研场景:多模态解题、个性化教学、课程设计、作业批改;处理海量文献、分析实验数据、推导科学结论,加速科研成果产出。
- 内容创作场景:基于图文视频素材自动生成文案、脚本、动画、3D场景;视频内容分析与摘要生成,大幅提升内容生产效率与质量。
六、总结:多模态智能体的新标杆,工程级AI的首选基座
通义千问Qwen3.7-Plus以35B稠密参数架构、五大输入形态统一处理、GUI+CLI双端自主执行、视觉编程与长时自治能力,重新定义了中端多模态模型的技术标准与应用边界。它不仅实现了从“看懂内容”到“自主做事”的跨越,更以极致性价比与完善生态,成为企业级应用与开发者工程的首选AI基座。
作为国产多模态智能体的新标杆,Qwen3.7-Plus将视觉感知、逻辑推理、代码生成、工具执行深度融合,形成完整的智能体工作流,为各行业数字化转型提供强大的AI支撑。随着模型的持续迭代与生态完善,Qwen3.7-Plus将进一步释放技术红利,推动AI从“辅助工具”走向“自主执行者”,成为工程级AI应用的核心基础设施。