最新版通义千问(Qwen3.7-Plus)功能介绍

简介: 通义千问Qwen3.7-Plus是Qwen3.7系列中定位高性价比的主力多模态模型,采用35B稠密参数架构,原生统一文本、图片、截图、短视频、网页五大输入形态,打通GUI可视化界面与CLI命令行双操作环境,实现“看、想、写、做、验”全流程闭环。它不仅是多模态理解工具,更是可独立执行复杂任务的混合智能体,在Vision Arena全球多模态评测中跻身前五、国产登顶,成为企业开发、自动化办公、行业数字化的工程级AI基座。

通义千问Qwen3.7-Plus是Qwen3.7系列中定位高性价比的主力多模态模型,采用35B稠密参数架构,原生统一文本、图片、截图、短视频、网页五大输入形态,打通GUI可视化界面与CLI命令行双操作环境,实现“看、想、写、做、验”全流程闭环。它不仅是多模态理解工具,更是可独立执行复杂任务的混合智能体,在Vision Arena全球多模态评测中跻身前五、国产登顶,成为企业开发、自动化办公、行业数字化的工程级AI基座。

一、技术架构:稠密参数+多模态融合,构建全能智能体基座

Qwen3.7-Plus采用35B稠密参数设计,区别于旗舰版Qwen3.7-Max的万亿级MoE架构,以更轻量化的参数规模实现全场景能力覆盖,兼顾性能与成本。模型基于Qwen3.7强大文本基座深度优化,将视觉、语言、代码生成能力整合为统一基座,打破单一能力割裂痛点,支持图形界面操作、命令行工具调用、自主编程与结果验证的多元协同。详情👉访问阿里云百炼大模型服务平台页面 了解。
image.png
bailian1.png
bailian2.png

在上下文处理上,Qwen3.7-Plus标准上下文窗口达128K,可拓展至100万Token,最长支持64K Token输出,能一次性处理整本书籍、整套代码仓库或数百页文档,彻底解决长文本处理的信息割裂问题。视觉能力方面,单图支持1600万像素解析,一次最多处理2048张图片;视频处理最长支持2小时,可同时输入64个视频素材,实现长视频关键帧提取、内容理解与字幕生成。

模型内置双模式推理机制,思考模式专注深度逻辑推演,适用于数学计算、代码编写、长文档分析;快速模式保障实时响应,适配轻量化批量生成与对话场景。同时支持上下文缓存功能,隐式缓存命中成本大幅降低,长对话与连续任务的性价比显著提升。

二、核心能力:四大硬核突破,实现从感知到执行的全链路闭环

Qwen3.7-Plus的核心价值在于将视觉感知与代码生成、工具调用、GUI操控深度融合,形成完整的智能体工作流,四大能力构成其核心竞争力。

1. GUI屏幕智能操控:看懂界面,自主执行操作

作为国内首款实现看图、识屏、编程、自主操控软硬件一体化的模型,Qwen3.7-Plus具备强大的GUI感知与交互能力。它能精准识别桌面端、移动端界面元素,理解UI布局与功能逻辑,模拟人类操作完成点击、输入、滑动、截图等动作,实现应用自动化测试、流程自动化执行。

在桌面端应用复刻测试中,模型基于GUI感知能力,自主分析macOS Stocks应用界面,理解功能细节,自动生成SwiftUI代码并接入实时行情API,完成10项核心功能测试,实现原生应用的完整复刻。在移动端场景,可端到端导航App,完成注册、登录、数据查询、表单提交等全流程操作,无需人工干预。

2. 视觉编程:从截图/草图到可运行代码,一键生成工程

视觉编程是Qwen3.7-Plus的差异化优势,可直接基于图片、截图、草图生成完整代码,实现“所见即所得”的开发体验。上传产品设计图、网页截图或手绘原型,模型可自动解析视觉元素、布局结构与交互逻辑,输出HTML、CSS、JavaScript、SwiftUI等前端代码,包含响应式适配与交互逻辑。详情👉访问阿里云百炼大模型服务平台页面 了解。
image.png
bailian1.png
bailian2.png

更强大的是,模型支持视觉反馈闭环,可观察生成的页面效果,自动识别布局错乱、样式异常等问题,修改代码并重新生成,直至达到预期效果。在后端开发场景,可基于数据库设计图、接口文档截图,生成完整的API接口代码、数据库操作逻辑与业务逻辑层代码,实现前后端一体化开发。

以下是基于Qwen3.7-Plus的视觉编程命令行工具调用示例,实现截图转前端工程:

# 安装Qwen视觉编程CLI工具
npm install -g qwen-vision-cli
# 配置API密钥与模型
qwen config set api_key $DASHSCOPE_API_KEY
qwen config set model qwen3.7-plus
# 上传设计截图,生成前端工程
qwen vision codegen ./design-screenshot.png \
  --framework react \
  --output ./frontend-project \
  --responsive true
# 自动修复代码问题并生成测试用例
qwen code fix ./frontend-project --test true
3. 全栈编程与代码执行:自主开发,端到端交付项目

Qwen3.7-Plus的编程能力看齐旗舰模型,在CodeArena等权威榜单中表现优异,支持全栈开发、代码调试、漏洞修复与单元测试生成。模型可基于空文件夹,独立完成中小型软件工程项目开发,覆盖需求分析、架构设计、编码实现、测试部署全流程,实测可稳定运行11小时,生成超万行代码,完成1000+次顺序工具调用。

在数学推理场景,AIME竞赛测试中与旗舰模型答对相同题目,但单题耗时仅113秒,速度提升近3倍。代码修复测试中,实现100%漏洞修复率,表现超越旗舰模型。同时支持Code Interpreter代码执行功能,可直接运行Python代码进行计算、数据处理与可视化,以下是调用示例:

import os
from openai import OpenAI

# 初始化OpenAI兼容客户端
client = OpenAI(
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

# 调用Qwen3.7-Plus并启用代码解释器
completion = client.chat.completions.create(
    model="qwen3.7-plus",
    messages=[{
   "role": "user", "content": "分析销售数据,生成可视化报表"}],
    extra_body={
   
        "enable_code_interpreter": True,
        "enable_thinking": True
    },
    stream=True
)

# 流式输出结果
for chunk in completion:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")
4. 长时自治与工具协同:数千轮交互,自主完成复杂任务

Qwen3.7-Plus具备超长时长稳定运行能力,官方标称35小时自治运行,可独立承接万行代码级别的大型软件开发项目,完整覆盖需求分析、代码开发、测试部署、迭代更新全流程。在长周期任务中,模型可自主拆解目标、规划步骤、调用工具、处理异常、验证结果,历经数千轮交互实现闭环执行。

在浏览器自动化场景,依托Chrome插件实现网页全流程自动化,可自主完成数据采集、表单填写、内容发布、报表生成等操作。在办公自动化场景,可独立完成200余种高频任务,包括合同审阅、财报分析、邮件分发、会议纪要整理,将法务团队一周的合同审阅量压缩至一小时。

三、多模态输入与处理:五大形态统一解析,覆盖全场景数据

Qwen3.7-Plus原生支持文本、图片、截图、短视频、网页五大输入形态,实现多模态数据的统一理解与处理,无需切换模型即可完成复杂多源数据任务。

  • 图片处理:支持1600万像素高清图片解析,可识别文字、图表、场景、物体,理解复杂布局与视觉逻辑,适用于图纸分析、设计图转代码、票据识别、文档扫描等场景。
  • 视频处理:最长支持2小时视频,可同时处理64个视频,提取关键帧、分析内容、生成字幕、追踪人物与事件,适用于视频内容审核、教学视频解析、监控视频分析等场景。
  • 网页处理:可直接解析网页内容,理解DOM结构、交互逻辑与数据格式,实现网页数据提取、自动化操作、前端代码生成。
  • 混合输入:支持文本+图片+视频的混合输入,模型可同步理解多源信息,进行跨模态推理与整合,输出更精准的结果。

以下是多模态混合输入的API调用示例,实现图片+文本的联合分析:

import os
import dashscope

# 配置API密钥
dashscope.api_key = os.getenv("DASHSCOPE_API_KEY")

# 构建多模态消息
messages = [
    {
   
        "role": "user",
        "content": [
            {
   "image": "https://example.com/product-design.png"},
            {
   "text": "基于这张设计图,生成完整的React前端代码,并编写接口文档"}
        ]
    }
]

# 调用Qwen3.7-Plus多模态对话接口
response = dashscope.MultiModalConversation.call(
    model="qwen3.7-plus",
    messages=messages
)

# 输出结果
print(response.output.choices[0].message.content[0]["text"])

四、性价比与生态:低成本接入,无缝兼容主流开发框架

Qwen3.7-Plus的核心优势之一是极致性价比,Token调用成本仅为旗舰模型的1/6,同时保持接近旗舰的能力水平。国内定价为每百万Token输入3元、输出9元,隐式缓存命中0.3元;海外定价为每百万Token输入0.4美元、输出1.6美元,缓存命中0.08美元,在同级别多模态模型中极具竞争力。

模型原生兼容OpenAI、Anthropic双API协议,原有基于主流模型开发的Agent、业务系统无需大幅修改代码,直接切换即可获得多模态能力,迁移零成本。同时支持Partial Mode、Context Cache等高级功能,可进一步优化推理性能与成本。

在生态方面,Qwen3.7-Plus已上架阿里云百炼平台与千问云,开发者可通过API、SDK、命令行工具等多种方式接入,配套Qoder IDE插件、视觉编程CLI工具、浏览器自动化插件等开发工具,形成完整的开发生态。模型还通过严格的安全与合规测试,内置内容安全审核机制,保障输出内容的合规性与安全性。

五、应用场景:赋能全行业,重塑数字化生产力

Qwen3.7-Plus的全链路能力可深度适配开发者、企业、个人等不同用户群体,覆盖软件开发、企业办公、金融服务、教育科研、内容创作、工业设计等全行业场景。

  • 开发者场景:作为全栈开发助手,快速搭建项目框架、编写核心代码、修复漏洞、生成测试用例,大幅缩短开发周期;视觉编程能力让前端开发效率提升数倍,从设计到代码一键完成。
  • 企业办公场景:实现办公流程自动化,合同审阅、财报分析、数据处理、报表生成等任务自主完成,解放重复性劳动;GUI操控能力实现系统自动化测试与流程自动化,提升运营效率。
  • 金融服务场景:自动分析财报、合同、票据,识别风险点,生成分析报告;量化策略生成、市场数据监控、客户服务智能化,为金融机构提供高效AI支持。
  • 教育科研场景:多模态解题、个性化教学、课程设计、作业批改;处理海量文献、分析实验数据、推导科学结论,加速科研成果产出。
  • 内容创作场景:基于图文视频素材自动生成文案、脚本、动画、3D场景;视频内容分析与摘要生成,大幅提升内容生产效率与质量。

六、总结:多模态智能体的新标杆,工程级AI的首选基座

通义千问Qwen3.7-Plus以35B稠密参数架构、五大输入形态统一处理、GUI+CLI双端自主执行、视觉编程与长时自治能力,重新定义了中端多模态模型的技术标准与应用边界。它不仅实现了从“看懂内容”到“自主做事”的跨越,更以极致性价比与完善生态,成为企业级应用与开发者工程的首选AI基座。

作为国产多模态智能体的新标杆,Qwen3.7-Plus将视觉感知、逻辑推理、代码生成、工具执行深度融合,形成完整的智能体工作流,为各行业数字化转型提供强大的AI支撑。随着模型的持续迭代与生态完善,Qwen3.7-Plus将进一步释放技术红利,推动AI从“辅助工具”走向“自主执行者”,成为工程级AI应用的核心基础设施。

目录
相关文章
|
3月前
|
传感器 人工智能 缓存
阿里云Qwen3.7-Plus介绍:模型能力、优势、适用场景与支持的订阅计划
阿里云百炼平台推出的Qwen3.7-Plus是一款多模态智能体大模型,具备"能看、能想、能动手"的端到端闭环能力,可融合GUI与CLI交互,实现复杂任务自动化。其视觉推理、编程、数学能力较上代大幅提升,在Vision Arena榜单跻身全球前五、中国第一。该模型适用于智能编程、办公自动化、跨模态分析等场景,并提供限时8折推理优惠、新用户100万tokens免费试用、全模型资源包低至4.5折及节省计划最高5.3折等多档计费方案,降低企业与开发者的AI应用成本。
|
13天前
|
人工智能 安全 API
阿里云通义千问大模型完整解析:全系列模型能力、核心优势、行业落地与选型定价全梳理
生成式人工智能技术持续迭代,大模型已经从概念阶段深度走进各类业务生产环节,不管是个人开发者搭建AI应用、中小团队做业务智能化改造,还是大型企业完成数字化转型升级,都需要选择适配自身业务的大模型底座。通义千问,代号Qwen,是阿里云完全自主研发的大模型家族,并非单一对话模型,而是一套覆盖文本、代码、图像、音频、视频、超长文档处理、智能体执行的完整模型产品矩阵,依托阿里云百炼大模型服务平台对外提供服务,支持在线调用API、模型微调、私有知识库搭建、智能体编排、私有化部署等多样化能力,是国内企业级调用规模位居前列的大模型体系。
455 2
|
1月前
|
人工智能 自然语言处理 API
从入门到精通阿里云千问:模型矩阵、免费额度、API代码调用与企业落地指南
AI产业落地的浪潮下,自研通用大模型已经成为数字化转型的核心基础设施。阿里云千问,官方名称通义千问,代号Qwen,是阿里云完全自主研发的全栈式大模型家族,并非单一文本模型,而是覆盖纯文本、代码、图像、音频、视频、行业垂直场景的完整产品矩阵,统一依托阿里云百炼大模型服务平台对外提供模型调用、微调、智能体开发、私有知识库构建、应用一键部署等全链路MaaS服务。当前主力迭代版本为Qwen3.7系列,形成旗舰、均衡、轻量、多模态、代码专用五大分支模型,在中文理解、超长上下文推理、自主智能体执行、多模态统一解析四大维度具备国产头部水准,同时搭配免费试用、按量计费、Token Plan订阅、长期节省计划四
944 4
|
人工智能 JavaScript 开发工具
DeepSeek Harness 本地安装与使用指南
DeepSeek Harness(DSH)是DeepSeek AI开源的Agent运行框架,支持本地文件操作、命令执行与工具调用。基于Cordis插件架构,具备高扩展性与强可控性,适合开发者搭建可控Agent环境或开展模型基准测试。当前为开发者预览版,需Node.js环境,推荐先用`npx @deepseek-ai/dsh web`快速体验。
5754 17
|
1月前
|
人工智能 弹性计算 API
零门槛!阿里云计算巢部署Hermes Agent并对接百炼Coding Plan/Token Plan完整教程
在AI智能体开发与部署领域,Hermes Agent凭借自主进化、多场景适配的特性,成为开发者与企业构建专属AI助手的热门选择。阿里云计算巢提供一键式部署能力,可快速完成Hermes Agent的环境搭建与服务启动,而阿里云百炼的Coding Plan与Token Plan则为其提供稳定、高性价比的大模型推理能力。本文将从部署前准备、计算巢一键部署、百炼Coding Plan/Token Plan开通与API Key获取、Hermes Agent配置对接、功能验证与优化等环节,提供保姆级全流程实操指南,帮助用户快速完成从部署到可用的全链路配置。
92 1
|
26天前
|
人工智能 缓存 数据挖掘
阿里云Qwen3.8-Max大模型首发尝鲜:个人版和企业版超值优惠低至39元/月起
本文介绍了阿里云Qwen3.8-Max旗舰大模型。该模型拥有2.4万亿参数,采用MoE架构,支持文本、图像、视频多模态输入,在代码工程、专业办公、长程任务规划及多模态视觉理解等方面较上代Qwen3.7-Max显著提升,最大上下文达100万Token。文章详解其核心能力、API调用方式与定价策略(输入12元/百万tokens),并重点介绍Token Plan订阅(39元/月起、首发加量10倍)、NightPlan夜间2折等多项优惠活动,助力用户以低成本享受旗舰级AI生产力。
阿里云Qwen3.8-Max大模型首发尝鲜:个人版和企业版超值优惠低至39元/月起
|
1月前
|
设计模式 人工智能 监控
智能体工作流引擎设计:LangGraph与状态机在企业生产中的应用
本文剖析企业级AI Agent工作流核心架构,对比状态机(强确定性、易审计)与LangGraph(图结构、动态规划)两大范式,提出“外层状态机+内层LangGraph”的混合生产模式,并详解状态持久化、事件溯源、人机协同、工具隔离等高可靠设计实践。
179 1
|
1月前
|
人工智能 运维 数据可视化
最新版通义千问(Qwen3.7-Plus)功能介绍
作为通义千问3.7系列的中端主力旗舰,Qwen3.7-Plus以35B稠密参数架构为核心,定位“高性价比多模态智能体基座”,彻底打破传统多模态模型“只能看懂、无法做事”的局限。它原生统一文本、图片、截图、短视频、网页五大输入形态,打通GUI可视化界面与CLI命令行双操作环境,实现“看、想、写、做、验”全流程闭环,在全球多模态评测榜单跻身前五、国产榜单登顶,标志国产多模态AI从“内容解析”迈向“自主执行”的关键跨越。相比同系列旗舰Max,它以更轻量化的参数、更低的使用成本,实现了接近旗舰的多模态与智能体能力,成为个人开发者、中小企业与行业数字化场景的首选AI基座。
387 2

热门文章

最新文章