计算巢支持一键部署GLM-5.2

简介: GLM-5.2是智谱推出的旗舰级MoE大模型(744B总参,激活仅40B),支持真正无损1M上下文与128K输出,长程任务能力开源SOTA,编程与工程规范遵循能力卓越,原生支持结构化输出与工具调用,已在计算巢模型市场开放FP8版一键部署。

模型简介

GLM-5.2 是由智谱(ZhipuAI)研发的新一代旗舰基座大语言模型,面向「长程任务(Long-Horizon Tasks)」时代打造。它采用 MoE 稀疏混合专家架构,总参数达 744B、每次推理仅激活约 40B,在保有大模型知识容量的同时兼顾推理成本;配合真正可用的 1M 无损上下文,可一次性承载项目级工程上下文,让耗时数小时乃至数十小时的复杂工程任务稳定跑到底。

GLM-5.2 大模型具有以下核心特点:

  • Solid 1M 超长上下文:标配 1M token 上下文窗口且为「无损」可用,实测可一次性放入整个工程仓库;长程任务后半程的上下文漂移、目标遗忘明显减少,最大输出可达 128K token
  • 顶级长程任务能力:在 FrontierSWE、SWE-Marathon、PostTrainBench 等长程任务基准上整体表现介于 Claude Opus 4.7 与 4.8 之间,是当前排名最高的开源模型
  • 开源 SOTA 的 Coding 能力:在主流编程基准上保持开源 SOTA,与 Claude Opus 4.8 处于可比区间;在百万用户盲测的前端评估系统 Code Arena 上取得全球可用模型第一
  • 稳定的工程规范遵循:在长上下文、多轮执行中更能守住代码风格、架构边界、依赖约束、构建与测试流程等研发硬约束,降低越界修改与擅自提交风险
  • 思考模式切换:支持思考/非思考模式自由切换,并可调节 reasoning_effort,兼顾深度推理与快速响应
  • 结构化输出与工具调用:原生支持 JSON 结构化输出、Function Calling 与 MCP,方便与各类业务系统、Agent 框架对接

部署步骤

  1. 在计算巢模型市场中找到GLM-5.2-FP8模型,点击“开始部署”,或通过链接直达该模型:https://computenest.console.aliyun.com/ai-lab/model/cn-hangzhou/GLM-5.2-FP8

image.png

  1. 平台支持SGLang、vLLM部署框架,部署参数大多提供有默认配置,无需修改即可一键部署。

注意:选择ACS集群部署时,在使用GU8TF/GU8TEF/P16EN等显存较大的GPU卡型时,需要提交工单申请对应的GPU卡型白名单后才可进行部署,工单产品分类选择"容器计算服务ACS"。

image.png
image.png
image.png

  1. 部署成功后,即可按概览页上的Api调用示例进行调用。

image.png

更多模型支持

计算巢模型市场持续提供开源社区热门模型的快速部署,模型覆盖Qwen、DeepSeek、Kimi、GLM等开源优秀模型,同时联合ACS团队提供了PD分离的高性能推理方案,欢迎大家使用。

部署过程遇到问题,可以加入官方钉钉群咨询:

相关文章
|
3月前
|
人工智能 NoSQL 开发工具
AI 还在装失忆?1 万 Star 开源 EverOS 有点东西,把 Agent 记忆塞进 Markdown
EverOS 是 EverMind-AI 开源的 local-first Agent 记忆运行时,将会话和 Agent 经验保存为可读、可编辑、可迁移的 Markdown 资产。
249 4
|
3月前
|
缓存 人工智能 自然语言处理
成本直降50%!GPT-5.6 Terra与GPT-5.5跑分、延迟、稳定性深度实测
随着大模型技术持续迭代更新,高效能、低成本成为企业开发、个人项目落地的核心诉求。OpenAI推出的GPT-5.6系列模型,针对性优化了前代模型的成本高、资源消耗大、推理延迟波动等痛点,其中**GPT-5.6 Terra**作为中端均衡主力模型,主打平替GPT-5.5、成本减半的核心优势,一经推出便成为各类AI应用、智能问答、代码开发、文本处理场景的首选模型。
503 1
|
3月前
|
SQL 存储 关系型数据库
【SQLite】SQLite3下载、安装、数据库操作保姆级教程(2026最新,超详细)
SQLite 是全球最流行的嵌入式关系数据库引擎,无需安装服务、零配置、单文件(.db)存储,直接以 C 库形式嵌入应用。广泛用于移动App、桌面软件、IoT设备及开发测试,支持标准SQL与ACID事务,跨平台、轻量高效。(239字)
|
3月前
|
人工智能 API
从 0 到 1 做品牌视觉:用百炼 CLI 一条命令线打通 Logo→IP→VI→种草图
本文以「云朵咖啡」为例,详解如何用百炼CLI(`bl`)实现品牌视觉全链路生成:通过锚点(主色/角色/风格)+固定种子保障风格统一,支持Logo、IP、表情包等批量产出,并可联动语音、文案构建一体化内容生产线。(239字)
|
2月前
|
弹性计算 网络协议 测试技术
从 TPOT 188ms 到 22ms:大模型多机分布式部署的并行策略实测
本文通过三轮压测对比TP(张量并行)与PP(流水线并行)在普通网络与eRDMA下的性能表现:普通网络下PP+TP更优;启用eRDMA后,全TP在解码吞吐、TPOT等关键指标上全面碾压PP,端到端时延降至1/7.7。结论直击部署选型痛点——网络能力决定并行策略。
从 TPOT 188ms 到 22ms:大模型多机分布式部署的并行策略实测
|
3月前
|
存储 Kubernetes 调度
|
3月前
|
机器学习/深度学习 API Python
用 Scikit-LLM 和 Groq 搭建情感分析 pipeline
本文介绍如何用Scikit-LLM集成Groq的Llama 3.1模型,构建零样本情感分析Pipeline:基于IMDB数据集,通过文本清洗、零样本分类与scikit-learn标准接口,实现高效、易用的LLM驱动文本分类,兼顾简洁性与实用性。
183 2
用 Scikit-LLM 和 Groq 搭建情感分析 pipeline
|
3月前
|
缓存 运维 安全
中小企业低成本搭建合规企业官网:阿里云轻量化建站架构全流程解析
很多中小企业搭建官网只看重页面设计,忽略底层服务器、合规备案、加载速度、安全防护等技术问题,出现网站打不开、被浏览器标记不安全、搜索引擎不收录、频繁被攻击等情况。本文结合阿里云全系产品,分享一套低成本、易维护、适配搜索优化的企业站上云落地思路,从资源选型、部署上线到长期运维全覆盖。
|
存储 缓存 调度
vLLM 吞吐量优化实战:10个KV-Cache调优方法让tokens/sec翻倍
十个经过实战检验的 vLLM KV-cache 优化方法 —— 量化、分块预填充、前缀重用、滑动窗口、ROPE 缩放、后端选择等等 —— 提升 tokens/sec。
3783 10