魔搭中文开源模型社区:模型即服务-GLM-130B:让每个人都能用上千亿模型(下)

简介: 魔搭中文开源模型社区:模型即服务

除此之外,在训练初期embedding的梯度和其余层有数量级的差异,可能对损失函数缩放不利。清华大学可以通过手动调小梯度的方式平衡embedding层梯度,对稳定训练非常有帮助,对loss几乎不影响。

 

image.png

 

如上图所示,清华大学对GLM-130B的英文语言模型能力进行了评估。其中,LAMBADA是一个广泛采用的通过预测句子末尾单词,评估达模型语言能力的数据集。GLM-130B取得了80.2的优异成绩,超过了GPT-3以及SOTA PaLM 540B。

 

image.png

 

在文语言理解能力上,清华大学在大规模多任务语言理解MMLU上进行了测试,发现GLM-130B的表现与GPT-3相当,并大幅超越BLOOM-176B。随着持续训练,水平尚未收敛,并将持续提高。

 

image.png

 

在中文方面,清华大学选取了CLUE和FewCLUE两个常用数据集进行了测试,可以发现GLM-130B全面超越了ERNIE TITAN 3.0(260B),并在生成式阅读理解任务上取得了巨大的提升。

 

image.png

 

除此之外,清华大学近期探索了GLM-130B的模型量化。在保留中间结果度为FP16的情况下,GLM-130B的权重可以量化到INT8而没有任何损失,甚至以非常小的精度损失可以量化到INT4。

 

在无损性能的INT8量化下,GLM-130B支持8张V100以及8张3090服务器高效。在一点点的精度损失下,用户可以在4张3090甚至8张2080 Ti上进行高效推理。

 

image.png

 

如上图所示,在T4量化在8张RTX 3090时,GLM-130B仅需5秒生成128 Token。

 

image.png

 

目前,GLM-130B已开源模型代码,大家可以免费下载。GLM-130B在英文的语言建模和少样本语言理解任务上的表现基本和GPT-3持平,且优于目前开源的OPT和BLOOM。

 

GLM-130B在中文CLUE和FewCLUE数据集上的零样本能力明显优于,具有2600亿参数的ERINE Titan 3.0。

 

除此之外,GLM-130B适配了英伟达的Faster Transformer推理库。相比于常用的Megatron框架,用户可以在一台A100上实现最高2.5倍的推理加速性能。

相关文章
|
Java 测试技术 微服务
最新技术栈下 Java 面试高频技术点实操指南详解
本指南结合最新Java技术趋势,涵盖微服务(Spring Cloud Alibaba)、响应式编程(Spring WebFlux)、容器化部署(Docker+Kubernetes)、函数式编程、性能优化及测试等核心领域。通过具体实现步骤与示例代码,深入讲解服务注册发现、配置中心、熔断限流、响应式数据库访问、JVM调优等内容。适合备战Java面试,提升实操能力,助力技术进阶。资源链接:[https://pan.quark.cn/s/14fcf913bae6](https://pan.quark.cn/s/14fcf913bae6)
627 25
|
jenkins Java Shell
使用 Docker 安装 Jenkins 并实现项目自动化部署
Jenkins 是一款开源的持续集成(DI)工具,广泛用于项目开发,能提供自动构建,测试,部署等功能。作为领先的开源自动化服务器,Jenkins 提供了数百个插件来支持构建、部署和自动化任何项目。
37359 3
使用 Docker 安装 Jenkins 并实现项目自动化部署
|
传感器 机器学习/深度学习 人工智能
VR硬件进化史:从“晕3D”到沉浸式未来
VR硬件进化史:从“晕3D”到沉浸式未来
749 4
|
6月前
|
人工智能 Linux API
OpenClaw封神玩法:数字人形象声音克隆+多端部署(阿里云本地)与API配置实战完整教程
2026年,OpenClaw(Clawdbot)的玩法迎来颠覆性升级——通过集成数字人技能,实现形象克隆、声音克隆与数字人视频生成的全流程自动化,让AI助手从“文字交互”跃迁至“可视化语音交互”。无论是用个人照片生成专属数字人播报,还是克隆明星、名人音色制作创意视频,甚至复刻抖音爆款内容,OpenClaw都能一键完成。想要解锁这一高阶玩法,需先完成基础部署与大模型API对接,再集成数字人技能包。本文将详细拆解2026年OpenClaw的阿里云部署、本地MacOS/Linux/Windows11全系统部署流程,完成阿里云百炼Coding Plan免费API配置,最后手把手教你搭建数字人克隆技能,
2804 0
|
9月前
|
JSON API 定位技术
万年历API接口详细教程:获取指定日12时辰详细信息
万年历“取指定日-12时辰详细信息”API提供免费、全面的农历及时辰数据,涵盖干支、五行、纳音、宜忌、方位等90余项命理信息,支持POST/GET请求,适用于算命、风水、日历类应用开发。
1465 0
|
人工智能 数据可视化 安全
手把手教你用Tableau制作超酷炫能源数据可视化图表
Tableau 是一个强大的可视化分析平台,帮助用户轻松探索和管理数据。结合开源能源管理系统 MyEMS,本文详细讲解如何用 Tableau 制作能源数据可视化图表,包括连接数据库、创建柱状图、饼状图、折线图及文本展示等步骤。通过实际案例(如设备能耗数据分析),手把手教你将数据转化为直观见解,助力企业实现低碳发展与数据驱动决策。
624 0
|
Ubuntu 应用服务中间件 数据库
Nginx配置:阻止非国内IP地址访问的设置方法
此外,出于用户隐私和法律合规性的考虑,应慎重考虑阻止特定国家或地区IP地址的决策。在某些情况下,这可能被视为歧视性或违反当地法律。
1704 3
一文讲明 网络调试助手的基本使用 NetAssist
文章介绍了网络调试助手NetAssist的基本使用方法,包括创建客户端和服务端,模拟网络连接和数据发送,并通过Java代码示例展示了客户端与服务端之间的通信过程。
一文讲明 网络调试助手的基本使用 NetAssist
|
机器学习/深度学习 存储 数据可视化
MambaOut:状态空间模型并不适合图像的分类任务
该论文研究了Mamba架构(含状态空间模型SSM)在视觉任务(图像分类、目标检测、语义分割)中的必要性。实验表明,Mamba在这些任务中效果不如传统卷积和注意力模型。论文提出,SSM更适合长序列和自回归任务,而非视觉任务。MambaOut(不带SSM的门控CNN块)在图像分类上优于视觉Mamba,但在检测和分割任务中略逊一筹,暗示SSM在这类任务中可能仍有价值。研究还探讨了Mamba在处理长序列任务时的效率和局部信息整合能力。尽管整体表现一般,但论文为优化不同视觉任务的模型架构提供了新视角。
676 2
|
存储 PHP 对象存储
开源免费的图床源码整理汇总-个人自用图床相册程序推荐
开源免费的图床源码整理汇总-个人自用图床相册程序推荐
4204 0

热门文章

最新文章