Jeff Dean等人新作:换个角度审视语言模型,规模不够发现不了

简介: Jeff Dean等人新作:换个角度审视语言模型,规模不够发现不了

这是一篇来自谷歌、斯坦福大学、北卡罗来纳大学教堂山分校以及 DeepMind 四个机构的研究,论文从「涌现(emergence)」的角度介绍大模型,所谓的,即有些现象不存在于较小的模型中但存在于较大的模型中。

近年来,语言模型对自然语言处理 (NLP) 产生了革命性影响。众所周知,扩展语言模型,例如参数等,可以在一系列下游 NLP 任务上带来更好的性能和样本效率。在许多情况下,扩展对性能的影响通常可以通过扩展定律进行预测,一直以来,绝大多数研究者都在研究可预测现象。


相反,包括 Jeff Dean 、 Percy Liang 等在内的 16 位研究者合作的论文《 Emergent Abilities of Large Language Models 》,他们讨论了大模型不可预测现象,并称之为大型语言模型的涌现能力( emergent abilities)。所谓的,即有些现象不存在于较小的模型中但存在于较大的模型中,他们认为模型的这种能力是的。


作为一种想法已经在物理学、生物学和计算机科学等领域讨论了很长时间,本论文从的一般定义开始,该定义改编自 Steinhardt 的研究,并植根于 1972 年诺贝尔奖获得者、物理学家 Philip Anderson 的一篇名为 More Is Different 的文章。


本文探讨了模型规模的,通过训练计算和模型参数来衡量。具体而言,本文将大型语言模型的能力定义为在小规模模型中不存在、但在大规模模型中存在的能力;因此,大型模型不能通过简单地推断小规模模型的性能改进来进行预测。该研究调查了在一系列先前工作中观察到的模型能力,并将它们进行分类:小样本提示和增强提示等设置。


模型的这种能力激发了未来的研究,即为什么会获得这些能力,以及更大的规模是否会获得更多的能力,并强调了这项研究的重要性。



论文地址:https://arxiv.org/pdf/2206.07682.pdf


小样本提示任务


本文首先讨论了提示范式中的能力。例如在 GPT-3 提示中,给出预训练语言模型任务提示,模型无需进一步训练或对参数进行梯度更新即可完成响应。此外,Brown 等人提出了小样本提示,他们将模型上下文(输入)中的一些输入输出示例作为提示(preamble),然后要求模型执行未见过的推理任务。图 1 为一个提示示例。



当模型具有随机性能且具有一定规模时,通过小样本提示就可以执行任务,这时能力就会出现,之后模型性能远远高于随机性能。下图展示了 5 个语言模型系列(LaMDA、GPT-3、Gopher、Chinchilla 以及 PaLM  )的 8 种能力。



BIG-Bench:图 2A-D 描述了来自 BIG-Bench 的四个小样本提示任务,BIG-Bench 是一个由 200 多个语言模型评估基准的套件。图 2A 显示了一个算术基准,它测试了 3 位数字的加减法,以及 2 位数字的乘法。表 1 给出了 BIG-Bench 更多能力。



增强提示策略


目前来看,尽管小样本提示是与大型语言模型交互的最常见方式,但最近的工作已经提出了其他几种提示和微调策略,以进一步增强语言模型的能力。如果一项技术在应用到一个足够大的模型之前没有显示出改进或者是有害的,本文也认为该技术也是一种能力。


多步推理(Multi-step reasoning):对于语言模型和 NLP 模型来说,推理任务,尤其是那些涉及多步推理的任务一直是一个很大的挑战。最近有一种名为思维链(chain-of-thought)提示策略,通过引导语言模型在给出最终答案之前生成一系列中间步骤,从而使它们能够解决这类问题。如图 3A 所示,当扩展到 1023 次训练 FLOP(~ 100B 参数)时,思维链提示只超过了没有中间步骤的标准提示。


指令( Instruction following ):如图 3B 所示,Wei 等人发现,当训练 FLOP 为 7 · 10^21  (8B 参数)或更小时,指令微调(instruction-finetuning)技术会损害模型性能,在将训练 FLOP 扩展到 10^23 (~100B 参数)时才能提高性能。


程序执行( Program execution ):如图 3C 所示,在 8 位加法的域内评估中,使用暂存器仅有助于 ∼9 · 10^19 个训练 FLOP(40M 参数)或更大的模型。图 3D 显示这些模型也可以泛化到域外 9 位加法,它出现在 ∼1.3 · 10^20 个训练 FLOPs(100M 参数)。



本文讨论了语言模型的能力,到目前为止,仅在一定的计算规模上才能观察到有意义的性能。模型的这种能力可以跨越各种语言模型、任务类型和实验场景。这种涌现的存在意味着额外的规模扩展可以进一步扩大语言模型的能力范围。这种能力是最近发现的语言模型扩展的结果,关于它们是如何出现的,以及更多的扩展是否会带来更多的涌现能力,可能是NLP领域未来重要的研究方向。


更多内容,请参考原论文。


相关文章
|
数据安全/隐私保护
Solid Converter PDF v10 安装及使用教程
Solid Converter PDF v10 安装及使用教程
2018 0
|
8月前
|
JSON 监控 数据挖掘
用唯品会 API 实现唯品会店铺商品用户评价口碑管理
在电商竞争激烈的今天,用户评价口碑管理对销量和品牌形象至关重要。本文介绍如何利用唯品会API自动化获取、分析和响应用户评价,提升店铺运营效率。内容涵盖API基础、口碑指标计算、自动化处理及优化策略,助力商家高效管理评价数据,优化口碑,促进销售增长。
335 1
|
4月前
|
机器学习/深度学习 人工智能 搜索推荐
2026:智能体加持下大学生创造的全新职业可能
2026年,智能体技术催生大学生主导的新职业:智能体训练师、交互设计师等。这些职业依托智能体技术、凸显创新技能、兴起于当下,并需跨学科能力。适合有技术基础与探索精神的大学生,但须警惕过度依赖、忽视专业积累及市场误判风险。(239字)
242 3
|
边缘计算 容灾 网络性能优化
算力流动的基石:边缘网络产品技术升级与实践探索
本文介绍了边缘网络产品技术的升级与实践探索,由阿里云专家分享。内容涵盖三大方面:1) 云编一体的混合组网方案,通过边缘节点实现广泛覆盖和高效连接;2) 基于边缘基础设施特点构建一网多态的边缘网络平台,提供多种业务形态的统一技术支持;3) 以软硬一体的边缘网关技术实现多类型业务网络平面统一,确保不同网络间的互联互通。边缘网络已实现全球覆盖、差异化连接及云边互联,支持即开即用和云网一体,满足各行业需求。
600 4
|
10月前
|
存储 算法 数据安全/隐私保护
密码如何存储?
本文介绍了密码存储的安全策略及加密算法对比。内容涵盖明文密码风险、彩虹表攻击原理,以及如何通过加盐、迭代哈希提升安全性,推荐使用 BCrypt 算法。同时比较了 DES、AES、SM4 对称加密算法,和 RSA、ECDSA、SM2 非对称加密算法的特性与应用场景。
449 0
|
人工智能 监控 安全
容器化AI模型的安全防护:构建可信的AI服务
在AI模型广泛应用的背景下,容器化AI模型的安全防护至关重要。主要安全威胁包括数据窃取、模型窃取、对抗样本攻击和模型后门攻击等。为应对这些威胁,需采取多层次防护措施:容器安全(如使用可信镜像、限制权限)、模型安全(如加密、水印)、数据安全(如加密、脱敏)和推理安全(如输入验证、异常检测)。此外,利用开源工具如Anchore Engine、Falco和ART等,可进一步加强防护。遵循安全开发生命周期、最小权限原则和深度防御等最佳实践,确保AI服务的安全性和可信度。
|
供应链 监控 安全
业务上云的主要安全风险及网络安全防护建议
业务上云面临数据泄露、配置错误、IAM风险、DDoS攻击、合规与审计、供应链及内部威胁等安全挑战。建议采取全生命周期加密、自动化配置检查、动态权限管理、流量清洗、合规性评估、供应链可信验证及操作审批等措施,构建“预防-检测-响应”一体化安全体系,确保数据保护、权限收敛、合规审计和弹性防护,保障云端业务安全稳定运行。
1674 1
此用户不允许自调用(isv.self-invoke-forbidden)-处理方案
说明   如果您在调用蚂蚁金服接口出现这个错误,说明您请求的appid(年份开头)属于第三方应用不允许自己appid请求蚂蚁金服接口   简单来说:如果您出现这个报错说明不可以自调用,只能走以下两个方案进行接口测试。
4639 12
|
数据采集 人工智能 DataWorks
《解锁数据版本“魔方”:DataWorks护航AI模型训练》
DataWorks是一款强大的大数据开发治理平台,特别适用于人工智能模型训练数据的版本控制。通过详细的数据溯源和版本记录,它确保了模型训练的可重复性和可追溯性。DataWorks支持定期快照、版本标记及分支管理,保障多团队并行开发时的数据一致性。在多阶段模型训练中,从预处理到上线,DataWorks实现全流程版本控制,确保模型的稳定性和安全性。其灵活架构和强大功能,助力企业和研发团队提升模型训练的质量与效率,在AI领域占据优势。
220 0
|
机器学习/深度学习 人工智能 TensorFlow
深度学习中的图像识别技术:从理论到实践
【8月更文挑战第1天】在人工智能的广阔天地中,深度学习以其强大的数据处理能力成为图像识别领域的核心技术之一。本文将深入探讨深度学习在图像识别中的应用,通过一个实际案例展示如何利用Python和TensorFlow框架实现简单的图像分类模型。文章不仅解析了关键技术点,还提供了代码示例,帮助读者从理论走向实践。
510 6

热门文章

最新文章