Qwen2.5-Math: 世界领先的数学开源大语言模型

简介: Qwen2.5-Math: 世界领先的数学开源大语言模型

本文作者 | 通义千问团队

🚨Qwen2.5-Math主要被设计用于通过CoT或TIR的方式解中英数学题,我们不推荐在其他任务上使用该系列模型。


一个月前,我们开源了Qwen家族的第一款数学专项大语言模型Qwen2-Math。今天,我们将它升级并开源Qwen2.5-Math系列,包括基础模型Qwen2.5-Math-1.5B/7B/72B,指令微调模型Qwen2.5-Math-1.5B/7B/72B-Instruct和数学奖励模型Qwen2.5-Math-RM-72B。


相较于Qwen2-Math只支持使用思维链(CoT,Chain of Thought)解答英文数学题目,Qwen2.5系列扩展为同时支持使用思维链和工具集成推理(TIR,Tool-integrated Reasoning)解决中英双语的数学题。相比上一代,Qwen2.5-Math系列在中文和英文的数学解题能力上均实现了显著提升。



虽然CoT在增强LLM的推理能力方面发挥着重要作用,但它在实现计算精度和处理复杂的数学或算法推理任务方面依然面临挑战,例如,寻找二次方程的根或计算矩阵的特征值等等。而TIR(如使用python解释器)可以进一步提高模型在精确计算、符号操作和算法操作方面的能力。Qwen2.5-Math-1.5B/7B/72B-Instruct 使用TIR在MATH基准测试中分别达到79.7、85.3 和 87.8的高分。


基座模型:Qwen2.5-Math



Qwen2-Math和Qwen2.5-Math的整体训练流程如上图所示。在训练完 Qwen2-Math基础模型后,我们通过三个主要途径将其进一步升级为Qwen2.5-Math模型:


1)利用Qwen2-Math-72B-Instruct模型合成更多高质量的数学预训练数据。


2)通过多轮召回从网络资源、书籍和代码中获取更多高质量的数学数据,尤其是中文数学数据。


3)利用Qwen2.5系列基础模型进行参数初始化,它们相比Qwen2有更强大的语言理解、代码生成和文本推理能力。


最终,我们为Qwen2.5-Math-1.5B/7B/72B构建了名为Qwen Math Corpus v2的预训练数据集,并保持上下文长度为4K。与用于Qwen2-Math预训练的Qwen Math Corpus v1相比,Qwen Math Corpus v2的总token数量从700B增加到超过1T。


我们在三个广泛使用的英语数学基准GSM8K、MATH和MMLU-STEM上评估了我们的Qwen2.5-Math基础模型。此外,我们还评估了三个中国数学基准CMATH、GaoKao Math Cloze和GaoKao Math QA。所有评估都使用few-shot CoT的方式进行测试。



与Qwen2-Math-1.5B/7B/72B相比,Qwen2.5-Math-1.5B/7B/72B在各项测试中均取得了显著提升,例如,Qwen2.5-Math-1.5B/7B/72B在MATH评测集中分别提升了5.4、5.0、6.3分,在GaoKao Math QA中分别提升了3.4、12.2、19.8 分。


指令微调模型:

Qwen2.5-Math-Instruct


与Qwen2-Math-Instruct类似,我们基于Qwen2.5-Math-72B训练了一个数学专用奖励模型Qwen2.5-Math-RM-72B。此RM通过拒绝抽样构建SFT数据,也用于SFT之后的GRPO强化学习。


在Qwen2.5-Math-Instruct的开发过程中,我们额外使用Qwen2-Math-Instruct模型和Qwen2.5-Math-RM-72B进行了迭代,以在拒绝抽样期间进一步提高解题过程的质量。


与Qwen2-Math的后训练相比,我们进一步为Qwen2.5后训练引入了中文和英文的TIR数据和CoT数据。


我们在英文和中文的数学基准上评估Qwen2.5-Math-Instruct。除了广泛使用的基准测试(例如GSM8K和Math)之外,我们还涉及更多更具挑战性的考试,以全面评估Qwen2.5-Math-Instruct的数学能力,例如OlympiadBench、CollegeMath、GaoKao、AIME2024和AMC2023。对于中国数学基准测试,我们使用CMATH、Gaokao(中国大学入学考试2024)和 CN Middle School 24(中国高中入学考试 2024)。


我们报告了零样本设置下所有基准测试的Greedy、Maj@8和RM@8性能,而多项选择基准测试(包括MMLU STEM、GaoKao、CN Middle School 24中的多项选择题)采用5样本设置。


实验结果表明,Qwen2.5-Math-72B-Instruct模型在英文和中文上分别比上一代Qwen2-Math-72B-Instruct模型平均高出4.4分和6.1分,成为目前最好的开源数学模型。


旗舰模型Qwen2.5-Math-72B-Instruct的表现显著优于开源模型和领先的闭源模型(例如GPT-4o、Gemini Math-Specialized 1.5 Pro)。在RM@8的TIR设置下,在MATH上取得了92.9的高分。


借助72B模型的合成预训练和监督微调数据,Qwen2.5-Math-7B-Instruct在性能上超越了Qwen2-Math-Instruct 72B。在CoT和TIR设置下,其MATH分数分别达到83.6和85.3。


即使是我们最小的1.5B模型,在使用Python解释器时也能达到80左右的数学分数,优于该领域当前的大多数模型。




在AIME 2024和AMC 2023等更复杂的数学竞赛评估中,Qwen2.5-Math-Instruct在各种设置中也表现良好,包括Greedy、Maj@64、RM@64和RM@256。


在Qwen2.5-Math-RM-72B的支持下,Qwen2.5-Math-1.5B-Instruct使用CoT模式下的RM@256,成功解决了AMC 2023的40道题中的29道。


此外,Qwen2.5-Math-72B-Instruct在TIR模式下几乎获得了满分,解决了几乎所有的问题。

在极难的AIME 2024基准测试中,Claude3 Opus、GPT-4 Turbo和Gemini 1.5 Pro只能解决30道题中的1或2道。


相比之下,Qwen2.5-Math-72B-Instruct在贪婪解码CoT模式下解决了9道题,在TIR模式下解决了12道题。在RM的帮助下,Qwen2.5-Math-7B-Instruct甚至可以解决多达21道题,进一步展现了Qwen2.5-Math-Instruct出色的数学解题能力。



测试集去污染


测试集去污染对于确保模型性能评估的公正性至关重要。


遵循先前的工作Qwen2,我们使用13-gram匹配排除可能受污染的训练样本。为了提高此匹配过程的准确性,我们执行文本规范化、删除不相关的标点符号等规范化操作。


为了进一步减少假阴性,特别是对于常见的数学表达式,我们引入了一个附加标准:最长公共子序列的比率必须超过0.6,样本才被视为受污染。


对于预训练数据,我们根据GSM8K和MATH等数据集的测试集过滤可能受污染的样本。


在指令微调和强化学习阶段(包括SFT数据、RM训练数据和RL的query),我们会排除所有报告的评估数据集中任何可能受污染的问题或解题过程。这些评估数据集包括GSM8K、MATH、Minerva Math、Gaokao 2023 En、Olympiad Bench、College Math、MMLU STEM、GaoKao、CMATH、CN Middle School 24、AIME 24和AMC 23。


在分析受污染样本的过程中,我们发现一些现有的训练数据集(例如MATH训练数据集)包含相当一部分与测试数据集中的概念或结构高度相似的问题。虽然这些变化不是完全重复的,但它们可能会损害我们评估的完整性。因此,我们继续从训练语料库中排除此类样本。


Demo


我们开发了一个支持TIR模式的Demo——Qwen-Agent,它允许用户在本地执行代码以体验Qwen2.5-Math的TIR能力。



此外,我们也在Hugging Face和魔搭社区ModelScope提供了一个多模态的数学Demo。该WebUI利用Qwen2-VL进行OCR并用Qwen2-Math进行数学推理。你可以直接输入数学和算术的图片、文本或者草图。


总结


我们推出了Qwen2.5-Math,它有以下几个关键的技术亮点:


(1)在预训练阶段大量使用来自Qwen2-Math的合成数学数据。


(2)在后训练阶段迭代生成微调数据,并在奖励模型的指导下进行强化训练。


(3)支持双语(英语和中文)解题,以及思路链和工具集成推理能力。


Qwen2.5-Math代表了迄今为止最先进的开源数学模型系列。Qwen2.5-Math-1.5B-Instruct模型已经超越了大多数之前的70B内大小的数学模型,而Qwen2.5-Math-7B-Instruct的性能与Qwen2-Math-72B-Instruct相当。我们的旗舰模型Qwen2.5-Math-7B-Instruct的表现优于Qwen2-Math-72B-Instruct,在7项英文数学和3项中文数学任务中平均得分分别提高了4.4分和6.1分。


我们希望我们在Qwen2.5-Math等数学专项模型上取得的进步可以继续增强 Qwen 通用模型的整体能力,并使我们更接近实现通用人工智能。


Qwen2.5-Math 论文链接:

https://arxiv.org/pdf/2409.12122

相关文章
|
12月前
|
人工智能 算法 开发者
开源VLM“华山论剑”丨AI Insight Talk多模态专场直播预告
开源VLM“华山论剑”丨AI Insight Talk多模态专场直播预告
1051 10
开源VLM“华山论剑”丨AI Insight Talk多模态专场直播预告
|
11月前
|
分布式计算 测试技术 Spark
科大讯飞开源星火化学大模型、文生音效模型
近期,科大讯飞在魔搭社区(ModelScope)和Gitcode上开源两款模型:讯飞星火化学大模型Spark Chemistry-X1-13B、讯飞文生音频模型AudioFly,助力前沿化学技术研究,以及声音生成技术和应用的探索。
852 2
|
11月前
|
机器学习/深度学习 数据采集 人工智能
通义实验室Mobile-Agent-v3开源,全平台SOTA的GUI智能体,支持手机电脑等多平台交互
近日,通义实验室MobileAgent团队正式开源全新图形界面交互基础模型 GUI-Owl,并同步推出支持多智能体协同的自动化框架 Mobile-Agent-v3。该模型基于Qwen2.5-VL打造,在手机端与电脑端共8个GUI任务榜单中全面刷新开源模型性能纪录,达成全平台SOTA。
3007 2
|
12月前
|
数据采集 机器学习/深度学习 编解码
小红书 hi lab开源最强多模态大模型dots.vlm1,性能对标闭源 Gemini 2.5 Pro 和 Seed-VL1.5
小红书 hi lab开源最强多模态大模型dots.vlm1,性能对标闭源 Gemini 2.5 Pro 和 Seed-VL1.5
990 0
小红书 hi lab开源最强多模态大模型dots.vlm1,性能对标闭源 Gemini 2.5 Pro 和 Seed-VL1.5
|
12月前
智谱发布GLM-4.5V,全球开源多模态推理新标杆,Day0推理微调实战教程到!
视觉语言大模型(VLM)已经成为智能系统的关键基石。随着真实世界的智能任务越来越复杂,VLM模型也亟需在基本的多模态感知之外,逐渐增强复杂任务中的推理能力,提升自身的准确性、全面性和智能化程度,使得复杂问题解决、长上下文理解、多模态智能体等智能任务成为可能。
1416 0
|
12月前
|
编解码 算法 测试技术
MiniCPM-V4.0开源,多模态能力进化,手机可用,还有最全CookBook!
今天,面壁小钢炮新一代多模态模型 MiniCPM-V 4.0 正式开源。依靠 4B 参数,取得 在 OpenCompass、OCRBench、MathVista 等多个榜单上取得了同级 SOTA 成绩,且 实现了在手机上稳定、丝滑运行。此外,官方也正式开源了 推理部署工具 MiniCPM-V CookBook,帮助开发者面向不同需求、不同场景、不同设备,均可实现开箱即用的轻量、简易部署。
1585 0
|
11月前
|
人工智能 Java 开发者
阿里出手!Java 开发者狂喜!开源 AI Agent 框架 JManus 来了,初次见面就心动~
JManus是阿里开源的Java版OpenManus,基于Spring AI Alibaba框架,助力Java开发者便捷应用AI技术。支持多Agent框架、网页配置、MCP协议及PLAN-ACT模式,可集成多模型,适配阿里云百炼平台与本地ollama。提供Docker与源码部署方式,具备无限上下文处理能力,适用于复杂AI场景。当前仍在完善模型配置等功能,欢迎参与开源共建。
3419 58
阿里出手!Java 开发者狂喜!开源 AI Agent 框架 JManus 来了,初次见面就心动~
|
12月前
|
人工智能 算法 测试技术
轻量高效,8B 性能强劲书生科学多模态模型Intern-S1-mini开源
继 7 月 26 日开源『书生』科学多模态大模型 Intern-S1 之后,上海人工智能实验室(上海AI实验室)在8月23日推出了轻量化版本 Intern-S1-mini。
1625 49

热门文章

最新文章