本文作者 | 通义千问团队
🚨Qwen2.5-Math主要被设计用于通过CoT或TIR的方式解中英数学题,我们不推荐在其他任务上使用该系列模型。
一个月前,我们开源了Qwen家族的第一款数学专项大语言模型Qwen2-Math。今天,我们将它升级并开源Qwen2.5-Math系列,包括基础模型Qwen2.5-Math-1.5B/7B/72B,指令微调模型Qwen2.5-Math-1.5B/7B/72B-Instruct和数学奖励模型Qwen2.5-Math-RM-72B。
相较于Qwen2-Math只支持使用思维链(CoT,Chain of Thought)解答英文数学题目,Qwen2.5系列扩展为同时支持使用思维链和工具集成推理(TIR,Tool-integrated Reasoning)解决中英双语的数学题。相比上一代,Qwen2.5-Math系列在中文和英文的数学解题能力上均实现了显著提升。
虽然CoT在增强LLM的推理能力方面发挥着重要作用,但它在实现计算精度和处理复杂的数学或算法推理任务方面依然面临挑战,例如,寻找二次方程的根或计算矩阵的特征值等等。而TIR(如使用python解释器)可以进一步提高模型在精确计算、符号操作和算法操作方面的能力。Qwen2.5-Math-1.5B/7B/72B-Instruct 使用TIR在MATH基准测试中分别达到79.7、85.3 和 87.8的高分。
基座模型:Qwen2.5-Math
Qwen2-Math和Qwen2.5-Math的整体训练流程如上图所示。在训练完 Qwen2-Math基础模型后,我们通过三个主要途径将其进一步升级为Qwen2.5-Math模型:
1)利用Qwen2-Math-72B-Instruct模型合成更多高质量的数学预训练数据。
2)通过多轮召回从网络资源、书籍和代码中获取更多高质量的数学数据,尤其是中文数学数据。
3)利用Qwen2.5系列基础模型进行参数初始化,它们相比Qwen2有更强大的语言理解、代码生成和文本推理能力。
最终,我们为Qwen2.5-Math-1.5B/7B/72B构建了名为Qwen Math Corpus v2的预训练数据集,并保持上下文长度为4K。与用于Qwen2-Math预训练的Qwen Math Corpus v1相比,Qwen Math Corpus v2的总token数量从700B增加到超过1T。
我们在三个广泛使用的英语数学基准GSM8K、MATH和MMLU-STEM上评估了我们的Qwen2.5-Math基础模型。此外,我们还评估了三个中国数学基准CMATH、GaoKao Math Cloze和GaoKao Math QA。所有评估都使用few-shot CoT的方式进行测试。
与Qwen2-Math-1.5B/7B/72B相比,Qwen2.5-Math-1.5B/7B/72B在各项测试中均取得了显著提升,例如,Qwen2.5-Math-1.5B/7B/72B在MATH评测集中分别提升了5.4、5.0、6.3分,在GaoKao Math QA中分别提升了3.4、12.2、19.8 分。
指令微调模型:
Qwen2.5-Math-Instruct
与Qwen2-Math-Instruct类似,我们基于Qwen2.5-Math-72B训练了一个数学专用奖励模型Qwen2.5-Math-RM-72B。此RM通过拒绝抽样构建SFT数据,也用于SFT之后的GRPO强化学习。
在Qwen2.5-Math-Instruct的开发过程中,我们额外使用Qwen2-Math-Instruct模型和Qwen2.5-Math-RM-72B进行了迭代,以在拒绝抽样期间进一步提高解题过程的质量。
与Qwen2-Math的后训练相比,我们进一步为Qwen2.5后训练引入了中文和英文的TIR数据和CoT数据。
我们在英文和中文的数学基准上评估Qwen2.5-Math-Instruct。除了广泛使用的基准测试(例如GSM8K和Math)之外,我们还涉及更多更具挑战性的考试,以全面评估Qwen2.5-Math-Instruct的数学能力,例如OlympiadBench、CollegeMath、GaoKao、AIME2024和AMC2023。对于中国数学基准测试,我们使用CMATH、Gaokao(中国大学入学考试2024)和 CN Middle School 24(中国高中入学考试 2024)。
我们报告了零样本设置下所有基准测试的Greedy、Maj@8和RM@8性能,而多项选择基准测试(包括MMLU STEM、GaoKao、CN Middle School 24中的多项选择题)采用5样本设置。
实验结果表明,Qwen2.5-Math-72B-Instruct模型在英文和中文上分别比上一代Qwen2-Math-72B-Instruct模型平均高出4.4分和6.1分,成为目前最好的开源数学模型。
旗舰模型Qwen2.5-Math-72B-Instruct的表现显著优于开源模型和领先的闭源模型(例如GPT-4o、Gemini Math-Specialized 1.5 Pro)。在RM@8的TIR设置下,在MATH上取得了92.9的高分。
借助72B模型的合成预训练和监督微调数据,Qwen2.5-Math-7B-Instruct在性能上超越了Qwen2-Math-Instruct 72B。在CoT和TIR设置下,其MATH分数分别达到83.6和85.3。
即使是我们最小的1.5B模型,在使用Python解释器时也能达到80左右的数学分数,优于该领域当前的大多数模型。
在AIME 2024和AMC 2023等更复杂的数学竞赛评估中,Qwen2.5-Math-Instruct在各种设置中也表现良好,包括Greedy、Maj@64、RM@64和RM@256。
在Qwen2.5-Math-RM-72B的支持下,Qwen2.5-Math-1.5B-Instruct使用CoT模式下的RM@256,成功解决了AMC 2023的40道题中的29道。
此外,Qwen2.5-Math-72B-Instruct在TIR模式下几乎获得了满分,解决了几乎所有的问题。
在极难的AIME 2024基准测试中,Claude3 Opus、GPT-4 Turbo和Gemini 1.5 Pro只能解决30道题中的1或2道。
相比之下,Qwen2.5-Math-72B-Instruct在贪婪解码CoT模式下解决了9道题,在TIR模式下解决了12道题。在RM的帮助下,Qwen2.5-Math-7B-Instruct甚至可以解决多达21道题,进一步展现了Qwen2.5-Math-Instruct出色的数学解题能力。
测试集去污染
测试集去污染对于确保模型性能评估的公正性至关重要。
遵循先前的工作Qwen2,我们使用13-gram匹配排除可能受污染的训练样本。为了提高此匹配过程的准确性,我们执行文本规范化、删除不相关的标点符号等规范化操作。
为了进一步减少假阴性,特别是对于常见的数学表达式,我们引入了一个附加标准:最长公共子序列的比率必须超过0.6,样本才被视为受污染。
对于预训练数据,我们根据GSM8K和MATH等数据集的测试集过滤可能受污染的样本。
在指令微调和强化学习阶段(包括SFT数据、RM训练数据和RL的query),我们会排除所有报告的评估数据集中任何可能受污染的问题或解题过程。这些评估数据集包括GSM8K、MATH、Minerva Math、Gaokao 2023 En、Olympiad Bench、College Math、MMLU STEM、GaoKao、CMATH、CN Middle School 24、AIME 24和AMC 23。
在分析受污染样本的过程中,我们发现一些现有的训练数据集(例如MATH训练数据集)包含相当一部分与测试数据集中的概念或结构高度相似的问题。虽然这些变化不是完全重复的,但它们可能会损害我们评估的完整性。因此,我们继续从训练语料库中排除此类样本。
Demo
我们开发了一个支持TIR模式的Demo——Qwen-Agent,它允许用户在本地执行代码以体验Qwen2.5-Math的TIR能力。
此外,我们也在Hugging Face和魔搭社区ModelScope提供了一个多模态的数学Demo。该WebUI利用Qwen2-VL进行OCR并用Qwen2-Math进行数学推理。你可以直接输入数学和算术的图片、文本或者草图。
总结
我们推出了Qwen2.5-Math,它有以下几个关键的技术亮点:
(1)在预训练阶段大量使用来自Qwen2-Math的合成数学数据。
(2)在后训练阶段迭代生成微调数据,并在奖励模型的指导下进行强化训练。
(3)支持双语(英语和中文)解题,以及思路链和工具集成推理能力。
Qwen2.5-Math代表了迄今为止最先进的开源数学模型系列。Qwen2.5-Math-1.5B-Instruct模型已经超越了大多数之前的70B内大小的数学模型,而Qwen2.5-Math-7B-Instruct的性能与Qwen2-Math-72B-Instruct相当。我们的旗舰模型Qwen2.5-Math-7B-Instruct的表现优于Qwen2-Math-72B-Instruct,在7项英文数学和3项中文数学任务中平均得分分别提高了4.4分和6.1分。
我们希望我们在Qwen2.5-Math等数学专项模型上取得的进步可以继续增强 Qwen 通用模型的整体能力,并使我们更接近实现通用人工智能。
Qwen2.5-Math 论文链接: