没有推理轨迹,如何“偷走”模型的推理能力?

简介: 本文介绍Cornell Tech提出的“推理轨迹反演”(Trace Inversion)技术:攻击者仅凭黑盒模型输出的答案(及可选摘要),即可合成高质量推理链,用于蒸馏训练学生模型。实验证明,该方法在数学与科学任务上显著提升学生模型性能,甚至优于使用真实思维链的训练效果,揭示了隐藏思维链并非绝对防线。

很多推理模型在回答复杂问题时,会在内部进行长链条推理,但这些完整的推理轨迹(Reasoning Trace),也就是我们常说的思维链,并不会全部展示给用户。不少推理模型的 API 会保留完整的内部推理,只返回最终答案,或附上一段压缩后的推理摘要(Reasoning Summary)。

这样设计一方面是出于安全考虑,也能减少完整推理轨迹被用于模型蒸馏的风险。相比只提供最终答案,完整的逐步推理过程会包含更丰富的训练信号。如果拿这些数据去训练另一个模型,后者可以学习老师模型是如何拆解问题、推进中间步骤,以及怎样抵达最终结果。隐藏完整的思维链,也因此被视为降低模型蒸馏风险的一道防线。

Cornell Tech 的 Tingwei Zhang、John X. Morris 和 Vitaly Shmatikov 在论文「How to Steal Reasoning Without Reasoning Traces]中提出了一个新问题:如果模型只开放答案,最多再附上一段推理摘要,能不能迁移出来其中的推理能力?

他们给出的答案是推理轨迹反演(Trace Inversion)。攻击者不需要获得目标模型内部真实的推理轨迹,只利用问题、最终答案以及可选的推理摘要,能重新生成一条详细、合成的推理轨迹,再拿这些数据训练自己的模型。实验数据显示,这些重新生成的轨迹不仅能提高学生模型的推理能力,在部分任务上,训练效果甚至超过目标模型原始的推理轨迹。

隐藏思维链的防线

先来看论文讨论的问题。

假设一个推理模型收到问题 x,内部产生一条完整的推理轨迹 t,最后输出答案 y。在推理模型的 API 中,用户能看到的内容可能只有答案 y,或者再加上一段压缩完整的推理后得到的摘要 b。

这样,外部用户会缺少最有价值的一部分监督数据:x→t→y

如果只收集到 x→y 的数据,能拿来做模型蒸馏的训练信号会少很多。论文的实验也说明了这点,只拿目标模型答案训练学生模型,并不一定能有效地迁移推理能力,在某些情况下学生模型的表现甚至会低于训练前。

推理轨迹反演改变了这个思路。既然拿不到 t,那就额外训练一个模型。根据已知的起点和终点重新构造 $$\hat{t$$:

$$(x,b,y) \rightarrow \hat{t}$$

甚至在没有推理摘要的情况下构建:

$$(x,y) \rightarrow \hat{t}$$

上面的

$$\hat{t$$

就是合成推理轨迹(Synthetic Reasoning Trace)。论文的攻击目标很明确。没必要精确复现目标模型内部发生过的每一步,只要逻辑上能够连接问题和答案,并且可以成为有效的微调(Fine-tuning)数据,那它就有价值。

图 1:一道向量题展示最基础的推理轨迹反演:左侧只有查询、推理摘要和最终答案,右侧被扩展成一段完整的合成推理轨迹

推理轨迹反演的三阶段

论文把整个推理轨迹反演拆成三个阶段,其中最关键的地方,是先用一个能够获得推理轨迹的代理模型训练推理轨迹反演模型(Inversion Model),再把它迁移到真正的目标模型上。

第一阶段是训练反演模型。攻击者从公开的推理数据集中抽取问题,发送给自己的代理模型,得到完整推理轨迹 t' 和答案 y'。本次实验中使用的代理模型包括 DeepSeek-R1,以及规模小很多的 DeepSeek-R1-Distill-Qwen-1.5B,论文将后者记为 R1-Weak。

为了模拟推理模型 API,完整的代理模型推理还可以被压缩成推理摘要 b'。这样攻击者手里就有了一组完整对应关系:

$$(x', b', y') \rightarrow t'$$

接下来,用这些数据训练反演模型,让它学习如何根据问题、摘要和答案恢复一条完整的推理轨迹。论文同时训练了无摘要版本,只给模型 x' 和 y',让它生成 t'。

第二阶段才会开始调用真正的目标模型。攻击者向目标模型发送另一批问题,收集它开放出来的问题、推理摘要和答案,然后交给刚刚训练好的反演模型。对于 GPT-5.4 mini 这样的黑盒模型,攻击者从头到尾都接触不到它内部真实的推理轨迹。

第三阶段是学生模型蒸馏。反演模型生成合成推理轨迹后,再把它和目标模型给出的答案组合成训练样本:

$$x \rightarrow [\hat{t}; y]$$

这些数据后面会用来微调学生模型。论文选择 Qwen2.5-7B-Instruct 和 Llama-3.1-8B-Instruct 作为学生模型,最终评价的重点也从“合成轨迹像不像真实轨迹”,转移到了“这些轨迹能不能提高学生模型的推理能力”。

图 2:反演的三阶段流程,Stage 1 代理模型生成训练数据、Stage 2 目标模型输出反演、Stage 3 学生模型蒸馏

合成推理轨迹的质量

要判断推理轨迹反演到底生成了什么,作者先选择 DeepSeek-R1 作为目标模型。由于可以获取 R1 的完整推理轨迹,因此可以将合成推理轨迹与真实推理轨迹放在一起比较。

结果很有意思。R1 的原始推理轨迹平均约有 6,131 tokens。如果只通过提示词,让 Qwen 根据问题和答案补出推理过程,生成结果平均只有约 1,000 tokens,Token 重叠 F1 约为 35~38。这说明,单靠“根据答案解释过程”这样的提示词,很难生成接近原始长度的完整推理轨迹。

图 3:对比了 Zero-shot、R1 代理模型和 R1-Weak 代理模型在“摘要 / 无摘要”两种设置下的长度、BLEU、Token F1 和 ROUGE 指标

对专门的反演模型进行微调后,性能得到了明显的提升。即使训练数据来自能力弱很多的 R1-Weak,在提供推理摘要时,生成的合成轨迹平均能达到 4,972 tokens,约为 R1 原始轨迹长度的 81%,Token F1 达到 52.76;去掉推理摘要后,合成轨迹的平均长度仍能达到 5,434 tokens,Token F1 为 49.01

这里可以看出两点。首先,推理轨迹反演需要专门学习“从结果构造推理过程”的能力,简单的零样本提示很难达到相同效果。其次,反演模型本身不需要和目标模型一样强,能力较弱的代理模型提供的推理数据,也足以帮助它学会一种可以迁移的推理轨迹生成方式。

推理能力的迁移效果

轨迹相似度只是辅助指标,这篇论文更看重合成推理轨迹能否提升学生模型的下游任务表现。对于黑盒模型,外界无法获取它们真实的内部推理,因此“是否准确复原原始推理轨迹”很难验证。所以,论文关心的是合成推理轨迹能否成为有效的训练信号。

图 4:黑盒实验的核心结果表

在开放模型实验中,作者先以 R1 作为目标模型,并使用 R1-Weak 作为弱代理模型。在 JEEBench 上,如果 Qwen 学生模型学习 R1-Weak 自己生成的代理推理轨迹,准确率只有 19.7%;将 R1 的答案和推理摘要交给反演模型,再使用生成的合成推理轨迹训练,准确率可以提高到 36.3%。作为对照,如果能够使用 R1 的真实推理轨迹进行训练,准确率为 43.7%

这说明,弱代理模型自身生成的推理数据质量有限,但这些数据可以帮助反演模型学会“如何构造推理轨迹”。再结合能力更强的目标模型给出的高质量答案,生成的合成推理轨迹可以成为比弱代理模型自身推理轨迹更有效的训练数据。

接下来,作者将目标模型换成黑盒模型 GPT-5.4 mini。由于无法获取完整推理轨迹,实验只能使用模型返回的推理摘要和最终答案。

在 MATH500 上,Qwen 学生模型只学习 GPT-5.4 mini 的答案时,准确率为 68.4%;使用 R1 训练的反演模型生成合成推理轨迹后,准确率提高到 76.0%。Llama 的差异更加明显,仅使用答案训练时为 13.0%,加入合成推理轨迹后提高到 52.4%。在 JEEBench 上,Qwen 从 27.6% 提高到 43.7%,Llama 则从 6.3% 提高到 19.9%

另一个值得注意的结果是,单纯把推理摘要和答案放在一起训练,效果并不好。Qwen 在 MATH500 上只有 19.8%,JEEBench 甚至只有 1.6%。这说明,面向用户的短摘要本身未必适合作为学生模型的监督信号。推理轨迹反演所做的工作,其实是把这些高度压缩的信息重新展开,生成更适合用于训练的完整推理过程。

合成推理的训练价值

这篇论文还有一个很反直觉的结果:在部分实验中,使用合成推理轨迹训练出来的学生模型,表现甚至超过了使用目标模型真实推理轨迹训练的对照组。

图 5:左侧 R1 的真实推理轨迹 & 右侧合成推理轨迹

例如,在以 R1 为目标模型的实验中,Qwen 在 MATH500 上使用 R1 真实推理轨迹训练时,成绩为 72.2%;改用 R1 反演模型生成的合成推理轨迹后,可以达到 74.4%。Llama 在无摘要设置下,使用真实推理轨迹时为 59.6%,使用合成推理轨迹后提高到 62.0%。类似现象也出现在部分 JEEBench 实验中。

作者认为,这和真实推理轨迹本身的形态有关。模型解决问题时,内部推理可能包含尝试、回退、放弃某条路线后重新寻找方法等过程。这类轨迹能够保留完整求解过程,同时也会把不少无效尝试和错误路径带进训练数据。

反演模型的生成条件有所不同。它在生成推理轨迹前就看到了正确答案,因此可以围绕这个结果组织一条更连贯的正向推理过程,过滤掉原始轨迹中的试错和回退。这样一来,合成推理轨迹还能起到一定的“去噪”作用,让监督数据更加集中。

这个结果也进一步拓展了论文讨论的问题。对于模型训练来说,推理轨迹的价值除了取决于它是否忠实记录当时的求解过程,也取决于它能否提供清晰、稳定、易于学习的监督信号。真实的求解过程,与更适合模型学习的推理过程,可能存在差异。

小结

不过,论文标题中的“Steal Reasoning”容易让人误以为,只看模型答案就能还原其内部真实思维链。论文目前并没有证明这一点。对于 R1,作者还能比较合成轨迹和真实轨迹;到了 GPT-5.4 mini 这类闭源模型,真实推理轨迹无法获取,也就无法判断两者究竟有多接近。

因此,推理轨迹反演更适合理解为一种根据强模型输出重新构造训练过程的方法:已知问题和答案后,反演模型在两者之间生成一条高质量的推理路径。推理摘要可以提供额外线索,但即使去掉摘要,只保留问题和答案,这种方法仍有一定效果。

当前方法的局限也比较明显。在 LiveCodeBench 上,合成推理轨迹的收益弱于数学和科学推理任务,部分设置下甚至出现性能下降。现有证据主要集中在数学和结构化推理任务,它能否稳定迁移到代码、Agent、多模态和工具调用场景,还需要更多实验验证。

相关文章
|
22天前
|
人工智能 弹性计算 安全
从试点到规模化:2026企业级Agent解决方案落地路径全解析
2026年是企业级AI智能体规模化落地关键年。本文以瓴羊AgentOne为标杆,解析从PoC到生产的四大突破:长时任务、多Agent协同、弹性伸缩与全链路可观测,并提出“模型-技能-执行”三层解耦架构,强调场景优先、数据先行、安全内嵌、人机协同,助力企业真正实现AI增效。
|
2月前
|
存储 人工智能 缓存
企业AI私有化与云端协同方案:GLM5.2部署+OpenClaw/Hermes运维教程
GLM 5.2是一款753B混合专家架构开源旗舰大模型,原生支持百万Token超长上下文、复杂代码工程、长周期自主智能体任务,完整支持本地、私有云自托管部署。自托管模式能够实现全部业务数据不出环境、企业自定义推理调度、全链路操作私有化审计,对数据安全管控有严格要求的研发、金融、政企团队具备不可替代价值。整套落地链路包含硬件分级选型、多量化权重存储配置、vLLM/SGLang双推理框架部署、长期使用成本盈亏测算四大核心模块,同时可搭配轻量应用服务器部署OpenClaw、Hermes两类主流AI智能体,结合百炼Token Plan云端订阅算力构建混合AI架构,兼顾私有化数据安全与云端灵活弹性
366 1
|
8月前
|
机器学习/深度学习 人工智能 自然语言处理
模型训练篇|多阶段ToolRL打造更可靠的AI导购助手
芝麻租赁推出AI导购“租赁小不懂”,针对长周期、重决策租赁场景,首创“One-Model + Tool-Use”架构与两阶段强化学习,攻克需求难匹配、决策效率低、服务被动三大痛点,实现响应提速78%、推荐成功率提升14.93%,打造贴切、沉浸、信任的场景化租赁体验。(239字)
692 25
模型训练篇|多阶段ToolRL打造更可靠的AI导购助手
|
机器学习/深度学习 人工智能 数据可视化
AI开源框架:让分布式系统调试不再"黑盒"
Ray是一个开源分布式计算框架,专为支持可扩展的人工智能(AI)和Python应用程序而设计。它通过提供简单直观的API简化分布式计算,使得开发者能够高效编写并行和分布式应用程序 。Ray广泛应用于深度学习训练、大规模推理服务、强化学习以及AI数据处理等场景,并构建了丰富而成熟的技术生态。
2120 102
AI开源框架:让分布式系统调试不再"黑盒"
|
5月前
|
存储 缓存 并行计算
DeepSeek-V4 深度解读:百万上下文背后的工程细节
DeepSeek-V4系列突破百万token上下文瓶颈:V4-Pro单token推理FLOPs仅V3.2的27%,KV Cache压至10%;V4-Flash更达10%与7%。依托CSA/HCA混合注意力、mHC残差、Muon优化器与FP4量化,实现长上下文“能用、好用、日常用”。
1884 0
|
12月前
|
人工智能 监控 搜索推荐
给RAG打分:小白也能懂的AI系统评测全攻略
RAG系统评估听起来高深,其实跟我们生活中的'尝鲜评测'没啥两样!本文用轻松幽默的方式,带你从检索质量、生成质量到用户体验,全方位掌握如何科学评测RAG系统,避免踩坑,让你的AI应用又快又准。#RAG技术 #AI评估 #信息检索 #大模型 #数据科学
691 9
|
6月前
|
人工智能 安全 Linux
【OpenClaw小龙虾AI保姆级教程】1分钟阿里云/Win11/Mac/Linux部署配置免费API+2868个Skill精选实战
截至2026年2月,OpenClaw官方技能市场ClawHub已收录超过5705个社区构建的技能,而经过严格筛选的awesome-openclaw-skills项目,最终收录2868个优质技能(过滤了1180个垃圾账号测试技能、672个加密货币相关技能、492个重复技能、396个恶意技能及8个非英文描述技能)。本文基于参考文章核心逻辑,结合2026年最新实操经验,详细拆解OpenClaw零基础全平台部署流程(阿里云+Windows11/MacOS/Linux本地)、阿里云百炼免费大模型API配置步骤,深度解析社区亲测好用的核心技能,所有代码命令可直接复制执行,全程无营销词汇,助力新手快速解锁O
1589 1
|
9月前
|
数据采集 缓存 JSON
微信 item_get - 搜狗微信文章信息接口对接全攻略:从入门到精通
搜狗微信搜索item_get接口(非微信官方)基于合规爬虫,支持通过文章URL、ID或公众号+标题批量获取公众号文章详情,涵盖正文、作者、发布时间、阅读量等数据,适用于舆情监测、内容分析、运营调研等场景。本攻略详解接口认知、参数使用、签名生成、Python实操代码及调试优化,助力开发者高效稳定对接。