EvalPlanner:基于“计划-执行”双阶段的大语言模型评估框架

简介: EvalPlanner是一种创新的大语言模型(LLM)评估算法,采用计划-执行双阶段范式,生成无约束的评估计划并执行,从而提升评估的系统性和可靠性。该系统包含评估计划、计划执行模块和最终判决三个核心组件,通过自训练循环优化计划和执行过程。EvalPlanner在多个基准测试中表现出色,特别是在数据效率和泛化能力方面,为构建高效、稳健的LLM评估模型提供了新方向。

大语言模型(LLM)评估系统在生成思维链(Chain-of-Thought, CoT)序列时,需要系统地捕捉评估过程中的推理步骤。但是由于缺乏人工标注的CoT训练数据,以及预定义评估提示在复杂任务中的局限性,构建高质量的LLM评估模型面临重大挑战。另外手动调整评估指令的方法在面对多样化和复杂任务时表现出明显的局限性。

为应对这些挑战,研究团队提出了EvalPlanner[1],这是一种创新的LLM评估算法。该算法采用计划-执行的双阶段范式,首先生成无约束的评估计划,随后执行该计划并做出最终判断。这种方法显著提升了评估过程的系统性和可靠性。

核心方法论

系统架构

EvalPlanner的架构包含三个核心组件,如下图所示:

具体来说,系统包含以下关键要素:

a) 评估计划(z)

  • 基于输入指令x,系统制定具体的响应评估策略
  • 计划设计注重灵活性和通用性

b) 计划执行模块

  • 依序执行评估计划的各个步骤
  • 分析目标响应a和b,生成详细的评估结果

c) 最终判决(y)

  • 在评判LLM(参数θ)的框架下,将计划z和执行e作为潜变量
  • 判决生成过程可表述为:

工作流程

系统的整体工作流程如下图所示:

主要步骤包括:

  1. 从分布P中采样多个评估计划z
  2. 对每个计划,从分布E中采样多个执行路径e
  3. 通过自训练循环优化计划和执行过程
  4. 在测试阶段,模型生成结构化的CoT输出:ỹ = (z̃, ẽ, ỹ)

训练数据生成方法

提示词选择与响应对生成

系统采用两类核心任务领域:

  • 通用指令执行任务- 通过对原始指令引入噪声生成对比样本- 原始指令响应作为正例,噪声指令响应作为负例
  • 数学推理任务- 采样多个候选响应- 正确解答作为正例,错误解答作为负例

评估计划生成

系统采用通用且无约束的计划生成提示模板,该模板仅基于输入指令查询经过指令调优的LLM以获取初始计划。提示模板的核心内容如下:

 We want to evaluate the quality of the responses provided by AI assistants to
 the user question displayed below. For that, your task is to help us build an 
 evaluation plan that can then be executed to assess the response quality. 
 Whenever appropriate, you can choose to also include a step-by-step reference 
 answer as part of the evaluation plan. Enclose your evaluation plan between 
 the tags “[Start of Evaluation Plan]” and “[End of Evaluation Plan]”.

 [User Question]
 {instruction}

计划执行生成

计划执行阶段采用种子模型,结合指令和响应对,基于生成的计划进行推理并产生判决。

 Please act as an impartial judge and evaluate the quality of the responses 
 provided by two AI assistants to the user question displayed below. You 
 should choose the assistant that follows the user’s instructions and answers
 the user’s question better. Your evaluation should consider factors such as 
 the helpfulness, relevance, accuracy,depth, creativity, and level of detail 
 of their responses. Begin your evaluation by comparing the two responses and 
 provide a short explanation. Avoid any position biases and ensure that the 
 order in which the responses were presented does not influence your decision. 
 Do not allow the length of the responses to influence your evaluation. Do not 
 favor certain names of the assistants. Be as objective as possible. After 
 providing your explanation, output your final verdict by strictly following 
 this format: “[[A]]” if assistant A is better, “[[B]]” if assistant B is better.

 [[User Question]]
 {instruction}

 [The Start of Assistant A’s Answer]
 {response A}
 [The End of Assistant A’s Answer]

 [The Start of Assistant B’s Answer]
 {response B}
 [The End of Assistant B’s Answer]

这种分离式架构具有两个主要优势:

确保执行过程严格遵循预定计划

通过对同一计划采样多个执行路径,增加评估数据的多样性

构建计划-执行偏好对

对于每个输入指令:

  • 采样|P|个计划
  • 每个计划采样|E|个执行路径
  • 考虑响应对的两种顺序(a,b)和(b,a),总共生成2×|P|×|E|个CoT序列


计划与执行的优化策略

系统采用自训练循环进行优化,主要包含以下步骤:

初始监督微调(SFT)

  • 从种子模型M₀开始
  • 在正确思维子集D₁ᶜ上进行微调
  • 得到模型M₁ˢᶠᵀ

第一轮直接偏好优化(DPO)

  • 以M₁ˢᶠᵀ为基础
  • 在包含正确与错误思维的数据集D₁上执行DPO
  • 得到模型M₁ᴰᴾᴼ

第二轮直接偏好优化(DPO)

  • 以M₁ᴰᴾᴼ为基础
  • 在新的指令和响应对子集D₂上执行DPO
  • 得到最终模型M₂ᴰᴾᴼ

实验设置与评估

训练数据构建

  • WildChat数据集:使用自学习评估器生成综合响应
  • MATH数据集:通过Mixtral 22Bx8 Instruct模型生成多个候选解答

实验配置

训练数据规模:

  • WildChat: 17,588个独特三元组
  • MATH: 4,141个独特三元组

采样参数:

  • 每次迭代5个计划
  • 每个计划8个执行路径(每种顺序4个)
  • 温度参数0.8,top_p值0.95

基准比较

模型性能与多个基准系统进行对比:

  • 零样本评估的开源和闭源LLM
  • 具有评论功能的奖励模型
  • RewardBench排行榜上的领先模型

实验结果与分析

性能优势

EvalPlanner展现出显著的性能优势:

  • 在较少训练数据的情况下超越所有基准系统
  • 为生成式奖励模型创造新的性能记录
  • 在多个种子模型上展示方法的普适性

数据效率

系统表现出优异的数据效率:

  • 仅使用5K偏好对即达到92.3的性能分数
  • 通过迭代DPO进一步提升至93.9
  • 相比单次DPO迭代(92.5)取得明显进步

泛化能力

在多个评估基准上验证了系统的泛化能力:

  • FollowBenchEval:在多层次约束评估中超越基准13%
  • RM-Bench:展示出对内容变化的强大鲁棒性
  • JudgeBench:在多类别挑战性问题上保持竞争力



总结

EvalPlanner通过创新的计划-执行范式,成功解决了LLM评估模型面临的核心挑战。系统在多个基准测试中的出色表现,证实了该方法在构建高效、稳健的评估模型方面的有效性。特别是在数据效率和泛化能力方面的优势,为未来LLM评估系统的发展提供了新的研究方向。

论文:
https://avoid.overfit.cn/post/f7ce0fc3e984451b97da82075bfb0b27

作者:SACHIN KUMAR

目录
相关文章
|
人工智能 自然语言处理 物联网
中文LLaMA模型和指令精调的Alpaca大模型:中文数据进行二次预训练,进一步提升了中文基础语义理解能力
中文LLaMA模型和指令精调的Alpaca大模型:中文数据进行二次预训练,进一步提升了中文基础语义理解能力
中文LLaMA模型和指令精调的Alpaca大模型:中文数据进行二次预训练,进一步提升了中文基础语义理解能力
|
4月前
|
算法 知识图谱 索引
KNOWLEDGE IS NOT STATIC: ORDER-AWARE HYPERGRAPH RAG FOR LANGUAGE MODELS(论文解读)
本研究推翻了RAG领域“检索证据可视为无序集合”的核心假设,提出OKH-RAG框架,将顺序作为核心结构属性融入超图RAG,实现高阶知识交互与时序关系的统一建模。实验证明,在顺序敏感的领域推理任务中,**证据的组织顺序与内容本身同等重要**,顺序感知轨迹检索可显著提升大模型的推理准确性与事实一致性。
260 2
|
机器学习/深度学习 存储 算法
近端策略优化(PPO)算法的理论基础与PyTorch代码详解
近端策略优化(PPO)是深度强化学习中高效的策略优化方法,广泛应用于大语言模型的RLHF训练。PPO通过引入策略更新约束机制,平衡了更新幅度,提升了训练稳定性。其核心思想是在优势演员-评论家方法的基础上,采用裁剪和非裁剪项组成的替代目标函数,限制策略比率在[1-ϵ, 1+ϵ]区间内,防止过大的策略更新。本文详细探讨了PPO的基本原理、损失函数设计及PyTorch实现流程,提供了完整的代码示例。
7494 10
|
7月前
|
存储 人工智能 自然语言处理
GEO优化:成功前奏的关键布局与实操清单
本文将深入探讨GEO优化的前期关键布局,并提供一份实操清单,帮助企业在AI时代抢占先机。
547 8
|
人工智能 监控 前端开发
主流多智能体框架设计原理
本文描述了关于智能体(Agents)和多智能体系统(Multi-Agent Systems, MAS)的详尽介绍,涵盖了从定义、分类到具体实现框架的多个方面。
主流多智能体框架设计原理
|
机器学习/深度学习 人工智能 数据挖掘
如何做好互联网产品需求分析?看这里!
如何做好互联网产品需求分析?看这里!
680 0
|
10月前
|
存储 人工智能 搜索推荐
LangGraph 记忆系统实战:反馈循环 + 动态 Prompt 让 AI 持续学习
本文介绍基于LangGraph构建的双层记忆系统,通过短期与长期记忆协同,实现AI代理的持续学习。短期记忆管理会话内上下文,长期记忆跨会话存储用户偏好与决策,结合人机协作反馈循环,动态更新提示词,使代理具备个性化响应与行为进化能力。
1846 10
LangGraph 记忆系统实战:反馈循环 + 动态 Prompt 让 AI 持续学习
|
10月前
|
机器学习/深度学习 人工智能 搜索推荐
拔俗AI学伴智能体系统:基于大模型与智能体架构的下一代个性化学习引擎
AI学伴智能体系统融合大模型、多模态理解与自主决策,打造具备思考能力的个性化学习伙伴。通过动态推理、长期记忆、任务规划与教学逻辑优化,实现千人千面的自适应教育,助力因材施教落地,推动教育公平与效率双提升。(238字)
1250 0
|
10月前
|
存储 人工智能 搜索推荐
拔俗AI助教系统:基于大模型与智能体架构的新一代教育技术引擎
AI助教融合大语言模型、教育知识图谱、多模态感知与智能体技术,重构“教、学、评、辅”全链路。通过微调LLM、精准诊断错因、多模态交互与自主任务规划,实现个性化教学。轻量化部署与隐私保护设计保障落地安全,未来将向情感感知与教育深度协同演进。(238字)
1285 0