首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >直接偏好优化 >直接偏好优化中的偏好数据是如何构成的?

直接偏好优化中的偏好数据是如何构成的?

词条归属:直接偏好优化

1. 偏好对的基本结构

  • DPO 使用成对的偏好数据,每条样本由"提示(prompt)""被选响应(chosen)"和"被拒响应(rejected)"三部分组成
  • 被选响应是人类标注者更偏好的输出,被拒响应是相对不理想的输出;模型的学习目标是提高被选响应的相对概率、降低被拒响应的相对概率

2. 数据的来源方式

  • 人工标注:由标注者对同一提示下的多个候选回答进行排序或 pairwise 比较,得到"哪个更好"的判断
  • 模型生成:用更强的模型对较小模型的输出打分,自动产出 chosen / rejected 对
  • 规则或原则构造:依据内容安全策略、合规要求等,构造"合规响应优于不合规响应"的偏好对

3. 数据格式要求

  • 标准格式包含 prompt、chosen、rejected 三个字段;对话场景可使用角色(role)与内容(content)组成的消息列表
  • 数据需为成对结构;若仅有"好 / 坏"独立标注而无配对,则需使用 KTO 等支持非配对反馈的算法
相关文章
使用直接偏好优化在SageMaker AI中定制Nova模型
在某中心纽约峰会推出的Nova基础模型定制方案,提供了一套完整的模型训练生命周期管理能力。这些能力以即用型配方形式提供,涵盖预训练、监督微调和对齐等阶段。
用户11764306
2025-08-17
3320
偏好获取增强的贝叶斯优化
Elicitation-Augmented Bayesian Optimization
CreateAMind
2026-05-19
2180
研究人员利用脑机接口可以直接预测我们的偏好
来自哥本哈根大学(University of Copenhagen)和赫尔辛基大学(University of Helsinki)的一个研究团队发现,可以根据一个人的大脑反应与其他人的匹配程度来预测个人偏好。
脑机接口社区
2022-09-22
4470
通过胜率理解偏好学习的理论与优化方法
偏好学习(即通过偏好对比数据对齐生成模型)尚未达到分类或密度估计等任务的成熟度。为此,本文从成对偏好数据的抽样分布出发构建理论框架,证明生成模型的唯一合理评估指标是胜率(win rate),因其同时尊重数据分布中的偏好与流行度。
用户11764306
2025-08-02
2140
LLM 的自然语言偏好获取函数的贝叶斯优化
摘要 在冷启动环境下,设计能够快速确定用户最偏爱物品的偏好获取(PE)方法,是构建高效且个性化对话式推荐(ConvRec)系统的关键挑战。尽管大语言模型(LLM)能够实现完全自然语言(NL)的偏好获取对话,但我们假设,单一的LLM自然语言偏好获取(NL-PE)方法缺乏多轮、基于决策理论的推理能力,难以在对任意物品集合的偏好探索与利用之间有效平衡。相比之下,传统的贝叶斯优化(BO)偏好获取方法定义了理论上最优的PE策略,但无法生成任意的自然语言查询,也无法对自然语言描述的物品内容进行推理——因此要求用户通过评分或比较不熟悉的物品来表达偏好。为了克服上述两种方法的局限性,我们将自然语言偏好获取(NL-PE)建模为一个贝叶斯优化(BO)框架,旨在主动获取自然语言反馈以识别最佳推荐物品。将贝叶斯优化推广至处理自然语言反馈所面临的关键挑战包括:(a)如何利用大语言模型将自然语言偏好反馈的似然性建模为物品效用的函数;以及(b)如何为自然语言贝叶斯优化设计一种采集函数,以在无限的语言空间中主动获取偏好信息。我们在一个新颖的NL-PE算法PEBOL中展示了该框架,该算法使用:1)用户偏好语句与自然语言物品描述之间的自然语言推理(NLI)来维护贝叶斯偏好信念;2)贝叶斯优化策略(如汤普森采样TS和置信上限UCB)来指导大语言模型生成查询语句。我们在受控仿真实验中对所提方法进行了数值评估,结果表明,在经过10轮对话后,PEBOL的MRR@10最高可达0.27,优于最佳单一LLM基线方法的0.17,尽管PEBOL所依赖的是更早版本且规模更小的大语言模型。
CreateAMind
2026-03-11
2890
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券