direct-preference-optimization:基于偏好数据训练语言模型的参考实现,支持DPO、保守DPO和IPO算法

Reference implementation for DPO (Direct Preference Optimization)

分支1Tags0

项目介绍

DPO(直接偏好优化)的参考实现【此简介由AI生成】

定制我的领域
152.9 K238访问 GitHub