direct-preference-optimization:基于偏好数据训练语言模型的参考实现,支持DPO、保守DPO和IPO算法
Star
0
Fork
0
代码
介绍
代码
Issues
Pull Requests
流水线
Actions
项目讨论
Wiki
项目成员
5
分析
项目设置
Star
0
Fork
0
Reference implementation for DPO (Direct Preference Optimization)
main
分支
1
Tags
0
IDE
下载zip
Clone
README
项目介绍
查看原文
DPO(直接偏好优化)的参考实现【此简介由AI生成】
Apache-2.0
Python
16
提交数
定制我的领域
README
举报项目
15
2.9 K
238
访问 GitHub
举报项目