多模态大模型的RLHF对齐优化:从DPO到KPO的演进路径与训练效率提升 深入分析多模态大模型对齐优化技术,从DPO到KPO的演进路径,探讨RLHF在多模态场景的局限性及工程实践方案。 大语言模型 2026年09月23日 0 点赞 0 评论 2 浏览