跳到正文
原文
Hugging Face Blog·· 2025-08-07精选AI 评分62

TRL 为视觉语言模型加入 MPO、GRPO、GSPO 对齐支持

Vision Language Model Alignment in TRL ⚡️

AI 导读

Hugging Face 的 TRL 新增面向视觉语言模型的对齐方法支持,包括 Mixed Preference Optimization(MPO)、Group Relative Policy Optimization(GRPO)和 Group Sequence Policy Optimization(GSPO),并扩展 RLOO 与 Online DPO 到多模态场景。

推荐理由

TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本与 notebook。

来源:Hugging Face Blog · huggingface.co