Hugging Face Blog·· 2025-08-07精选AI 评分62
TRL 为视觉语言模型加入 MPO、GRPO、GSPO 对齐支持
Vision Language Model Alignment in TRL ⚡️
AI 导读
Hugging Face 的 TRL 新增面向视觉语言模型的对齐方法支持,包括 Mixed Preference Optimization(MPO)、Group Relative Policy Optimization(GRPO)和 Group Sequence Policy Optimization(GSPO),并扩展 RLOO 与 Online DPO 到多模态场景。
推荐理由
TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本与 notebook。
来源:Hugging Face Blog · huggingface.co