Hugging Face Blog·· 2025-09-09AI 评分50
Hugging Face 发布 mmBERT:基于 ModernBERT 的多语言编码器,覆盖 1800+ 语言
mmBERT: ModernBERT goes Multilingual
AI 导读
Hugging Face 发布 mmBERT,一个基于 ModernBERT 架构的多语言编码器模型,在超 3T token、1800 多种语言上训练,是首个在性能上超越 XLM-R 的多语言模型。base 版含 110M 非嵌入参数(总计 307M),采用三阶段训练与逆掩码率调度(30%→15%→5%),在 GLUE 和 XTREME 基准上显著领先 XLM-R 与 mGTE。
来源:Hugging Face Blog · huggingface.co