Hugging Face Blog·· 2023-05-16AI 评分34
BigCode 背后的大规模近重复数据删除
Large-scale Near-deduplication Behind BigCode
AI 导读
Hugging Face 博客详解 BigCode 项目采用 MinHash + LSH(参数 256, 0.7, 5)进行文档级近重复数据删除,并确认去重同样能提升代码模型性能且所需数据集更小。文章还对比了 The Stack、CodeParrot、InCoder 等代码数据集所用的精确匹配、Levenshtein 距离等去重方法,指出去重可减少训练步数、防止基准污染与数据泄露。
来源:Hugging Face Blog · huggingface.co