跳到正文
原文
Hugging Face Blog·· 2023-05-16AI 评分34

BigCode 背后的大规模近重复数据删除

Large-scale Near-deduplication Behind BigCode

AI 导读

Hugging Face 博客详解 BigCode 项目采用 MinHash + LSH(参数 256, 0.7, 5)进行文档级近重复数据删除,并确认去重同样能提升代码模型性能且所需数据集更小。文章还对比了 The Stack、CodeParrot、InCoder 等代码数据集所用的精确匹配、Levenshtein 距离等去重方法,指出去重可减少训练步数、防止基准污染与数据泄露。

来源:Hugging Face Blog · huggingface.co