用于训练代码模型的公开代码语料集合。
开放代码数据集就是程序员高考题库:AI刷多了,解题套路也背熟。
训练代码模型常用它,也要处理版权、隐私和脏数据。
Pretraining开放代码数据集常作为预训练语料,让模型学代码模式。
CodexCodex 这类代码模型,依赖大量公开代码训练。
Benchmark contamination公开代码里若混入测试题,会虚高模型分数。
Copyright公开代码可训练模型,但许可证边界常有争议。