智源研究院开源中文互联网语料库CCI3.0，1000GB数据集，498GB高质量子集，魔搭社区可下载-阿里云开发者社区

智源研究院开源中文互联网语料库CCI3.0，1000GB数据集，498GB高质量子集，魔搭社区可下载

2024-10-08 1350

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： 近日，智源研究院正式发布中文互联网语料库CCI 3.0(Chinese Corpora Internet，简称 CCI)

近日，在由中央网信办指导，北京市委网信办、北京市经济和信息化局、北京市新闻出版局、北京市版权局承办的2024北京文化论坛“新兴业态与技术融合”平行论坛上，智源研究院正式发布中文互联网语料库CCI 3.0(Chinese Corpora Internet，简称 CCI)，包括1000GB的数据集以及498GB的高质量子集CCI3.0-HQ。智源研究院于2023年11月首次开源CCI 1.0，并在2024年4月发布CCI 2.0。目前，CCI系列数据集下载量已超过4万次，服务500多个企事业单位的大模型研发，助力高质量中文语料和训练数据建设，支撑中国人工智能产业生态发展。

CCI 3.0下载地址

Flopsera：

http://open.flopsera.com/flopsera-open/data-details/BAAI-CCI3

ModelScope：

https://www.modelscope.cn/datasets/BAAI/CCI3-Data

Datahub：

https://data.baai.ac.cn/details/BAAI-CCI3

规模扩大，来源广泛

CCI 3.0收录超过2.68亿个网页，涵盖新闻、社交媒体、博客等多个领域。CCI 3.0的数据规模相较于CCI 2.0扩大近一倍，数据来源机构扩展至20多家，显著提升数据覆盖面和代表性。

精细标注，赋能应用

CCI 3.0对原始数据进行了覆盖语法、句法、教育程度等10多个维度的细粒度分类和详细标记，以筛选高价值数据，为企业定制个性化训练数据提供可能性。此外，CCI 3.0 HQ是基于70B模型自动标注样本，然后训练小尺寸质量模型进行优中选优得到的高质量子集，可更好地满足不同行业和应用场景的需求。

效果显著，更懂中文

同一500M模型基于不同的数据集从零开始训练100B数据对比实验表明，CCI 3.0在单独中文语料训练和中英文语料混合训练的效果上优于其他数据集，而CCI 3.0 HQ的效果更加突出。

模型训练效果对比

未来，智源研究院将继续携手行业生态推动语料库共建共享，构建大规模高质量高知识密度的中文数据集，为中国人工智能产业发展做出贡献。

点击链接👇，直达数据集~

https://www.modelscope.cn/datasets/BAAI/CCI3-Data?from=alizishequ__text

智源研究院开源中文互联网语料库CCI3.0，1000GB数据集，498GB高质量子集，魔搭社区可下载

热门文章

最新文章

相关电子书

探索云世界

热门

云计算

大数据

云原生

人工智能

数据库

开发与运维

活动广场

任务中心

训练营

直播

乘风者计划

下载

镜像站

技术资料

智源研究院开源中文互联网语料库CCI3.0，1000GB数据集，498GB高质量子集，魔搭社区可下载

热门文章

最新文章

相关电子书