中国大模型语料数据联盟开源发布高质量多模态语料“书生·万卷”
来源:上海证券报 发布时间:2023-08-14 19:51:18

继今年7月在2023世界人工智能大会发起成立“中国大模型语料数据联盟”(以下简称“语料数据联盟”),上海人工智能实验室(上海AI实验室)于8月14日宣布,联合语料数据联盟成员单位,共同开源发布“书生·万卷”1.0多模态预训练语料。


(相关资料图)

“书生·万卷”1.0目前包含文本数据集、图文数据集、视频数据集三部分,本次开源的数据总量超过2TB。该语料数据包含超过5亿个文本,2200万个图文交错文档,1000个节目影像视频,具备多元融合、精细处理、价值对齐、易用高效等四大特征。

集合语料数据联盟成员丰富的内容积累与上海AI实验室领先的数据处理能力等优势,“书生·万卷”将为学术界及产业界提供更符合主流中文价值对齐的高质量大模型多模态预训练语料。

跨界联合,共建宽领域语料库

本次开源的“书生·万卷”1.0包含文本、图文、视频三部分数据集。其中文本数据为来自网页、百科、书籍、专利、教材、考题等不同来源的清洗后预训练语料,数据总量超过5亿个文档,数据大小超过1TB,覆盖科技、文学、媒体、教育、法律等多个领域。

图文数据主要来自公开网页,经处理后形成图文交错文档。文档总量超过2200万个,数据大小超过140GB(不含图片),覆盖新闻事件、人物、自然景观、社会生活等多个领域。

视频数据主要来自中央广播电视总台和上海文广集团,包含新闻、影视等多种类型的节目影像,总计视频文件数超过1000个,数据大小超过900GB,内容覆盖军事、文艺、体育、自然、真实世界、知识、影像艺术、媒体、美食、历史、科教等方面。

精细处理构建高质量预训练语料

高质量、大规模、安全可信的语料数据对于大语言模型的训练和性能提升至关重要。基于语料数据联盟构建的语料库,上海AI实验室对其中部分数据进行细粒度清洗、去重以及价值对齐,形成了高质量多模态预训练语料“书生·万卷”1.0,具备多元融合、精细处理、价值对齐、易用高效等四大特征。

在多元融合方面,“书生·万卷”1.0包含文本、图文、视频等多模态数据,范围覆盖科技、文学、媒体、教育、法律等多个领域,在训练提升模型知识含量、逻辑推理和泛化能力方面具有显著效果。

在精细处理方面,“书生·万卷”1.0经历了语言甄别、正文抽取、格式标准化、基于规则及模型的数据过滤与清洗、多尺度去重、数据质量评估等精细化数据处理环节,因而能更好地适配后续的模型预训练需求。

在价值对齐方面,研究人员在“书生·万卷”1.0的构建过程中,着眼于内容与中文主流价值观的对齐,通过算法与人工评估结合的方式,提升了语料的纯净度。

在易用高效方面,研究人员在“书生·万卷”1.0采用统一格式,并提供详细的字段说明和工具指导,使其兼顾了易用性和效率,可快速应用于语言、多模态等大模型预训练。

据悉,高质量、多模态、宽领域的数据支持已成为当前人工智能大模型发展的重要基石,中国大模型语料数据联盟将持续通过开源开放,共建包容、开放、有序、共享的人工智能大生态。

上海人工智能实验室是我国人工智能领域的新型科研机构,目标为建成国际一流的人工智能实验室,成为享誉全球的人工智能原创理论和技术的策源地。

中国大模型语料数据联盟是由上海人工智能实验室联合国家气象中心、上海数据集团、上海市数商协会等单位联合发起成立的开放组织。旨在通过链接模型训练、数据供给、学术研究、第三方服务等多方面机构,联合打造多知识、多模态、标准化的高质量语料数据,探索形成基于贡献、可持续运行的激励机制,打造国际化、开放型的大模型语料数据生态圈。

关键词:

猜你喜欢

中国大模型语料数据联盟开源发布高质量多模态语料“书生·万卷”

中国大模型语料数据联盟开源发布高质量多模态语料

【中国大模型语料数据联盟开源发布高质量多模态语料“书生·万卷”】继更多

2023-08-14 19:51:18
巴中市平昌县委统战部开展宗教场所安全检查

巴中市平昌县委统战部开展宗教场所安全检查

为进一步筑牢宗教活动场所安全防线,切实维护场所安全稳定,日前,平昌更多

2023-08-14 18:32:24
华为手机怎么截长图教程_华为手机怎么截取长图

华为手机怎么截长图教程_华为手机怎么截取长图

华为手机截取长图如下:一、滚动截屏的操作步骤:1 先解锁华为手机,打更多

2023-08-14 17:32:04
杭州奶奶告诉你:夏天穿裙要过膝,不露大腿不扮嫩,老得更体面

杭州奶奶告诉你:夏天穿裙要过膝,不露大腿不扮嫩

总有人认为女人到了祖母辈之后就与美无关了,但是你知道吗?美丽与年龄更多

2023-08-14 17:10:54
热评丨“今年能吃到新鲜的五常大米吗?”尽力把损失降到最低

热评丨“今年能吃到新鲜的五常大米吗?”尽力把损

热评丨“今年能吃到新鲜的五常大米吗?”尽力把损失降到最低更多

2023-08-14 16:39:20
市场监管总局发布2023年上半年食品安全监督抽检情况

市场监管总局发布2023年上半年食品安全监督抽检情

原标题:市场监管总局发布2023年上半年食品安全监督抽检情况市场监管总更多

2023-08-14 16:03:51
荣耀申请MagicAl商标

荣耀申请MagicAl商标

天眼查App显示,近日,荣耀终端有限公司申请“MagicAl”商标,国际分类更多

2023-08-14 15:35:22
2023年第二季度苹果iPhone出货量下降 平均售价创纪录

2023年第二季度苹果iPhone出货量下降 平均售价创纪录

根据TechInsights的数据,2023年第二季度,苹果iPhone全球出货量同比下更多

2023-08-14 15:13:37
“高铁进市区”添新动作!广州站至广州南站联络线拟9月开工

“高铁进市区”添新动作!广州站至广州南站联络线

南都讯广州站至广州南站将新建联络线!“高铁进市区”再添新动作。日前更多

2023-08-14 14:32:11
国家防总、应急管理部等部门:当前防汛形势总体趋于明朗 防汛关键期取得阶段性成效

国家防总、应急管理部等部门:当前防汛形势总体趋

据央视新闻8月14日消息,今天上午国家防总、应急管理部等相关部门再次更多

2023-08-14 13:58:59

© 2012-2020 财经快报网 版权所有 关于我们

网站联系邮箱:435 227 67@qq.com

琼ICP备2022009675号-3