中文互联网基础语料 4.0 发布:数据量 120GB,为大模型训练和 AI 发展提供可信数据支撑
9月15日下午,2026年国家网络安全宣传周人工智能安全治理分论坛在济南召开,中文互联网基础语料4.0正式面向社会发布,同步在“中文互联网语料资源平台”完成上线。

120GB高质量语料完成迭代升级
自中文互联网基础语料系列发布以来,各版本均稳定保持120GB的高质量数据规模,持续为AI行业提供可信数据供给。本次推出的4.0版本在中国网络空间安全协会的主导下,于中央网信办指导下,联合国家互联网应急中心,依托网安协会人工智能安全治理专委会建立的语料共建共享机制,联动多家行业单位共同完成数据共建,参与共建的单位包括:
- 百度
- 中科闻歌
- 开普云
- 拓尔思
- 科大讯飞
- 知乎
新版本在前期1.0、2.0、3.0版本的积累上,进一步扩大了优质中文网站信源覆盖范围,同时加强了违法不良信息过滤力度,所有语料均经过信源筛选、内容过滤、数据去重等一系列严格加工处理,数据规范性与可信度进一步提升,可为大模型训练、人工智能技术研发提供高质量中文数据支撑。
官方平台开放获取降低使用门槛
本次发布的语料面向社会公众、科研机构、AI企业等主体开放获取渠道:用户登录中国网络空间安全协会官网,点击“中文互联网语料资源平台”链接,完成注册、认证等程序后,即可下载相关语料,也可联系官方获取定制化数据服务,大幅降低了高质量中文语料的获取成本。
多方协同持续扩充语料供给体系
中国网络空间安全协会负责人表示,中文互联网基础语料4.0是社会各界协同共建高质量中文语料的重要阶段性成果,进一步丰富了国内高质量中文语料供给体系。下一步,协会将继续联合国家互联网应急中心等单位,联动各行业领域深化中文互联网基础语料建设,持续为人工智能产业高质量发展筑牢数据底座,为AI技术创新和产业落地提供持续稳定的数据支撑。