WAIC 2026 | 全国已建成高质量数据集12万个WAIC语料创新论坛发布七项成果
记者从2026世界人工智能大会“语料筑基、智生时代”语料创新论坛获悉,截至今年6月底,全国已建成高质量数据集12万个,总体量超过1565PB;七个数据标注先行先试城市标注规模超过119PB,已服务425个大模型研发。
新华财经上海7月19日电(记者 杜康)记者从2026世界人工智能大会“语料筑基、智生时代”语料创新论坛获悉,截至今年6月底,全国已建成高质量数据集12万个,总体量超过1565PB;七个数据标注先行先试城市标注规模超过119PB,已服务425个大模型研发。
随着人工智能从通用基础大模型向行业大模型深入拓展、从数字空间向物理世界延伸,高质量数据集正成为支撑模型训练和行业应用的重要基础。
论坛围绕平台能力升级、行业产品创新、标准体系建设、科学智能发展和高价值语料征集等方向,集中发布七项成果。
其中,语料运营公共服务平台2.0正式发布。平台构建“筛选—转换—合成”三层十级数据进化路线,并集成语料工程平台、行业专家经验语料平台和专家众包网络,推动语料从一次性交付转向持续使用、评测和更新。
面向医疗、工业、交通、供应链和城市治理等场景,论坛还发布专病、焊接、城市轨道交通、交通基础设施运维、航运物流、港口堆场、国际物流供应链、消防等系列语料库,推动医疗知识、工业经验和行业规则转化为可训练、可推理、可调用、可评测的数据资源。
标准建设方面,论坛新增发布15项团体标准和2项行业标准,覆盖高端装备、消防、医疗专病、国际物流供应链、文物、钢铁、合成数据和大模型数据集开发管理等方向,贯通语料采集、清洗、标注、评测和运营管理等环节。
当天,科学数据服务AI4S可持续发展倡议正式发起。倡议提出,将围绕流程重塑、标准引领、价值对齐和平台创新,推动科学数据采集、预处理、标注、流通和使用全流程贯通,促进科学数据向AI-Ready、Agent-Ready演进。
“DARE GO达·高”跨领域高价值语料数据征集计划也同步启动。该计划将面向各行业征集带有具体环境、任务要求、评价标准和参考答案的专业难题,探索形成“专家出题—社会答题—模型验证—价值回流”的持续机制,推动模型从“学习知识”向“完成任务”转变。
此次论坛由世界人工智能大会组委会指导,上海库帕思科技有限公司、上海市人工智能行业协会主办。
编辑:葛佳明
声明:新华财经(中国金融信息网)为新华社承建的国家金融信息平台。任何情况下,本平台所发布的信息均不构成投资建议。如有问题,请联系客服:400-6123115









