点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:聚焦AI数据开放共享 百度技术委员会主席吴华分享千言开源进展
首页> IT频道> 产业 公司 > 正文

聚焦AI数据开放共享 百度技术委员会主席吴华分享千言开源进展

来源:光明网2021-07-09 17:34

调查问题加载中,请稍候。
若长时间无响应,请刷新本页面

  7月8日,以“智联世界,众智成城”为主题的2021世界人工智能大会(WAIC)在上海正式开幕。今年大会邀请多位图灵奖得主、数十位学界专家、产业界大咖以及百余位行业领军人物等全球AI领域的重磅嘉宾,就AI技术开源、应用创新、人才培养等议题展开深度对话。作为国内AI“头雁”,百度也全方位参与大会多个环节,围绕AI生态发展、前沿科技以及AI人才等话题分享洞见。

  当前,数据已经成为了人工智能技术发展的重要生产要素,促进数据开放共享,对提升人工智能技术水平价值巨大。7月9日,在“AI时代数据开放共享创新论坛”上,数字技术开源生态探索暨白玉兰开源合作伙伴签约仪式举行,百度飞桨也参与其中,助力中国开源生态的共建。在随后的主题演讲环节,百度技术委员会主席吴华分享了百度开源数据集“千言”的发展近况和创新成果。

聚焦AI数据开放共享 百度技术委员会主席吴华分享千言开源进展

  百度技术委员会主席吴华

  吴华首先回顾了百度开源数据BRORD和“千言”的发展历程,她表示,在人工智能领域,数据至关重要。百度自2017年启动了AI公开数据集计划“BROAD”(Baidu Research Open-Access Dataset),并于2020年发布了中文开源数据集“千言”。截至目前,百度开源开放的数据集已涵盖了交通类多场景的细分数据集、大规模自然语言处理及知识图谱数据集、来自真实视频/OCR业务的数据集以及行业数据集等。

  吴华提到,目前的许多技术研发仅关注模型在单一数据集上的效果,然而自然语言处理技术在大规模产业化的应用中,面临着多领域、多场景等诸多挑战,具体可分为三大维度:全面性,即处理多个子任务的能力;泛化性,即跨领域数据上有泛化能力;鲁棒性,即模型或系统是否足够健壮。

  为了解决自然语言技术发展中所面临的挑战,百度、中国计算机学会、中国中文信息学会共同发起了“千言”数据共建计划。“千言”项目作为面向自然语言处理的中文开源数据共建项目,针对每个自然语言处理任务,均收集和整理多个开源数据集,进行统一的处理并提供统一的测评方式。“千言”项目期望从准确性、泛化性和鲁棒性等多角度对模型效果进行综合评价,可支持复杂知识构建、语义理解、语言生成、知识融合、多模态融合等丰富的任务类型。

  目前,“千言”项目已经针对8个任务,汇集了来自哈工大、清华、华为、中科院信息工程研究所等在内的11所高校和企业的28个开源数据集。此外,为了使“千言”能够提供一站式的数据浏览、下载和评测的科研体验,百度还对所有数据进行了处理,每个任务都有统一的数据格式和评测,并在此基础上提供了基线系统,帮助加速模型的研发。

  吴华还表示,在未来3年中,“千言”计划面向超20个任务,收集和建设不少于100个中文自然语言处理数据集,全面覆盖应用系统、语言理解、语言生成、知识图谱、多模态等多个领域。同时,也期待更多数据集作者能够加入共建,共同推动中文信息处理技术的进步。

  作为面向自然语言理解和生成任务的中文开源数据集合,为更好地支持NLP技术的发展和创新,“千言”项目连续多届支持了语言与智能技术竞赛以及CCF大数据与计算智能大赛。其中,2021语言与智能技术竞赛中,竞赛基于“千言”数据集,源于真实应用需求设置了机器阅读理解、多技能对话、多形态信息抽取三大任务。吴华在演讲中以其中的两大命题——机器阅读理解、多技能对话为例,详细论述了“千言”在检验模型的全面性、鲁棒性的优越性,并凭此从而推动技术更好地适应多领域、多场景的产业应用。

  产教融合是当前AI时代数据开源开放的另一重要话题。百度飞桨作为我国首个自主研发、功能丰富、开源开放的产业级深度学习平台,在“千言”等开源数据集的支持下正在积极赋能推动AI技术的开放共享,不仅推出一系列自然语言处理的配套课程,还基于丰富的产业实践助力高校体系化开设AI课程,在高校人工智能实践课的开展中新增开放了包含人工智能全技术方向和产业应用方向的50多个实战案例,到7月底将累积超过100个。未来,百度将持续关注科研和产业实践的创新发展,推动AI开放共享,融合创新。(李文)

[ 责编:李汶键 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 联合国中文日活动走进巴西里约热内卢

  • 第十四届北京国际电影节开幕

独家策划

推荐阅读
4月2日,随着57652次检测车从南充北站5道缓缓驶出,标志着新建汉中至巴中至南充铁路南充至巴中段(以下称"巴南高铁")启动联调联试,进入工程验收关键阶段,为全线早日开通奠定了坚实基础
2024-04-03 15:11
为切实织密森林“防火网”各地组织人员巡查防火。
2024-04-03 15:11
2024年3月31日,“知音湖北 遇见浪漫孝感”春赏花活动在湖北省孝感市金卉庄园景区启动。金卉庄园花团锦簇,五彩斑斓花卉竞相绽放。人们穿梭在花海之间,享受明媚春光。
2024-04-02 15:40
2024年3月23日,由中国服装设计师协会主办的2024秋冬中国国际时装周在北京开幕。
2024-03-26 21:07
3月17日,原创独立设计师品牌SHANG1 BY SHANGYI 2024秋冬系列时装发布会在北京举行。
2024-03-18 16:39
2024年2月28日,新疆维吾尔自治区巴音郭楞蒙古自治州博湖县境内的博斯腾湖出现推冰景观。
2024-02-29 18:59
云南省曲靖市罗平县马街镇钻天坡,盛开的油菜花梯田在初升太阳映照下,勾勒出一幅田园春景图
2024-02-23 10:59
美丽的三亚湾
2024-01-20 17:42
2024年1月12日,江西省吉安市吉州区庐陵文化生态园层林尽染,色彩斑斓,市民徜徉其间,尽享生态之乐。
2024-01-13 19:43
2023年12月26日,在云南省红河哈尼族彝族自治州元阳县新街镇黄草岭村附近,游客在冬樱花与梯田边游览。
2023-12-26 15:39
2023年12月12日,新疆哈密市巴里坤县第十九届冰雪文化旅游节采冰仪式在高家湖二渠水库进行。仪式主要展示了"头冰"的开采上岸过程。开幕式上还举行迎风旗、祈福词、喝出征酒等仪式。
2023-12-13 16:08
2023年12月13日,河北省正定古城迎来降雪,古城内外银装素裹,犹如一幅淡雅的水墨画,美如画卷。
2023-12-13 15:59
2023年11月28日,贵州省六盘水市明湖国家湿地公园层林尽染,景色迷人。
2023-11-29 15:42
2023年11月28日,江西吉安长塘镇中心小学,老师指导学生剪纸。
2023-11-29 15:42
三角梅原产于巴西,现主要分布在中国、秘鲁、阿根廷、日本、赞比亚等国家和地区。其中,以海南三角梅最为出名。
2023-11-29 11:13
2023年11月23日清晨,朝霞初现,三峡库区湖北省宜昌市秭归县沿江公路G348国道的绝壁岩体上,工人们正在铺设防护网,以防止岩崩和落石。
2023-11-24 15:15
2023年11月23日,黑龙江哈尔滨,哈尔滨站工作人员正在清理站台积雪。
2023-11-23 16:02
2023年11月21日,甘肃敦煌,首趟"敦煌号"铁海联运国际货运班列装载1000吨石棉驶出,经天津港通过铁海联运发往泰国曼谷。
2023-11-21 16:55
2023年11月21日,江苏省如皋市龙游河生态公园,色彩斑斓的树木与一河碧水相应成趣。
2023-11-21 16:55
江西省赣州市定南县历市镇,一座座风力发电机矗立在延绵群山上,与蓝天白云、绿树青山相辉映,极目远望、蔚为壮观。
2023-11-16 15:56
加载更多