国内刊号:37-1389/N
国际刊号:1671-9352
发布日期:
作者:王雪梅,陈兴蜀,王海舟,王文贤
单位:1. 四川大学计算机学院(软件学院), 四川 成都 610065;2. 四川大学网络空间安全学院, 四川 成都 610065;3. 四川大学网络空间安全研究院, 四川 成都 610065
关键词:标签和分块特征,新闻关键信息,信息抽取,新闻站点,
基金:国家自然科学基金资助项目(61802270);国家自然科学基金资助项目(61802271);国家“双创”示范基地之变革性技术国际研发转化平台资助项目(C700011);四川省重点研发项目资金资助(2018G20100);四川省科技支撑计划资金资助(2016GZ0038);中央高校基本科研业务费专项资金资助(2017SCU11065)
针对抽取新闻关键信息需要人工构造或训练生成模板的问题,提出了基于标签和分块特征的新闻关键信息自动抽取方法。该方法首先通过计算新闻网页相关特征来定位新闻正文标签块,然后通过编辑距离定位新闻标题标签块,最后根据正文块和标题块定位新闻发布时间和来源标签块,并通过抽取各块的文本获得目标新闻关键信息。在该方法的基础上提出了针对新闻站点的目标新闻自动抽取框架,并用该框架对10个新闻站点的30个新闻栏目进行了新闻抽取。对抽取到的1597条新闻随机选择了1000条进行了实验。实验结果表明,该方法对新闻标题、发布时间、来源、正文均表现出良好的抽取效果,且优于实验对比对象。
来源:2019年第3期
《山东大学学报(理学版)》期刊编辑部