国内刊号:37-1389/N
国际刊号:1671-9352
发布日期:
作者:谭金源,刁宇峰,杨亮,祁瑞华,林鸿飞
单位:1. 大连理工大学信息检索实验室, 辽宁 大连 116024;2. 大连外国语大学语言智能研究中心, 辽宁 大连 116024
关键词:BERT预训练语言模型,结构化模型,指针生成网络,EAC损失函数,
基金:国家重点研发计划资助项目(2019YFC1200302);国家自然科学基金重点资助项目(61632011)
抽取式摘要可读性、准确性较差,生成式摘要存在连贯性、逻辑性的不足,此外2种摘要方法的传统模型对文本的向量表示往往不够充分、准确。针对以上问题,该文提出了一种基于BERT-SUMOPN模型的抽取-生成式摘要方法。模型通过BERT预训练语言模型获取文本向量,然后利用抽取式结构化摘要模型抽取文本中的关键句子,最后将得到的关键句子输入到生成式指针生成网络中,通过EAC损失函数对模型进行端到端训练,结合coverage机制减少生成重复,获取摘要结果。实验结果表明,BERT-SUMOPN模型在BIGPATENT专利数据集上取得了很好的效果,ROUGE-1和ROUGE-2指标分别提升了3.3%和2.5%。
来源:2021年第7期
《山东大学学报(理学版)》期刊编辑部