《计算机应用研究》|Application Research of Computers

基于多数据源的论文数据爬虫技术的实现及应用

Implementation and application of paper data crawler technology based on multiple data sources

免费全文下载 (已被下载 次)  
获取PDF全文
作者 侯晋升,张仰森,黄改娟,段瑞雪
机构 北京信息科技大学 智能信息研究所;国家经济安全预警工程北京实验室
统计 摘要被查看 次,已被下载
摘要 在使用单个数据源进行论文数据采集的过程中,存在着数据全面性不足,数据采集速度因网站访问频率限制而受限等问题。针对这些问题,提出了一个基于多数据源的论文数据爬虫技术。首先,以万方数据、维普网、超星期刊四大中文文献服务网站为数据源,针对检索关键词完成列表页数据的爬取与解析;然后通过任务调度策略,去除各数据源之间重复的数据,同时进行任务的均衡;最后采用多线程对各数据源进行论文详情信息的抓取、解析与入库,并构建网页进行检索与展示。实验表明,在单个网页爬取与解析速度相同的情况下,该技术能够更加全面、高效地完成论文信息采集任务,证实了该技术的有效性。
关键词 网络爬虫;多源数据源;多线程;信息处理;数据展示
基金项目 国家自然科学基金资助项目(61772081)
科技创新服务能力建设—科研基地建设—北京实验室—国家经济安全预警工程北京实验室项目(PXM2018_014224_000010)
国家重点研发计划课题(2018YFB1402901)
本文URL http://www.arocmag.com/article/02-2021-02-038.html
收稿日期
修回日期
页码 -
中图分类号 TP391.1
文献标志码