舆情分析方法及系统的制作方法

xiaoxiao2020-10-23  13

舆情分析方法及系统的制作方法
【技术领域】
[0001]本发明涉及计算机信息安全监测技术领域,特别涉及一种舆情分析方法及系统。
【背景技术】
[0002]目前市场上有不少舆情系统。从实现功能来看,很多以“监控”/“热点发现”/ “预警”为核心功能和宣传点,如谷尼国际软件开发的Goonie互联网舆情监控系统、中科点击开发的军犬网络舆情监控系统、北京拓尔思开发的TRS网络舆情监控系统、北大方正开发的方正智思一网络舆情互联网信息监控分析系统等。但限于目前国内外的研究现状,中文分词和自动聚类等算法还不成熟,准确性方面难以保证。“热点发现”其实不是网监部门开展舆情监测工作的难点和唯一的主要关心的功能,在多渠道海量信息的分析上做得不到位,所以难以满足本项目的需要。
[0003]从需求分析来看,市面上很多舆情产品的厂商缺乏信息安全行业的背景,没有对舆情市场做经过科学严谨的需求调研,导致做出的产品功能大而全、缺乏深度、准确性也不够,不能满足客户的需求,从而导致市场推广的困难。
[0004]总而言之,目前市场上的相关技术具有如下的缺点:(1)成本高、效率低及耗时;
(2)侧重于舆情监控,需具备庞大的系统计算能力和系统建设成本;(3)舆情搜索不准确,搜索结果存在大量垃圾信息;(4)没有面向司法诉讼的电子证据保全功能。

【发明内容】

[0005]本发明旨在至少解决上述技术问题之一。
[0006]为此,本发明的一个目的在于提出一种具有成本低、效率高、省时、准确性高及安全性高的优点的舆情分析方法。
[0007]本发明的第二个目的在于提供一种舆情分析系统。
[0008]为了实现上述目的,本发明第一方面的实施例提出了一种舆情分析方法,包括以下步骤:根据搜索请求搜索并读取网页文件;从所述网页文件中提取舆情信息;对所述舆情信息进行分类;对每个分类结果中的舆情信息进行进一步分析以得到所述每个分类结果中的舆情信息对应的起源、舆论情感色彩、网络扩散状态、发展趋势、地域信息和年龄段信息;根据对所述舆情信息的进一步分类结果以及预设的证据保全规则判断是否对所述舆情信息进行证据保全。
[0009]根据本发明实施例的舆情分析方法,根据搜索请求搜索并读取网页文件,并从该网页文件中提取舆情信息,然后对舆情信息进行分类,并对每个分类结果中的舆情信息做进一步分析以得到每个分类结果中的舆情信息对应的起源、舆论情感色彩、网络扩散状态、发展趋势、地域信息和年龄段信息,最后根据对舆情信息的进一步分类结果以及预设的证据保全规则判断是否对舆情信息进行证据保全。从而,本发明实施例的方法能够对舆情信息进行自动分析、统计、聚类等操作,具有成本低、效率高、省时的优点,该方法采用双重消息过滤机制,因此准确性高,另外,该方法具有电子证据保全功能,能够有效支撑司法诉讼,安全性较高。
[0010]另外,根据本发明上述实施例的舆情分析方法还可以具有如下附加的技术特征:
[0011]在一些示例中,通过网络爬虫搜索并读取所述网页文件。
[0012]在一些示例中,所述舆情信息包括:作者、快照URL、标题、URL、收藏次数、回复次数、转发次数、所属板块、分类标签、内容摘要、来源和发布时间。
[0013]在一些示例中,所述预设的证据保全规则包括:是否启用、对应媒体、开始时间、结束时间、作者列表、感情色彩和关键字。
[0014]在一些示例中,当所述舆情信息的发布时间位于所述开始时间和所述结束时间、所述舆情信息的作者位于所述作者列表、所述舆情信息的发布媒体为所述对应媒体且所述舆情信息启动时,判断对所述舆情信息进行证据保全。
[0015]本发明第二方面的实施例还提供了一种舆情分析系统,包括:读取模块,用于根据搜索请求搜索并读取网页文件;提取模块,用于从所述网页文件中提取舆情信息;分类模块,用于对所述舆情信息进行分类,并对每个分类结果中的舆情信息进行进一步分析以得到所述每个分类结果中的舆情信息对应的起源、舆论情感色彩、网络扩散状态、发展趋势、地域信息和年龄段信息;判断模块,用于根据对所述舆情信息的进一步分类结果以及预设的证据保全规则判断是否对所述舆情信息进行证据保全。
[0016]根据本发明实施例的舆情分析系统,读取模块根据搜索请求搜索并读取网页文件,提取模块从该网页文件中提取舆情信息,然后分类模块对舆情信息进行分类,并对每个分类结果中的舆情信息做进一步分析以得到每个分类结果中的舆情信息对应的起源、舆论情感色彩、网络扩散状态、发展趋势、地域信息和年龄段信息,最后判断根据对舆情信息的进一步分类结果以及预设的证据保全规则判断是否对舆情信息进行证据保全。从而,本发明实施例的系统能够对舆情信息进行自动分析、统计、聚类等操作,具有成本低、效率高、省时的优点,该系统采用双重消息过滤机制,因此准确性高,另外,该系统具有电子证据保全功能,能够有效支撑司法诉讼,安全性较高。
[0017]另外,根据本发明上述实施例的舆情分析系统还可以具有如下附加的技术特征:
[0018]在一些示例中,所述读取模块通过网络爬虫搜索并读取所述网页文件。
[0019]在一些示例中,所述舆情信息包括:作者、快照URL、标题、URL、收藏次数、回复次数、转发次数、所属板块、分类标签、内容摘要、来源和发布时间。
[0020]在一些示例中,所述预设的证据保全规则包括:是否启用、对应媒体、开始时间、结束时间、作者列表、感情色彩和关键字。
[0021]在一些示例中,所述判断模块用于:当所述舆情信息的发布时间位于所述开始时间和所述结束时间、所述舆情信息的作者位于所述作者列表、所述舆情信息的发布媒体为所述对应媒体且所述舆情信息启动时,判断对所述舆情信息进行证据保全。
[0022]本发明的附加方面和优点将在下面的描述中部分给出,部分将从下面的描述中变得明显,或通过本发明的实践了解到。
【附图说明】
[0023]本发明的上述和/或附加的方面和优点从结合下面附图对实施例的描述中将变得明显和容易理解,其中:
[0024]图1是根据本发明一个实施例的舆情分析方法的流程图;
[0025]图2是根据本发明一个实施例的舆情分析方法的工作逻辑示意图;
[0026]图3是根据本发明另一个实施例的舆情分析方法的整体工作逻辑示意图;以及
[0027]图4是根据本发明一个实施例的舆情分析系统的结构框图。
【具体实施方式】
[0028]下面详细描述本发明的实施例,所述实施例的示例在附图中示出,其中自始至终相同或类似的标号表示相同或类似的元件或具有相同或类似功能的元件。下面通过参考附图描述的实施例是示例性的,仅用于解释本发明,而不能理解为对本发明的限制。
[0029]在本发明的描述中,需要理解的是,术语“中心”、“纵向”、“横向”、“上”、“下”、“前”、“后”、“左”、“右”、“竖直”、“水平”、“顶”、“底”、“内”、“外”等指示的方位或位置关系为基于附图所示的方位或位置关系,仅是为了便于描述本发明和简化描述,而不是指示或暗示所指的装置或元件必须具有特定的方位、以特定的方位构造和操作,因此不能理解为对本发明的限制。此外,术语“第一”、“第二”仅用于描述目的,而不能理解为指示或暗示相对重要性。
[0030]在本发明的描述中,需要说明的是,除非另有明确的规定和限定,术语“安装”、“相连”、“连接”应做广义理解,例如,可以是固定连接,也可以是可拆卸连接,或一体地连接;可以是机械连接,也可以是电连接;可以是直接相连,也可以通过中间媒介间接相连,可以是两个元件内部的连通。对于本领域的普通技术人员而言,可以具体情况理解上述术语在本发明中的具体含义。
[0031]参照下面的描述和附图,将清楚本发明的实施例的这些和其他方面。在这些描述和附图中,具体公开了本发明的实施例中的一些特定实施方式,来表示实施本发明的实施例的原理的一些方式,但是应当理解,本发明的实施例的范围不受此限制。相反,本发明的实施例包括落入所附加权利要求书的精神和内涵范围内的所有变化、修改和等同物。
[0032]以下结合附图描述根据本发明实施例的舆情分析方法及系统。
[0033]图1是根据本发明一个实施例的舆情分析方法的流程图。图2是根据本发明一个实施例的舆情分析方法的工作逻辑示意图。图3是根据本发明另一个实施例的舆情分析方法的整体工作逻辑示意图。
[0034]结合图1、图2和图3所示,根据本发明一个实施例的舆情分析方法,包括以下步骤:
[0035]步骤S101,根据搜索请求搜索并读取网页文件。
[0036]在一个具体的示例中,可根据搜索请求,通过网络爬虫搜索并获取网页文件。
[0037]步骤S102,从网页文件中提取舆情信息。
[0038]换言之,即从上述步骤SlOl获取得到的网页文件中提取舆情信息。在本发明的一个实施例中,舆情信息例如包括:作者、快照URL、标题、URL、收藏次数、回复次数、转发次数、所属板块、分类标签、内容摘要、来源和发布时间。
[0039]步骤S103,对舆情信息进行分类。
[004 0]换言之,即对上述步骤S102中得到的舆情信息如:作者、快照URL、标题、URL、收藏次数、回复次数、转发次数、所属板块、分类标签、内容摘要、来源和发布时间进行分类。
[0041]步骤S104,对每个分类结果中的舆情信息进行进一步分析以得到每个分类结果中的舆情信息对应的起源、舆论情感色彩、网络扩散状态、发展趋势、地域信息和年龄段信息。具体而言,可根据智能算法,判断网页内容的起源和情感色彩,根据网页内容、服务器所在地区,自动获取城市地区,并智能分析当前关注该舆情信息的用户群年龄分段。
[0042]步骤S105,根据对舆情信息的进一步分类结果以及预设的证据保全规则判断是否对舆情信息进行证据保全。其中,在本发明的一个实施例中,该预设的证据保全规则例如包括:是否启用、对应媒体、开始时间、结束时间、作者列表、感情色彩和关键字。更为具体地,在步骤S105中,当舆情信息的发布时间位于开始时间和结束时间、舆情信息的作者位于作者列表、舆情信息的发布媒体为对应媒体且舆情信息启动时,判断对舆情信息进行证据保全,并将符合该规则的网页信息(舆情信息)写入数据库内。
[0043]根据本发明实施例的舆情分析方法,根据搜索请求搜索并读取网页文件,并从该网页文件中提取舆情信息,然后对舆情信息进行分类,并对每个分类结果中的舆情信息做进一步分析以得到每个分类结果中的舆情信息对应的起源、舆论情感色彩、网络扩散状态、发展趋势、地域信息和年龄段信息,最后根据对舆情信息的进一步分类结果以及预设的证据保全规则判断是否对舆情信息进行证据保全。从而,本发明实施例的方法能够对舆情信息进行自动分析、统计、聚类等操作,具有成本低、效率高、省时的优点,该方法采用双重消息过滤机制,因此准确性高,另外,该方法具有电子证据保全功能,能够有效支撑司法诉讼,安全性较高。
[0044]本发明另一方面的实施例还提供了一种舆情分析系统。
[0045]图4为根据本发明一个实施例的舆情分析系统的结构框图。如图4所示,根据本发明一个实施例的舆情分析系统200,包括:读取模块210、提取模块220、分类模块230和判断模块240。
[0046]其中,读取模块210用于根据搜索请求搜索并读取网页文件。
[0047]在一个具体示例中,读取模块210可根据搜索请求,通过网络爬虫搜索并获取网页文件。
[0048]提取模块220用于从网页文件中提取舆情信息。
[0049]换言之,即提取模块220用于从读取模块210获取得到的网页文件中提取舆情信息。在本发明的一个实施例中,舆情信息例如包括:作者、快照URL、标题、URL、收藏次数、回复次数、转发次数、所属板块、分类标签、内容摘要、来源和发布时间。
[0050]分类模块230用于对舆情信息进行分类,并对每个分类结果中的舆情信息进行进一步分析以得到每个分类结果中的舆情信息对应的起源、舆论情感色彩、网络扩散状态、发展趋势、地域信息和年龄段信息。具体而言,分类模块230可根据智能算法,判断网页内容的情感色彩,根据网页内容、服务器所在地区,自动获取城市地区,并智能分析当前关注该舆情信息的用户群年龄分段。
[0051]换言之,即分类模块230用于对上述提取模块220得到的舆情信息如:作者、快照URL、标题、URL、收藏次数、回复次数、转发次数、所属板块、分类标签、内容摘要、来源和发布时间进行分类。
[0052]判断模块240用于根据对舆情信息的进一步分类结果以及预设的证据保全规则判断是否对舆情信息进行证据保全。其中,在本发明的一个实施例中,该预设的证据保全规贝_如包括:是否启用、对应媒体、开始时间、结束时间、作者列表、感情色彩和关键字。更为具体地,在一个具体示例中,判断模块240用于当舆情信息的发布时间位于开始时间和结束时间、舆情信息的作者位于作者列表、舆情信息的发布媒体为对应媒体且舆情信息启动时,判断对舆情信息进行证据保全。
[0053]作为一个具体的例子,该舆情分析系统200能够支持国内众多大型的新闻网站、论坛、博客、微博,且使用QT平台,易实现跨平台部署。另外,该系统使用模版精确定位网页信息,排除网页中例如广告等网页元素的对于信息提取的干扰,使用智能算法,高效准确地判断网页信息的情感值,且能够智能获得舆情信息发生的城市地区。
[0054]根据本发明实施例的舆情分析系统,读取模块根据搜索请求搜索并读取网页文件,提取模块从该网页文件中提取舆情信息,然后分类模块对舆情信息进行分类,并对每个分类结果中的舆情信息做进一步分析以得到每个分类结果中的舆情信息对应的起源、舆论情感色彩、网络扩散状态、发展趋势、地域信息和年龄段信息,最后判断根据对舆情信息的进一步分类结果以及预设的证据保全规则判断是否对舆情信息进行证据保全。从而,本发明实施例的系统能够对舆情信息进行自动分析、统计、聚类等操作,具有成本低、效率高、省时的优点,该系统采用双重消息过滤机制,因此准确性高,另外,该系统具有电子证据保全功能,能够有效支撑司法诉讼,安全性较高。
[0055]在本说明书的描述中,参考术语“一个实施例”、“一些实施例”、“示例”、“具体示例”、或“一些示例”等的描述意指结合该实施例或示例描述的具体特征、结构、材料或者特点包含于本发明的至少一个实施例或示例中。在本说明书中,对上述术语的示意性表述不一定指的是相同的实施例或示例。而且,描述的具体特征、结构、材料或者特点可以在任何的一个或多个实施例或示例中以合适的方式结合。
[0056]尽管已经示出和描述了本发明的实施例,本领域的普通技术人员可以理解:在不脱离本发明的原理和宗旨的情况下可以对这些实施例进行多种变化、修改、替换和变型,本发明的范围由权利要求及其等同限定。
【主权项】
1.一种舆情分析方法,其特征在于,包括以下步骤: 根据搜索请求搜索并读取网页文件; 从所述网页文件中提取舆情信息; 对所述舆情信息进行分类; 对每个分类结果中的舆情信息进行进一步分析以得到所述每个分类结果中的舆情信息对应的起源、舆论情感色彩、网络扩散状态、发展趋势、地域信息和年龄段信息; 根据对所述舆情信息的进一步分类结果以及预设的证据保全规则判断是否对所述舆情信息进行证据保全。2.根据权利要求1所述的舆情分析方法,其特征在于,通过网络爬虫搜索并读取所述网页文件。3.根据权利要求1所述的舆情分析方法,其特征在于,所述舆情信息包括:作者、快照URL、标题、URL、收藏次数、回复次数、转发次数、所属板块、分类标签、内容摘要、来源和发布时间。4.根据权利要求1所述的舆情分析方法,其特征在于,所述预设的证据保全规则包括:是否启用、对应媒体、开始时间、结束时间、作者列表、感情色彩和关键字。5.根据权利要求4所述的舆情分析方法,其特征在于,当所述舆情信息的发布时间位于所述开始时间和所述结束时间、所述舆情信息的作者位于所述作者列表、所述舆情信息的发布媒体为所述对应媒体且所述舆情信息启动时,判断对所述舆情信息进行证据保全。6.一种舆情分析系统,其特征在于,包括: 读取模块,用于根据搜索请求搜索并读取网页文件; 提取模块,用于从所述网页文件中提取舆情信息; 分类模块,用于对所述舆情信息进行分类,并对每个分类结果中的舆情信息进行进一步分析以得到所述每个分类结果中的舆情信息对应的起源、舆论情感色彩、网络扩散状态、发展趋势、地域信息和年龄段信息; 判断模块,用于根据对所述舆情信息的进一步分类结果以及预设的证据保全规则判断是否对所述舆情信息进行证据保全。7.根据权利要求6所述的舆情分析系统,其特征在于,所述读取模块通过网络爬虫搜索并读取所述网页文件。8.根据权利要求6所述的舆情分析系统,其特征在于,所述舆情信息包括:作者、快照URL、标题、URL、收藏次数、回复次数、转发次数、所属板块、分类标签、内容摘要、来源和发布时间。9.根据权利要求6所述的舆情分析系统,其特征在于,所述预设的证据保全规则包括:是否启用、对应媒体、开始时间、结束时间、作者列表、感情色彩和关键字。10.根据权利要求9所述的舆情分析系统,其特征在于,所述判断模块用于: 当所述舆情信息的发布时间位于所述开始时间和所述结束时间、所述舆情信息的作者位于所述作者列表、所述舆情信息的发布媒体为所述对应媒体且所述舆情信息启动时,判断对所述舆情信息进行证据保全。
【专利摘要】本发明提出一种舆情分析方法,包括以下步骤:根据搜索请求搜索并读取网页文件;从网页文件中提取舆情信息;对舆情信息进行分类;对每个分类结果中的舆情信息进行进一步分析以得到每个分类结果中的舆情信息对应的起源、舆论情感色彩、网络扩散状态、发展趋势、地域信息和年龄段信息;根据对舆情信息的进一步分类结果以及预设的证据保全规则判断是否对舆情信息进行证据保全。本发明实施例的方法具有成本低、效率高、省时、准确性高及安全性高的优点。本发明还提供了一种舆情分析系统。
【IPC分类】G06F17/30
【公开号】CN104881417
【申请号】CN201410073473
【发明人】张剑, 王水兵, 袁源
【申请人】深圳市网安计算机安全检测技术有限公司
【公开日】2015年9月2日
【申请日】2014年2月28日
转载请注明原文地址:https://www.famiwei.com/read-8138658.html

最新回复(0)