CN116663534A

CN116663534A - 一种基于自然语言处理的文本数据统计分析系统及方法

Info

Publication number: CN116663534A
Application number: CN202310961991.9A
Authority: CN
Inventors: 孙兆洋; 隋媛; 张莺; 张荫芬; 李文武
Original assignee: China National Institute of Standardization
Current assignee: China National Institute of Standardization
Priority date: 2023-08-02
Filing date: 2023-08-02
Publication date: 2023-08-29

Abstract

本发明提供一种基于自然语言处理的文本数据统计分析系统及方法，包括自然语言数据筛选系统、自然语言数据管理系统、自然语言数据分析系统和自然语言图表可视化管理系统，所述自然语言数据筛选系统包括自然语言数据预处理模块、自然语言数据筛选模块以及信息获取模块，根据自然语言图表可视化管理系统的统计结果和用户筛选条件自动生成由表和关键词为节点、有序对为边构成的有向图，所述语义匹配模块利用自然语言处理技术判断自然语言数据查询结果是否匹配用户待分析问题。本发明能够利用自然语言处理技术和知识图谱技术建立知识库，再通过智能数据分析和可视化技术实现文本数据统计分析，实现文本文档数据挖掘。

Description

一种基于自然语言处理的文本数据统计分析系统及方法

技术领域

本发明涉及自然语言分析技术领域，尤其涉及一种基于自然语言处理的文本数据统计分析系统及方法。

背景技术

随着人工智能技术的不断发展，自然语言语义解析与交互技术越来越受到重视。目前对话系统针对某个行业有自身的语料库，并不能对数据进行智能管理和统计计算或者模板相对固定；

对大型的数据中心，主要依靠人力通过阅读文本的形式来进行统计，因此会耗费大量的时间。随着文本文档数量的爆炸式增长，人工已经无法满足文本数据分析的需求，再加上企业文本文档的离散化储存，势必导致大量重要的数据信息没有被挖掘而丢失，造成数据资源的浪费。

因此，有必要解决企业文本文档数据的统计分析问题，进而提取关键信息指导企业生产运营。

发明内容

针对上述问题，本发明提供一种基于自然语言处理的文本数据统计分析系统及方法，本发明能够利用自然语言处理技术和知识图谱技术建立知识库，再通过智能数据分析和可视化技术实现文本数据统计分析，实现文本文档数据挖掘。

为解决上述问题，本发明所采用的技术方案是：

一种基于自然语言处理的文本数据统计分析系统及方法，包括自然语言数据筛选系统、自然语言数据管理系统、自然语言数据分析系统和自然语言图表可视化管理系统；

所述自然语言数据筛选系统包括自然语言数据预处理模块、自然语言数据筛选模块以及信息获取模块；

所述自然语言数据管理系统包括自然语言数据构建模块、自然语言数据配置模块以及描述语义编码模块；

所述自然语言数据分析系统包括自然语言理解模块、自然语言查询模块、语义匹配模块以及标签语义编码模块；

所述自然语言图表可视化管理系统用于数据图表的生成和可视化展现，所述自然语言图表可视化管理系统提供数据图表生成模板，根据图表模板读取自然语言图表可视化管理系统的统计结果，根据自然语言图表可视化管理系统的统计结果和用户筛选条件自动生成由表和关键词为节点、有序对为边构成的有向图；

所述语义匹配模块利用自然语言处理技术判断自然语言数据查询结果是否匹配用户待分析问题，匹配的数据需要纳入统计。

优选地，所述语言数据预处理模块用于文档文本的预处理，包括语料导入、格式转换、语料清理。

优选地，所述自然语言数据筛选模块将文档利用自然语言处理技术进行文档信息抽取，为自然语言数据管理系统提供知识数据，所述信息获取模块，用于获取访客所需访问和调取的资料的文本描述并定义访客的身份标签信息。

优选地，所述自然语言数据构建模块用于定义自然语言的领域、标签。

优选地，所述自然语言数据配置模块用于自然语言数据的配置，并建立数据与图谱标签的映射关系，为后续自然语言数据分析系统提供数据源，自然语言数据管理系统提供可视化功能，进行自然语言数据的增删改查，所述描述语义编码模块将所述访客所需访问和调取的资料的文本描述进行处理后通过包含嵌入层的语义编码器以得到资源描述语义特征向量。

优选地，所述自然语言理解模块连接用户交互界面，提供用户问题描述模板，用户可在用户交互界面根据模板输入待分析的问题，将用户待分析的问题通过基于模板和深度学习的自然语言处理技术进行语义提取。

优选地，所述自然语言查询模块利用图算法对知识图谱数据进行查询和数据统计。

优选地，所述自然语言查询模块包含自然语言算法技术，所述自然语言算法技术是指搜索算法类的基础图算法，根据所述自然语言算法技术进行自然语言数据查询，查询结果供语义匹配模块进行判断，所述标签语义编码模块将所述访客的身份标签信息进行分词处理后通过所述包含嵌入层的语义编码器以得到身份标签语义特征向量。

优选地，所述自然语言查询模块还包含自然语言计算功能，所述自然语言计算功能包括求和、求差类的基本统计数学计算，统计计算结果用于供自然语言图表可视化管理系统调用。

一种基于自然语言处理的文本数据统计分析系统的方法，包括以下步骤：

S1、构建自然语言数据筛选系统，包括自然语言数据预处理模块和自然语言数据筛选模块以及信息获取模块；构建自然语言数据管理系统，包括自然语言数据构建模块和自然语言数据配置模块；构建自然语言数据分析系统，包括自然语言理解模块、自然语言查询模块和语义匹配模块；构建自然语言图表可视化管理系统；

S2、构建完整的自然语言数据管理系统，并完成自然语言的领域、标签数据的定义，获取访客所需访问和调取的资料的文本描述并定义访客的身份标签信息；

S3、上传自然语言数据至语料预处理模块，然后对自然语言数据进行语料导入、格式转换、语料清理；

S4、对自然语言数据进行标注，标注完成后，自然语言数据自动抽取并导入至知识图谱中，为后续自然语言数据分析系统提供数据源，自然语言数据管理系统提供可视化功能，进行自然语言数据的增删改查；

S5、在问题理解模块的问题描述模板中输入待分析的问题，通过基于模板和深度学习的自然语言处理技术进行语义提取;

S6、有向图的生成具体如下：记有向图作AS＝<M,N>；其中，顶点集，/>为第i个用户需求关键词或实体，i＝1,...,n；/>表示r张数据信息表，r＝1,...,m；边集定义为CS＝/>为第i个用户需求关键词或实体关联的数据信息表}；在关键词对应同一张数据信息表的几个字段时，取相似度最大的字段，/>。

本发明的有益效果为：

1.利用自然语言处理技术和知识图谱技术建立知识库，再通过智能数据分析和可视化技术实现文本数据统计分析，实现文本文档数据挖掘，通过自然语言处理技术、知识图谱技术和图算法技术，实现同类型文本文档的统一数据管理和关联分析，可进行知识图谱的扩充和更新，同时数据分析结果也进行相应更新。

2.通过获取访客所需访问和调取的资料的文本描述，使用用于自然语言处理的语义理解模型分别对所述访客所需访问和调取的资料的文本描述和所述访客的身份标签信息进行自适应语义理解，将文本文档数据分析结果自动生成图表直观地展示，增强了数据分析结果的可读性。

3.对不同行业的领域增加了自学习的转义，能够对不同行业的专业词汇进行学习，使得查询结果更具行业针对性，实用性更强。

附图说明

图1为本发明的系统框图；

图2为本发明的流程框图。

具体实施方式

下面将结合本发明实施例中的附图，对本发明实施例中的技术方案进行清楚、完整地描述，显然，所描述的实施例仅仅是本发明一部分实施例，而不是全部的实施例。基于本发明中的实施例，本领域普通技术人员在没有做出创造性劳动前提下所获得的所有其他实施例，都属于本发明保护的范围。

参照图1，一种基于自然语言处理的文本数据统计分析系统及方法，包括自然语言数据筛选系统、自然语言数据管理系统、自然语言数据分析系统和自然语言图表可视化管理系统；

自然语言数据筛选系统包括自然语言数据预处理模块、自然语言数据筛选模块以及信息获取模块；

自然语言数据管理系统包括自然语言数据构建模块、自然语言数据配置模块以及描述语义编码模块；

自然语言数据分析系统包括自然语言理解模块、自然语言查询模块、语义匹配模块以及标签语义编码模块；

自然语言图表可视化管理系统用于数据图表的生成和可视化展现，自然语言图表可视化管理系统提供数据图表生成模板，根据图表模板读取自然语言图表可视化管理系统的统计结果，根据自然语言图表可视化管理系统的统计结果和用户筛选条件自动生成由表和关键词为节点、有序对为边构成的有向图；

语义匹配模块利用自然语言处理技术判断自然语言数据查询结果是否匹配用户待分析问题，匹配的数据需要纳入统计。

进一步的，语言数据预处理模块用于文档文本的预处理，包括语料导入、格式转换、语料清理。

进一步的，自然语言数据筛选模块将文档利用自然语言处理技术进行文档信息抽取，为自然语言数据管理系统提供知识数据，信息获取模块，用于获取访客所需访问和调取的资料的文本描述并定义访客的身份标签信息。

进一步的，自然语言数据构建模块用于定义自然语言的领域、标签。

进一步的，自然语言数据配置模块用于自然语言数据的配置，并建立数据与图谱标签的映射关系，为后续自然语言数据分析系统提供数据源，自然语言数据管理系统提供可视化功能，进行自然语言数据的增删改查，描述语义编码模块将访客所需访问和调取的资料的文本描述进行处理后通过包含嵌入层的语义编码器以得到资源描述语义特征向量。

进一步的，自然语言理解模块连接用户交互界面，提供用户问题描述模板，用户可在用户交互界面根据模板输入待分析的问题，将用户待分析的问题通过基于模板和深度学习的自然语言处理技术进行语义提取。

进一步的，自然语言查询模块利用图算法对知识图谱数据进行查询和数据统计。

进一步的，自然语言查询模块包含自然语言算法技术，自然语言算法技术是指搜索算法类的基础图算法，根据自然语言算法技术进行自然语言数据查询，查询结果供语义匹配模块进行判断，标签语义编码模块将访客的身份标签信息进行分词处理后通过包含嵌入层的语义编码器以得到身份标签语义特征向量。

进一步的，自然语言查询模块还包含自然语言计算功能，自然语言计算功能包括求和、求差类的基本统计数学计算，统计计算结果用于供自然语言图表可视化管理系统调用。

参照图2，一种基于自然语言处理的文本数据统计分析系统的方法，包括以下步骤：

综合上述，本发明利用自然语言处理技术和知识图谱技术建立知识库，再通过智能数据分析和可视化技术实现文本数据统计分析，实现文本文档数据挖掘，通过自然语言处理技术、知识图谱技术和图算法技术，实现同类型文本文档的统一数据管理和关联分析，可进行知识图谱的扩充和更新，同时数据分析结果也进行相应更新，通过获取访客所需访问和调取的资料的文本描述，使用用于自然语言处理的语义理解模型分别对所述访客所需访问和调取的资料的文本描述和所述访客的身份标签信息进行自适应语义理解，将文本文档数据分析结果自动生成图表直观地展示，增强了数据分析结果的可读性，对不同行业的领域增加了自学习的转义，能够对不同行业的专业词汇进行学习，使得查询结果更具行业针对性，实用性更强。

本发明中的公式是去除量纲取其数值计算，通过采集大量数据进行软件模拟得到最接近真实情况的一个公式，公式中的预设比例系数由本领域的技术人员根据实际情况设定或者通过大量数据模拟获取。

尽管已经示出和描述了本发明的实施例，对于本领域的普通技术人员而言，可以理解在不脱离本发明的原理和精神的情况下可以对这些实施例进行多种变化、修改、替换和变型，本发明的范围由所附权利要求及其等同物限定。

以上所述仅为本发明的较佳实施例，并不用以限制本发明，凡在本发明的精神和原则之内，所作的任何修改、等同替换、改进等，均应包含在本发明的保护范围之内。

Claims

1.一种基于自然语言处理的文本数据统计分析系统，其特征在于，包括自然语言数据筛选系统、自然语言数据管理系统、自然语言数据分析系统和自然语言图表可视化管理系统；

2.根据权利要求1所述的一种基于自然语言处理的文本数据统计分析系统，其特征在于，所述语言数据预处理模块用于文档文本的预处理，包括语料导入、格式转换、语料清理。

3.根据权利要求2所述的一种基于自然语言处理的文本数据统计分析系统，其特征在于，所述自然语言数据筛选模块将文档利用自然语言处理技术进行文档信息抽取，为自然语言数据管理系统提供知识数据，所述信息获取模块，用于获取访客所需访问和调取的资料的文本描述并定义访客的身份标签信息。

4.根据权利要求3所述的一种基于自然语言处理的文本数据统计分析系统，其特征在于，所述自然语言数据构建模块用于定义自然语言的领域、标签。

5.根据权利要求4所述的一种基于自然语言处理的文本数据统计分析系统，其特征在于，所述自然语言数据配置模块用于自然语言数据的配置，并建立数据与图谱标签的映射关系，为后续自然语言数据分析系统提供数据源，自然语言数据管理系统提供可视化功能，进行自然语言数据的增删改查，所述描述语义编码模块将所述访客所需访问和调取的资料的文本描述进行处理后通过包含嵌入层的语义编码器以得到资源描述语义特征向量。

6.根据权利要求5所述的一种基于自然语言处理的文本数据统计分析系统，其特征在于，所述自然语言理解模块连接用户交互界面，提供用户问题描述模板，用户可在用户交互界面根据模板输入待分析的问题，将用户待分析的问题通过基于模板和深度学习的自然语言处理技术进行语义提取。

7.根据权利要求6所述的一种基于自然语言处理的文本数据统计分析系统，其特征在于，所述自然语言查询模块利用图算法对知识图谱数据进行查询和数据统计。

8.根据权利要求7所述的一种基于自然语言处理的文本数据统计分析系统，其特征在于，所述自然语言查询模块包含自然语言算法技术，所述自然语言算法技术是指搜索算法类的基础图算法，根据所述自然语言算法技术进行自然语言数据查询，查询结果供语义匹配模块进行判断，所述标签语义编码模块将所述访客的身份标签信息进行分词处理后通过所述包含嵌入层的语义编码器以得到身份标签语义特征向量。

9.根据权利要求8所述的一种基于自然语言处理的文本数据统计分析系统，其特征在于，所述自然语言查询模块还包含自然语言计算功能，所述自然语言计算功能包括求和、求差类的基本统计数学计算，统计计算结果用于供自然语言图表可视化管理系统调用。

10.适用于权利要求1-9任意一条所述的一种基于自然语言处理的文本数据统计分析系统的方法，其特征在于，包括以下步骤：

S5、在问题理解模块的问题描述模板中输入待分析的问题，通过基于模板和深度学习的自然语言处理技术进行语义提取；

S6、有向图的生成具体如下：记有向图作AS＝<M,N>；其中，顶点集，/>为第i个用户需求关键词或实体，i＝1,...,n；/>表示r张数据信息表，r＝1,...,m；边集定义为CS＝/>＝1 ,2,3,...,n，r＝1 ,...,m,r为第i个用户需求关键词或实体关联的数据信息表}；在关键词对应同一张数据信息表的几个字段时，取相似度最大的字段，/>。