对商品评论进行文本分析(NLP)的实战项目

2024-08-21 08:20

本文主要是介绍对商品评论进行文本分析(NLP)的实战项目,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

文本分析技术是指使用计算机程序或算法处理、分析和理解文本数据的一系列方法。这种技术在自然语言处理(NLP)领域中非常重要,它可以应用于多种场景,包括但不限于情感分析、主题识别、信息提取、文本分类等。以下是一些常见的文本分析技术和方法:

1. 分词(Tokenization):
   - 将文本分割成单独的词汇或短语,这是文本处理的第一步。

2. 词性标注(Part-of-Speech Tagging):
   - 识别文本中每个词汇的词性,如名词、动词、形容词等。

3. 句法分析(Parsing):
   - 理解句子的语法结构,包括短语结构和依存关系。

4. 情感分析(Sentiment Analysis):
   - 判断文本的情感倾向,如正面、负面或中性。

5. 主题建模(Topic Modeling):
   - 识别文本集合中的主题分布,常用于文档聚类和探索性数据分析。

6. 文本分类(Text Classification):
   - 将文本分配到一个或多个类别中,如垃圾邮件检测、新闻分类等。

7. 命名实体识别(Named Entity Recognition, NER):
   - 识别文本中的特定实体,如人名、地点、组织等。

8. 链接识别(Entity Linking):
   - 将文本中的实体链接到知识库中的相应条目。

9. 关键词提取(Keyword Extraction):
   - 自动提取文本中的关键词汇或短语。

10. 摘要生成(Summarization):
    - 生成文本的简短摘要,保留主要信息。

11. 语义分析(Semantic Analysis):
    - 理解文本的深层含义,包括词义消歧和句子的真正意图。

12. 机器翻译(Machine Translation):
    - 将一种语言的文本自动翻译成另一种语言。

13. 文本相似度计算(Text Similarity):
    - 计算文本之间的相似度,常用于信息检索和去重。

14. 自然语言理解(Natural Language Understanding, NLU):
    - 综合理解自然语言的意图、情感、语境等。

15. 预训练语言模型(Pretrained Language Models):
    - 使用大规模数据预训练的深度学习模型,如BERT、GPT等,用于各种NLP任务。

文本分析技术的应用非常广泛,从社交媒体监控到客户反馈分析,从自动化内容生成到智能搜索引擎,都是文本分析技术的用武之地。随着技术的发展,文本分析技术正变得越来越精准和智能,为各种行业提供数据驱动的洞察。

在这里介绍一个用于情感分析的Python库SnowNLP。SnowNLP是一个专为中文文本处理设计的Python库,它提供了包括分词、词性标注、情感分析、文本转换(简繁转换)、关键词提取、摘要生成、短语提取等多种功能。SnowNLP的核心优势在于对中文文本的处理能力,特别是情感分析功能。

SnowNLP的安装非常简单,可以通过pip命令直接安装:

pip install snownlp

或者使用这个命令:

#安装snownlp包
!pip install snownlp  -i https://pypi.tuna.tsinghua.edu.cn/simple

接下来将对关于一个包含对一个商品的3637条评论的文本数据集来进行文本分析。本文将使用jieba,snownlp,wordcloud,matplotlib等模块对文本数据进行了简要的情感分析及可视化。

数据观看和下载入口:‌​​​​‍‌‍​‬​​‍‬‍​‍⁠‬​⁠​‌​⁠​​‍‌‍​​​​‌​‌​​​​数据集_NLP - 飞书云文档 (feishu.cn)

一、情感分析

先导入数据:

import pandas as pd
data = pd.read_csv('./商品评论数据.csv')
data1 = data[['sku_id','content']]
data1.head(10)

显示数据样貌为:

from snownlp import SnowNLP
data1['emotion'] = data1['content'].apply(lambda x:SnowNLP(x).sentiments)
data1.head(10)

接下来利用先前提到的用于情感分析的Python库SnowNLP:

from snownlp import SnowNLP
data1['emotion'] = data1['content'].apply(lambda x:SnowNLP(x).sentiments)
data1.head(10)

可以得到如下结果:

情感分析的结果是一个介于0到1之间的分数,越接近1表示情感越正面,越接近0则表示情感越负面 ,因此我们可以根据情感评分筛选出积极评论和消极评论。

我们也可对这些情感评分进一步可视化:

#情感分直方图
import matplotlib.pyplot as plt
import numpy as npplt.rcParams['font.sans-serif']=['SimHei']
plt.rcParams['axes.unicode_minus'] = Falsebins=np.arange(0,1.1,0.1)
plt.hist(data1['emotion'],bins,color='#4F94CD',alpha=0.9)
plt.xlim(0,1)
plt.xlabel('情感分')
plt.ylabel('数量')
plt.title('情感分直方图')plt.show()

可以得到如下的直方图:

便可得到如下结论:

  • 由直方图可见,评论内容两级分化较为严重

二、所有评论的词云图

from wordcloud import WordCloud
import jieba
w = WordCloud()
text = ''
for s in data['content']:text += s
data_cut = ' '.join(jieba.lcut(text))w = WordCloud(font_path='SimHei',stopwords=['的', '我', '了', '是', '和', '都', '就', '用'],width=2000,height=1200).generate(data_cut)
# 保存词云
w.to_file('词云图.png')
# 显示词云文件
plt.imshow(w)
plt.axis("off")
plt.show()

需要注意的是,为了运行这段代码,除了需要安装wordcloudjieba库之外,还需要安装matplotlib库来显示图片。

  • WordCloud 是一个用于生成词云的库。
  • jieba 是一个中文分词库,用于将中文文本拆分成单独的词语。
  • font_path='SimHei' 设置词云使用的字体,SimHei是一种常用的中文字体。
  • stopwords=['的', '我', '了', '是', '和', '都', '就', '用'] 设置停用词列表,这些词在生成词云时会被忽略。
  • width=2000 和 height=1200 设置生成的词云图片的宽度和高度。
  • generate(data_cut) 是根据分词后的文本数据生成词云。

以下为所有评论的词云图:

接下来我们提取其中的最常出现的前10个关键词:

#关键词top10
from jieba import analyse 
key_words = jieba.analyse.extract_tags(sentence=text, topK=10, withWeight=True, allowPOS=())
key_words

代码调用extract_tags函数来提取关键词,并带有以下参数:

  • sentence=text:要提取关键词的文本,这里使用之前拼接好的长字符串text
  • topK=10:指定提取关键词的数量,这里设置为10,表示提取出现频率最高的10个关键词。
  • withWeight=True:设置是否返回每个关键词的权重(即该关键词在文本中的出现频率),这里设置为True表示返回权重。
  • allowPOS=():这是一个可选参数,用来指定提取关键词时允许的词性。这里设置为空元组(),表示不限制词性,默认情况下会提取所有词性的关键词。

结果如下:

以上关键词显示,消费者比较在意手机的“屏幕”“拍照”“手感”等特性。

三、积极评论和消极评论的词云图

先根据第一步得出的情感评分进行分类,数值大于0.5的为积极评论,数值小于0.5的为消极评论。从而得出积极评论与消极评论占比:

#计算积极评论与消极评论各自的数目
pos = 0
neg = 0
for i in data1['emotion']:if i >= 0.5:pos += 1else:neg += 1
print('积极评论,消极评论数目分别为:',pos,neg)

得出结果为积极评论,消极评论数目分别为: 2791,846。

接下来我们对消极评论进行详细的分析:

#获取消极评论数据
data2=data1[data1['emotion']<0.5]
data2.head(10)

我们先了解消极评论数据样貌:

用与之前类似的方法得出消极评论的词云图:

#消极评论词云图
text2 = ''
for s in data2['content']:text2 += s
data_cut2 = ' '.join(jieba.lcut(text2))
w.generate(data_cut2)
image = w.to_file('消极评论词云.png')# 显示词云文件
plt.imshow(w)
plt.axis("off")
plt.show()

结果如下:

随后我们再用与之前类似的方法提取消极评论中最常出现的前10个关键词:

#消极评论关键词top10
key_words = jieba.analyse.extract_tags(sentence=text2, topK=10, withWeight=True, allowPOS=())
key_words

结果如下:

  • 消极评论关键词显示,“屏幕”“快递”“充电”是造成用户体验不佳的几个重要因素;屏幕和充电问题有可能是手机不良品率过高或快递压迫;

  • 因此平台应注重提高手机品控,降低不良品率;另外应设法提升发货,配送,派件的效率和质量。

以上就完成了对商品评论进行文本分析(NLP)的实战项目的全部流程,可以帮助了解用户使用体验,以此对平台运营提出优化建议。

点下关注,分享更多有关AI,数据分析和量化金融的实用教程和实战项目。

这篇关于对商品评论进行文本分析(NLP)的实战项目的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1092625

相关文章

Linux使用fdisk进行磁盘的相关操作

《Linux使用fdisk进行磁盘的相关操作》fdisk命令是Linux中用于管理磁盘分区的强大文本实用程序,这篇文章主要为大家详细介绍了如何使用fdisk进行磁盘的相关操作,需要的可以了解下... 目录简介基本语法示例用法列出所有分区查看指定磁盘的区分管理指定的磁盘进入交互式模式创建一个新的分区删除一个存

C#使用HttpClient进行Post请求出现超时问题的解决及优化

《C#使用HttpClient进行Post请求出现超时问题的解决及优化》最近我的控制台程序发现有时候总是出现请求超时等问题,通常好几分钟最多只有3-4个请求,在使用apipost发现并发10个5分钟也... 目录优化结论单例HttpClient连接池耗尽和并发并发异步最终优化后优化结论我直接上优化结论吧,

Golang操作DuckDB实战案例分享

《Golang操作DuckDB实战案例分享》DuckDB是一个嵌入式SQL数据库引擎,它与众所周知的SQLite非常相似,但它是为olap风格的工作负载设计的,DuckDB支持各种数据类型和SQL特性... 目录DuckDB的主要优点环境准备初始化表和数据查询单行或多行错误处理和事务完整代码最后总结Duck

使用Python进行文件读写操作的基本方法

《使用Python进行文件读写操作的基本方法》今天的内容来介绍Python中进行文件读写操作的方法,这在学习Python时是必不可少的技术点,希望可以帮助到正在学习python的小伙伴,以下是Pyth... 目录一、文件读取:二、文件写入:三、文件追加:四、文件读写的二进制模式:五、使用 json 模块读写

Redis主从/哨兵机制原理分析

《Redis主从/哨兵机制原理分析》本文介绍了Redis的主从复制和哨兵机制,主从复制实现了数据的热备份和负载均衡,而哨兵机制可以监控Redis集群,实现自动故障转移,哨兵机制通过监控、下线、选举和故... 目录一、主从复制1.1 什么是主从复制1.2 主从复制的作用1.3 主从复制原理1.3.1 全量复制

使用zabbix进行监控网络设备流量

《使用zabbix进行监控网络设备流量》这篇文章主要为大家详细介绍了如何使用zabbix进行监控网络设备流量,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录安装zabbix配置ENSP环境配置zabbix实行监控交换机测试一台liunx服务器,这里使用的为Ubuntu22.04(

通过C#获取PDF中指定文本或所有文本的字体信息

《通过C#获取PDF中指定文本或所有文本的字体信息》在设计和出版行业中,字体的选择和使用对最终作品的质量有着重要影响,然而,有时我们可能会遇到包含未知字体的PDF文件,这使得我们无法准确地复制或修改文... 目录引言C# 获取PDF中指定文本的字体信息C# 获取PDF文档中用到的所有字体信息引言在设计和出

Python中的随机森林算法与实战

《Python中的随机森林算法与实战》本文详细介绍了随机森林算法,包括其原理、实现步骤、分类和回归案例,并讨论了其优点和缺点,通过面向对象编程实现了一个简单的随机森林模型,并应用于鸢尾花分类和波士顿房... 目录1、随机森林算法概述2、随机森林的原理3、实现步骤4、分类案例:使用随机森林预测鸢尾花品种4.1

Python 中 requests 与 aiohttp 在实际项目中的选择策略详解

《Python中requests与aiohttp在实际项目中的选择策略详解》本文主要介绍了Python爬虫开发中常用的两个库requests和aiohttp的使用方法及其区别,通过实际项目案... 目录一、requests 库二、aiohttp 库三、requests 和 aiohttp 的比较四、requ

SpringBoot项目启动后自动加载系统配置的多种实现方式

《SpringBoot项目启动后自动加载系统配置的多种实现方式》:本文主要介绍SpringBoot项目启动后自动加载系统配置的多种实现方式,并通过代码示例讲解的非常详细,对大家的学习或工作有一定的... 目录1. 使用 CommandLineRunner实现方式:2. 使用 ApplicationRunne