喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

2023-10-31 10:40

文章标签 python 我用指南喜欢鉴茶成功人士喝茶

本文主要是介绍喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南，希望对大家解决编程问题提供一定的参考价值，需要的开发者们随着小编来一起学习吧！

前言

投一把青叶，感叹岁月如梦犹在，注一汪清泉，寻味浮生千姿百态。

说一下为啥我突然想到写Python来鉴茶这种小案例吧！因为今天领导把我喊到办公室，一起喝了两杯茶，但是我又不是那种喜欢喝茶的，对茶也没有研究过！所以今天特意来出一个教程，也是能教大家学Python也能防止没有这方面的知识点，至少一些喝茶最常见的礼仪得自己清楚，不至于在以后出丑嘛！

Start

阅读本文及源码，可以和小编一起学到 xpath 表达式爬取数据，多进程爬取，pandas 基本操作，pyecharts 可视化，stylecloud 词云，文本余弦相似度相似度，KMeans，关键词提取算法：TextRank，TF-IDF，LDA 主题模型。

源码获取在文末

小编找到一个和茶有关网站：

https://chaping.chayu.com/?bid=1

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

数据获取

从首页进入茶评，可以看到所有茶的基本信息，结果有多页，获取所有的基本信息包括标题，评分，品牌，产地，茶类，详细链接，id：

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

再根据获得的链接，下钻爬取每一种茶的推荐指数，总评，所有排行：

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

及爬取对应的评论，有多页就爬取多页，包含字段评论人，评论人等级，评分，评论，评论时间：

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

最后保存为 tea.csv,comment.csv 两个 csv：

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

整个爬虫流程就这样，使用了 xpath 提取，多进程爬取，逻辑不算复杂，详细实现逻辑可查看源码。

数据分析

总共获得 3w 条数据，获得数据后就可以开始进行探索了。

先对标题进行查看，标题是由品牌及名称构成，处理为只保留名称部分，绘制词云。

红茶，白杜丹，铁观音，绿茶，毛尖等一些听到过的茶名称还是比较多的：

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

茶评分取值为 0-10，对评分每两分进行切分后绘制直方图。

从结果上看，评分都挺高的，只有个别评分是低于 4 分的，小编选出数据看了看，总评价对这些低分的茶评价不是特别友好：

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

现在基本上每种茶都有专门的品牌在售卖，对品牌进行统计，绘制词语。

发现斗记茶业，中茶，大益，天福茗茶等较为突出，这些品牌就算不了解茶，但多多少少也听到过在大街上看到过：

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

每种茶都有它独特的产地，对产地绘制热力地图。

发现产地来自云南的是最多的，多达上千种，小编查了查，云南茶叶最重要的原产地，云南是茶叶最为古老的故乡。

其次是福建，有着一千多年的茶文化历史，是最中国产茶的重要产地：

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

目前茶类可分为普洱，绿茶，红茶，乌龙，黑茶，白茶，花茶，黄茶，袋泡，速溶茶十大类，每个大类别有细分很多小类，对每个大类进行统计绘制柱状图。

发现普洱茶是类别最多的，其次是绿茶，红茶，看到这里小编想到自己都很少喝普洱茶：

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

热搜能从侧面反映一种茶受不受欢迎，小编选出热搜排名前 10 的茶，拉出明细。

发现排名第一的是经典普洱，普洱也是种类最多的茶，以后可以特地买一点试试：

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

对评论时间以时间年月为维度，同比每一年每一月的评论走势图。

发现评论用户 14-17 年活跃程度是一直攀升，之后下跌了：

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

到这里，探索性分析就完成了，主要用到了，pandas，stylecloud，jieba，pyecharts 这些技术，详细实现过程可参考源码。

关键词提取

在获得的数据中，有总评字段，即对每一种茶的评语，有每一个用户评论的字段，利用这两个字段来实现文本关键词提取。

对于总评，我们想把总评相似的茶分到一起，可以使用 KMeans 聚类算法，但总评是文本数据。

需要先提取每条总评中的关键词，使用了 TextRank 算法提取关键词，原理是基于句子进行分词，对每个词进行权重打分，获得分数高的作为关键词。

对关键词向量化，再计算余弦相似度，最后使用聚类算法，分为了两种种类。

种类一主要是从品尝方向进行评价的，香气，滋味，入口，顺滑等。

种类二主要是从外表方向进行评价的，外形，条索，色泽，原料等：

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

对评论先使用了 TF-IDF 算法进行关键词的提取，是有 TF，IDF 两部分算法组成。

TF，计算每一个词在所有文本中出现的频率。

IDF，计算每一个词在所有评论中，在多少条评论中出现的次数，映射一个分值。

最后 TF*IDF 选出分值前 10 的关键词：

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

第二种方法是利用主题模型 LDA 进行关键词提取，需要先确定主题数，再提取关键词，这里就选取 1 个主题，及前 10 关键词：

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南

源码获取

需要源码点这里即可获取

这篇关于喜欢喝茶的都是成功人士吗？我用Python来做一个鉴茶指南的文章就介绍到这儿，希望我们推荐的文章对编程师们有所帮助！

http://www.chinasem.cn/article/314773。 23002807@qq.com

相关文章

如何使用 Python 读取 Excel 数据

如何使用 Python 读取 Excel 数据

《如何使用Python读取Excel数据》：本文主要介绍使用Python读取Excel数据的详细教程,通过pandas和openpyxl,你可以轻松读取Excel文件,并进行各种数据处理操... 目录使用 python 读取 Excel 数据的详细教程1. 安装必要的依赖2. 读取 Excel 文件3. 读

阅读更多...

SpringBoot请求参数接收控制指南分享

SpringBoot请求参数接收控制指南分享

《SpringBoot请求参数接收控制指南分享》：本文主要介绍SpringBoot请求参数接收控制指南,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录Spring Boot 请求参数接收控制指南1. 概述2. 有注解时参数接收方式对比3. 无注解时接收参数默认位置

阅读更多...

Python的time模块一些常用功能(各种与时间相关的函数)

Python的time模块一些常用功能(各种与时间相关的函数)

《Python的time模块一些常用功能(各种与时间相关的函数)》Python的time模块提供了各种与时间相关的函数,包括获取当前时间、处理时间间隔、执行时间测量等,：本文主要介绍Python的... 目录1. 获取当前时间2. 时间格式化3. 延时执行4. 时间戳运算5. 计算代码执行时间6. 转换为指

阅读更多...

利用Python调试串口的示例代码

利用Python调试串口的示例代码

《利用Python调试串口的示例代码》在嵌入式开发、物联网设备调试过程中,串口通信是最基础的调试手段本文将带你用Python+ttkbootstrap打造一款高颜值、多功能的串口调试助手,需要的可以了... 目录概述：为什么需要专业的串口调试工具项目架构设计1.1 技术栈选型1.2 关键类说明1.3 线程模

阅读更多...

Python ZIP文件操作技巧详解

Python ZIP文件操作技巧详解

《PythonZIP文件操作技巧详解》在数据处理和系统开发中,ZIP文件操作是开发者必须掌握的核心技能,Python标准库提供的zipfile模块以简洁的API和跨平台特性,成为处理ZIP文件的首选... 目录一、ZIP文件操作基础三板斧1.1 创建压缩包1.2 解压操作1.3 文件遍历与信息获取二、进阶技

阅读更多...

Python Transformers库(NLP处理库)案例代码讲解

Python Transformers库(NLP处理库)案例代码讲解

《PythonTransformers库(NLP处理库)案例代码讲解》本文介绍transformers库的全面讲解,包含基础知识、高级用法、案例代码及学习路径,内容经过组织,适合不同阶段的学习者,对... 目录一、基础知识1. Transformers 库简介2. 安装与环境配置3. 快速上手示例二、核心模

阅读更多...

Python正则表达式语法及re模块中的常用函数详解

Python正则表达式语法及re模块中的常用函数详解

《Python正则表达式语法及re模块中的常用函数详解》这篇文章主要给大家介绍了关于Python正则表达式语法及re模块中常用函数的相关资料,正则表达式是一种强大的字符串处理工具,可以用于匹配、切分、... 目录概念、作用和步骤语法re模块中的常用函数总结概念、作用和步骤概念：本身也是一个字符串，其中

阅读更多...

Python使用getopt处理命令行参数示例解析(最佳实践)

Python使用getopt处理命令行参数示例解析(最佳实践)

《Python使用getopt处理命令行参数示例解析(最佳实践)》getopt模块是Python标准库中一个简单但强大的命令行参数处理工具,它特别适合那些需要快速实现基本命令行参数解析的场景,或者需要... 目录为什么需要处理命令行参数？getopt模块基础实际应用示例与其他参数处理方式的比较常见问http

阅读更多...

python实现svg图片转换为png和gif

python实现svg图片转换为png和gif

《python实现svg图片转换为png和gif》这篇文章主要为大家详细介绍了python如何实现将svg图片格式转换为png和gif,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录python实现svg图片转换为png和gifpython实现图片格式之间的相互转换延展：基于Py

阅读更多...

Python中的getopt模块用法小结

Python中的getopt模块用法小结

《Python中的getopt模块用法小结》getopt.getopt()函数是Python中用于解析命令行参数的标准库函数,该函数可以从命令行中提取选项和参数,并对它们进行处理,本文详细介绍了Pyt... 目录getopt模块介绍getopt.getopt函数的介绍getopt模块的常用用法getopt模

阅读更多...