Python爬虫:如何下载懂车帝的电动车数据(完整代码)

2023-10-10 05:10

本文主要是介绍Python爬虫:如何下载懂车帝的电动车数据(完整代码),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

⭐️⭐️⭐️⭐️⭐️欢迎来到我的博客⭐️⭐️⭐️⭐️⭐️
🐴作者:秋无之地

🐴简介:CSDN爬虫、后端、大数据领域创作者。目前从事python爬虫、后端和大数据等相关工作,主要擅长领域有:爬虫、后端、大数据开发、数据分析等。

🐴欢迎小伙伴们点赞👍🏻、收藏⭐️、留言💬、关注🤝,关注必回关

上一篇文章已经跟大家介绍过《数据采集:数据挖掘的基础》,相信大家对用户画像都有一个基本的认识。下面我讲一下:Python爬虫:如何下载懂车帝的电动车数据

一、确定目标数据

1、先打开目标网站,找到目标数据所在的页面

2、找到目标数据所在的api或页面

通过f12打开调试模式,通过搜索关键词,找到关键词所在的api或页面

3、观察请求参数

1)header参数:没有加密数据,无需登录因此不用cookie

2)body参数:同样没有加密参数

3)翻页:body参数新增了limit(每页展示数量)、page(页码)

二、请求接口

使用requests库请求接口,返回数据

    def get_data(self,page=1,is_total=0):'''请求接口'''url = "https://www.dongchedi.com/motor/pc/car/brand/select_series_v2?aid=1839&app_name=auto_web_pc"# body参数data_dict = {"fuel_form": "4","sort_new": "hot_desc","city_name": "广州","limit": 30,"page": page}res = requests.post(url=url, headers=self.header, data=data_dict).json()# print(res)#返回数据if res and 'status' in res and res['status']==0:if is_total:return res['data']['series_count']return res['data']['series']else:return []

三、数据解析

将返回的数据进行json序列化,然后通过遍历、字典提取目标数据

    def data_deal(self,data_list=None):'''数据解析'''new_list = []for data_dict in data_list:#品牌IDbrand_id = data_dict['brand_id']#品牌brand_name = data_dict['brand_name']#封面图cover_url = data_dict['cover_url']#车名outter_name = data_dict['outter_name']#官方指导价official_price = data_dict['official_price']#款式数量count = data_dict['count']#评分dcar_score = data_dict['dcar_score']new_list.append([brand_id,brand_name,cover_url,outter_name,official_price,count,dcar_score])return new_list

四、数据存储

数据解析后,对数据进行拼接,然后持久化,存在csv文件

    def data_to_csv(self,data_li=None):'''数据存储'''df = pd.DataFrame(data_li)df.to_csv("test1.csv", index=False)

文件内容:

五、完整代码

完整代码如下:

# -*- coding: utf-8 -*-
import math
import requests
import pandas as pdclass Dongchedi_class():'''懂车帝'''def __init__(self):self.header = {"User-Agent":"Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/116.0.0.0 Safari/537.36","Referer":"https://www.dongchedi.com/auto/library/x-x-x-x-x-x-4-x-x-x-x","Origin":"https://www.dongchedi.com",}def get_data(self,page=1,is_total=0):'''请求接口'''url = "https://www.dongchedi.com/motor/pc/car/brand/select_series_v2?aid=1839&app_name=auto_web_pc"# body参数data_dict = {"fuel_form": "4","sort_new": "hot_desc","city_name": "广州","limit": 30,"page": page}res = requests.post(url=url, headers=self.header, data=data_dict).json()# print(res)#返回数据if res and 'status' in res and res['status']==0:if is_total:return res['data']['series_count']return res['data']['series']else:return []def data_deal(self,data_list=None):'''数据解析'''new_list = []for data_dict in data_list:#品牌IDbrand_id = data_dict['brand_id']#品牌brand_name = data_dict['brand_name']#封面图cover_url = data_dict['cover_url']#车名outter_name = data_dict['outter_name']#官方指导价official_price = data_dict['official_price']#款式数量count = data_dict['count']#评分dcar_score = data_dict['dcar_score']new_list.append([brand_id,brand_name,cover_url,outter_name,official_price,count,dcar_score])return new_listdef data_to_csv(self,data_li=None):'''数据存储'''df = pd.DataFrame(data_li)df.to_csv("test1.csv", index=False)def run(self):#获取总页数total = self.get_data(page=1, is_total=1)if total>0:total_page = math.ceil(total/30)print("总数:",total,",总页数:",total_page)#翻页获取数据all_list = []all_list.append(["品牌ID", "品牌", "封面图", "车名", "官方指导价", "款式数量", "评分"])for page in range(1,total_page):print("当前页数:",page)data_list = self.get_data(page=page)out_date = self.data_deal(data_list=data_list)print("*"*100)print(out_date)all_list += out_dateself.data_to_csv(data_li=all_list)if __name__ == '__main__':ddc = Dongchedi_class()ddc.run()

六、总结

Python爬虫主要分三步:

  1. 请求接口
  2. 数据解析
  3. 数据存储

版权声明

本文章版权归作者所有,未经作者允许禁止任何转载、采集,作者保留一切追究的权利。

这篇关于Python爬虫:如何下载懂车帝的电动车数据(完整代码)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/178175

相关文章

MyBatis-Plus通用中等、大量数据分批查询和处理方法

《MyBatis-Plus通用中等、大量数据分批查询和处理方法》文章介绍MyBatis-Plus分页查询处理,通过函数式接口与Lambda表达式实现通用逻辑,方法抽象但功能强大,建议扩展分批处理及流式... 目录函数式接口获取分页数据接口数据处理接口通用逻辑工具类使用方法简单查询自定义查询方法总结函数式接口

SQL server数据库如何下载和安装

《SQLserver数据库如何下载和安装》本文指导如何下载安装SQLServer2022评估版及SSMS工具,涵盖安装配置、连接字符串设置、C#连接数据库方法和安全注意事项,如混合验证、参数化查... 目录第一步:打开官网下载对应文件第二步:程序安装配置第三部:安装工具SQL Server Manageme

使用Python删除Excel中的行列和单元格示例详解

《使用Python删除Excel中的行列和单元格示例详解》在处理Excel数据时,删除不需要的行、列或单元格是一项常见且必要的操作,本文将使用Python脚本实现对Excel表格的高效自动化处理,感兴... 目录开发环境准备使用 python 删除 Excphpel 表格中的行删除特定行删除空白行删除含指定

Python通用唯一标识符模块uuid使用案例详解

《Python通用唯一标识符模块uuid使用案例详解》Pythonuuid模块用于生成128位全局唯一标识符,支持UUID1-5版本,适用于分布式系统、数据库主键等场景,需注意隐私、碰撞概率及存储优... 目录简介核心功能1. UUID版本2. UUID属性3. 命名空间使用场景1. 生成唯一标识符2. 数

创建Java keystore文件的完整指南及详细步骤

《创建Javakeystore文件的完整指南及详细步骤》本文详解Java中keystore的创建与配置,涵盖私钥管理、自签名与CA证书生成、SSL/TLS应用,强调安全存储及验证机制,确保通信加密和... 目录1. 秘密键(私钥)的理解与管理私钥的定义与重要性私钥的管理策略私钥的生成与存储2. 证书的创建与

Python办公自动化实战之打造智能邮件发送工具

《Python办公自动化实战之打造智能邮件发送工具》在数字化办公场景中,邮件自动化是提升工作效率的关键技能,本文将演示如何使用Python的smtplib和email库构建一个支持图文混排,多附件,多... 目录前言一、基础配置:搭建邮件发送框架1.1 邮箱服务准备1.2 核心库导入1.3 基础发送函数二、

Python包管理工具pip的升级指南

《Python包管理工具pip的升级指南》本文全面探讨Python包管理工具pip的升级策略,从基础升级方法到高级技巧,涵盖不同操作系统环境下的最佳实践,我们将深入分析pip的工作原理,介绍多种升级方... 目录1. 背景介绍1.1 目的和范围1.2 预期读者1.3 文档结构概述1.4 术语表1.4.1 核

SQL中如何添加数据(常见方法及示例)

《SQL中如何添加数据(常见方法及示例)》SQL全称为StructuredQueryLanguage,是一种用于管理关系数据库的标准编程语言,下面给大家介绍SQL中如何添加数据,感兴趣的朋友一起看看吧... 目录在mysql中,有多种方法可以添加数据。以下是一些常见的方法及其示例。1. 使用INSERT I

基于Python实现一个图片拆分工具

《基于Python实现一个图片拆分工具》这篇文章主要为大家详细介绍了如何基于Python实现一个图片拆分工具,可以根据需要的行数和列数进行拆分,感兴趣的小伙伴可以跟随小编一起学习一下... 简单介绍先自己选择输入的图片,默认是输出到项目文件夹中,可以自己选择其他的文件夹,选择需要拆分的行数和列数,可以通过

Python中反转字符串的常见方法小结

《Python中反转字符串的常见方法小结》在Python中,字符串对象没有内置的反转方法,然而,在实际开发中,我们经常会遇到需要反转字符串的场景,比如处理回文字符串、文本加密等,因此,掌握如何在Pyt... 目录python中反转字符串的方法技术背景实现步骤1. 使用切片2. 使用 reversed() 函