Python爬虫从入门到精通:(6)数据解析2_使用bs4(BeautifulSoup)_Python涛哥

本文主要是介绍Python爬虫从入门到精通:(6)数据解析2_使用bs4(BeautifulSoup)_Python涛哥,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

使用bs4BeautifulSoup

  • 数据解析的作用?

    • 用来实现聚焦爬虫
  • 网页中显示的数据都是存储在那里的?

    • 都是存储在html的标签中或者是标签的属性中
  • 数据解析的通用原理是什么?

    • 指定标签的定位
    • 取出标签中存储的数据或者标签属性中的数据
  • bs4解析原理

    • 实例化一个BeautifulSoup对象,且待解析的页面源码数据加载到该对象中
    • 调用BeautifulSoup对象中相关方法或者属性进行标签定位和文本数据的提取
  • 环境的安装

    pip install lxml #解析器
    pip install bs4
    
  • BeautifulSoup对象的实例化:

    • BeautifulSoup(file,'lxml') 用来将本地存储的html文档中的数据进行解析
    • BeautifulSoup(page_text,'lxml') 用来将互联网上请求的页面源码数据进行解析

我们来看这段test.html源码:

<html lang="en">
<head><meta charset="UTF-8"><title>测试bs4</title>
</head>
<body>
<div><p>百里守约</p>
</div>
<div class="song"><p>李清照</p><p>王安石</p><p>苏轼</p><p>柳宗元</p><a href="http://www.song.com/" title="赵匡胤" target="_self"><span>this is span</span>宋朝是最强大的王朝,不是军队的强大,而是经济很强大,国民都很有钱</a><a href="" class="du">总为浮云能蔽日,长安不见使人愁</a><img src="http://www.baidu.com/meinv.jpg" alt=""/>
</div>
<div class="tang"><ul><li><a href="http://www.baidu.com" title="qing">清明时节雨纷纷,路上行人欲断魂,借问酒家何处有,牧童遥指杏花村</a></li><li><a href="http://www.163.com" title="qin">秦时明月汉时关,万里长征人未还,但使龙城飞将在,不教胡马度阴山</a></li><li><a href="" alt="qi">岐王宅里寻常见,崔九堂前几度闻,正是江南好风景,落花时节又逢君</a></li><li><a href="" class="du">杜甫</a></li><li><a href="" class="du">杜牧</a></li><li><b>杜小月</b></li><li><i>度蜜月</i></li><li><a href="http://www.haha.com" id="feng">凤凰台上凤凰游,凤去台空江自流,吴宫花草埋幽径,晋代衣冠成古丘</a></li></ul></div>

bs4的使用

from bs4 import BeautifulSoup
file = open('./test.html', 'r', encoding='utf-8')
soup = BeautifulSoup(file, 'lxml')
soup  # 打印出完整页面源码
  • 标签定位:

    • soup.tagName:只可以定位到第一次出现的tagName标签

      soup.p  # <p>百里守约</p>
      
  • 属性定位

    • soup.find('tagName',attrName=value):定位到第一次出现的tagName标签

      举例:

      soup.find('div', class_='song')  # 注意class 后面有 _
      

      打印结果:

      <div class="song">
      <p>李清照</p>
      <p>王安石</p>
      <p>苏轼</p>
      <p>柳宗元</p>
      <a href="http://www.song.com/" target="_self" title="赵匡胤">
      <span>this is span</span>宋朝是最强大的王朝,不是军队的强大,而是经济很强大,国民都很有钱</a>
      <a class="du" href="">总为浮云能蔽日,长安不见使人愁</a>
      <img alt="" src="http://www.baidu.com/meinv.jpg"/>
      </div>
      http://www.song.com/
      

      soup.find('a', id='feng')
      

      打印结果:

      <a href="http://www.haha.com" id="feng">凤凰台上凤凰游,凤去台空江自流,吴宫花草埋幽径,晋代衣冠成古丘</a>
      

      # soup.findAll:跟find一样作属性定位,只不过findAll返回的是列表,定位到所有满足条件的标签
      soup.findAll('a', id='feng')
      

      打印结果:

      [<a href="http://www.haha.com" id="feng">凤凰台上凤凰游,凤去台空江自流,吴宫花草埋幽径,晋代衣冠成古丘</a>]
      

  • 选择器定位:soup.select(‘选择器’)

    • 类选择器

    • id选择器

    • 层级选择器

      • >大于号 表示一个层级

        soup.select('.tang > ul > li')
        
      • 空格表示隔多个层级

        soup.select('.tang li')
        

      其结果都是:

      [
      <li><a href="http://www.baidu.com" title="qing">清明时节雨纷纷,路上行人欲断魂,借问酒家何处有,牧童遥指杏花村</a></li>
      <li><a href="http://www.163.com" title="qin">秦时明月汉时关,万里长征人未还,但使龙城飞将在,不教胡马度阴山</a></li>
      <li><a alt="qi" href="">岐王宅里寻常见,崔九堂前几度闻,正是江南好风景,落花时节又逢君</a></li>
      <li><a class="du" href="">杜甫</a></li>
      <li><a class="du" href="">杜牧</a></li>
      <li><b>杜小月</b></li>
      <li><i>度蜜月</i></li>
      <li><a href="http://www.haha.com" id="feng">凤凰台上凤凰游,凤去台空江自流,吴宫花草埋幽径,晋代衣冠成古丘</a></li>
      ]
      

  • 取数据

    • .text:返回的是该标签下所有的文本内容

    • .string:返回的是该标签直系的文本内容

    a_tag = soup.find('a', id='feng')
    # <a href="http://www.haha.com" id="feng">凤凰台上凤凰游,凤去台空江自流,吴宫花草埋幽径,晋代衣冠成古丘</a>
    a_tag.text
    a_tag.string
    

    打印结果:

    凤凰台上凤凰游,凤去台空江自流,吴宫花草埋幽径,晋代衣冠成古丘
    

    # 另一个例子
    a_tag=soup.find('div',class_='song')
    a_tag.strings
    '''<generator object Tag._all_strings at 0x00000200F390BAC0>''' # 不同的编译器显示不同a_tag.text
    '''
    李清照
    王安石
    苏轼
    柳宗元this is span宋朝是最强大的王朝,不是军队的强大,而是经济很强大,国民都很有钱
    总为浮云能蔽日,长安不见使人愁
    '''
    

  • 取属性

    • a_tag['attrName']

    • a_tag.a['attrName']

      a_tag['class']
      # 打印结果 ['song']a_tag.a['href']
      # 打印结果 http://www.song.com/
      

这篇关于Python爬虫从入门到精通:(6)数据解析2_使用bs4(BeautifulSoup)_Python涛哥的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/817408

相关文章

Python函数作用域示例详解

《Python函数作用域示例详解》本文介绍了Python中的LEGB作用域规则,详细解析了变量查找的四个层级,通过具体代码示例,展示了各层级的变量访问规则和特性,对python函数作用域相关知识感兴趣... 目录一、LEGB 规则二、作用域实例2.1 局部作用域(Local)2.2 闭包作用域(Enclos

Linux中压缩、网络传输与系统监控工具的使用完整指南

《Linux中压缩、网络传输与系统监控工具的使用完整指南》在Linux系统管理中,压缩与传输工具是数据备份和远程协作的桥梁,而系统监控工具则是保障服务器稳定运行的眼睛,下面小编就来和大家详细介绍一下它... 目录引言一、压缩与解压:数据存储与传输的优化核心1. zip/unzip:通用压缩格式的便捷操作2.

Python实现对阿里云OSS对象存储的操作详解

《Python实现对阿里云OSS对象存储的操作详解》这篇文章主要为大家详细介绍了Python实现对阿里云OSS对象存储的操作相关知识,包括连接,上传,下载,列举等功能,感兴趣的小伙伴可以了解下... 目录一、直接使用代码二、详细使用1. 环境准备2. 初始化配置3. bucket配置创建4. 文件上传到os

深度解析Java DTO(最新推荐)

《深度解析JavaDTO(最新推荐)》DTO(DataTransferObject)是一种用于在不同层(如Controller层、Service层)之间传输数据的对象设计模式,其核心目的是封装数据,... 目录一、什么是DTO?DTO的核心特点:二、为什么需要DTO?(对比Entity)三、实际应用场景解析

深度解析Java项目中包和包之间的联系

《深度解析Java项目中包和包之间的联系》文章浏览阅读850次,点赞13次,收藏8次。本文详细介绍了Java分层架构中的几个关键包:DTO、Controller、Service和Mapper。_jav... 目录前言一、各大包1.DTO1.1、DTO的核心用途1.2. DTO与实体类(Entity)的区别1

Java中的雪花算法Snowflake解析与实践技巧

《Java中的雪花算法Snowflake解析与实践技巧》本文解析了雪花算法的原理、Java实现及生产实践,涵盖ID结构、位运算技巧、时钟回拨处理、WorkerId分配等关键点,并探讨了百度UidGen... 目录一、雪花算法核心原理1.1 算法起源1.2 ID结构详解1.3 核心特性二、Java实现解析2.

使用Python实现可恢复式多线程下载器

《使用Python实现可恢复式多线程下载器》在数字时代,大文件下载已成为日常操作,本文将手把手教你用Python打造专业级下载器,实现断点续传,多线程加速,速度限制等功能,感兴趣的小伙伴可以了解下... 目录一、智能续传:从崩溃边缘抢救进度二、多线程加速:榨干网络带宽三、速度控制:做网络的好邻居四、终端交互

Python中注释使用方法举例详解

《Python中注释使用方法举例详解》在Python编程语言中注释是必不可少的一部分,它有助于提高代码的可读性和维护性,:本文主要介绍Python中注释使用方法的相关资料,需要的朋友可以参考下... 目录一、前言二、什么是注释?示例:三、单行注释语法:以 China编程# 开头,后面的内容为注释内容示例:示例:四

Python中win32包的安装及常见用途介绍

《Python中win32包的安装及常见用途介绍》在Windows环境下,PythonWin32模块通常随Python安装包一起安装,:本文主要介绍Python中win32包的安装及常见用途的相关... 目录前言主要组件安装方法常见用途1. 操作Windows注册表2. 操作Windows服务3. 窗口操作

Python中re模块结合正则表达式的实际应用案例

《Python中re模块结合正则表达式的实际应用案例》Python中的re模块是用于处理正则表达式的强大工具,正则表达式是一种用来匹配字符串的模式,它可以在文本中搜索和匹配特定的字符串模式,这篇文章主... 目录前言re模块常用函数一、查看文本中是否包含 A 或 B 字符串二、替换多个关键词为统一格式三、提