python爬虫学习（六）：xpath解析

2022/3/20 20:34:38

编程Tag： 对象源码文本爬虫 text python XPath etree

本文主要是介绍python爬虫学习（六）：xpath解析，对大家解决编程问题具有一定的参考价值，需要的程序猿们随着小编来一起学习吧！

xpath解析原理：
- 1.实例化一个etree的对象，且需要将被解析的页面源码数据加载到该对象中。
- 2.调用etree对象中的xpath方法结合着xpath表达式实现标签的定位和内容的捕获。
- 环境的安装：
  - pip install lxml
- 如何实例化一个etree对象:from lxml import etree
  - 1.将本地的html文档中的源码数据加载到etree对象中：
    etree.parse(filePath)
  - 2.可以将从互联网上获取的源码数据加载到该对象中
    etree.HTML('page_text')
  - xpath('xpath表达式')
- xpath表达式:
  - /:表示的是从根节点开始定位。表示的是一个层级。
  - //:表示的是多个层级。可以表示从任意位置开始定位。
  - 属性定位：//div[@class='song'] tag[@attrName="attrValue"]
  - 索引定位：//div[@class="song"]/p[3] 索引是从1开始的。
  - 取文本：
    - /text() 获取的是标签中直系的文本内容
    - //text() 标签中非直系的文本内容（所有的文本内容）
  - 取属性：
    /@attrName ==>img/src

这篇关于python爬虫学习（六）：xpath解析的文章就介绍到这儿，希望我们推荐的文章对大家有所帮助，也希望大家多多支持为之网！

相关编程文章

更多>

2024-11-21Python编程基础教程
2024-11-20Python编程基础与实践
2024-11-20Python编程基础与高级应用
2024-11-19Python 基础编程教程
2024-11-19Python基础入门教程
2024-11-17在FastAPI项目中添加一个生产级别的数据库——本地环境搭建指南
2024-11-16`PyMuPDF4LLM`：提取PDF数据的神器
2024-11-16四种数据科学Web界面框架快速对比：Rio、Reflex、Streamlit和Plotly Dash
2024-11-14获取参数学习：Python编程入门教程
2024-11-14Python编程基础入门