Python爬虫基础之XPath语法与lxml库的用法详解
作者:qq52o 发布时间:2022-07-03 20:56:06
前言
本来打算写的标题是XPath语法,但是想了一下Python中的解析库lxml,使用的是Xpath语法,同样也是效率比较高的解析方法,所以就写成了XPath语法和lxml库的用法
XPath 即为 XML 路径语言,它是一种用来确定 XML(标准通用标记语言的子集)文档中某部分位置的语言。
XPath 基于 XML 的树状结构,提供在数据结构树中找寻节点的能力。 XPath 同样也支持HTML。
XPath 是一门小型的查询语言。
python 中 lxml库 使用的是 Xpath 语法,是效率比较高的解析方法。
下面话不多说了,来一起看看详细的介绍吧
安装
为什么要用这个库呢,因为要写爬虫啊,利用lxml库来解析 HTML 代码,同时lxml也继承了libxml2的特性自动修正HTML代码,利用pip安装即可
pip install lxml
XPath语法
XPath是一门在XML文档中查找信息的语言,可以用于在XML文档中通过元素和属性进行导航
举个栗子 😎
我们可以使用XPath提取网站地图中的所有链接,也就是说可以使用XPath去找我们HTML中的一些具体的东西
节点关系
在XPath中,有七种类型的节点:元素、属性、文本、命名空间、处理指令、注释以及文档节点(或称为根节点)
再举个栗子 😎
<urlset>
<url>
<loc>https://qq52o.me</loc>
<lastmod>2018-04-28T19:00:42+00:00</lastmod>
<changefreq>daily</changefreq>
<priority>1.0</priority>
</url>
</urlset>
第一个:父(Parent)
每个元素以及属性都有一个父
url元素是 loc、lastmod、changefreq以及 priority元素的父
第二个:子(Children)
元素节点可有零个、一个或多个子
loc、lastmod、changefreq以及 priority元素都是url元素的子
第三个:同胞(Sibling)
拥有相同的父的节点
loc、lastmod、changefreq以及 priority元素都是url元素的同胞
第四个:先辈(Ancestor)
某节点的父、父的父,等等
loc元素的先辈是 url元素和 urlset元素
第五个:后代(Descendant)
某个节点的子,子的子,等等
urlset的后代是url、loc、lastmod、changefreq以及 priority元素
如果你分不清楚,就按照子元素从上到下的去找元素节点
选取节点
XPath使用路径表达式在 XML 文档中选取节点,节点是通过沿着路径或者 step 来选取的,也就是上面所说的按照子元素从上到下去找元素节点
这些是最有用的路径表达式 💡
表达式 | 描述 |
---|---|
nodename | 选取此节点的所有子节点 |
/ | 从根节点选取 |
// | 从匹配选择的当前节点选择文档中的节点,而不考虑它们的位置 |
. | 选取当前节点 |
.. | 选取当前节点的父节点 |
@ | 选取属性 |
实例
路径表达式 | 结果 |
---|---|
urlset | 选取urlset元素的所有子节点 |
/urlset | 选取根元素 urlset |
urlset/url | 选取属于urlset的子元素的所有url元素 |
//url | 选取所有url子元素,而不管它们在文档中的位置 |
urlset//url | 选择属于urlset元素的后代的所有url元素,而不管它们位于urlset之下的什么位置 |
//@href | 选取名为href的所有属性 |
其他XPath语法请参考w3school
XPath实例测试
提取本站网站地图中id属性为content的的子元素h3的内容以及子元素a的href属性,F12去看代码找这个属性
div的id属性,下面的子元素h3的内容,直接利用 text 方法来获取元素的内容,然后输出
这里的子元素层级关系必须按顺序写好,不然会报错的
IndexError: list index out of range
这就说明你的XPath规则没写好,list是一个空的,没有一个元素
XPath 是一个非常好用的解析方法,同时也是作为爬虫学习的基础
来源:https://qq52o.me/2203.html


猜你喜欢
- 本章节将为大家介绍Python循环语句的使用。Python中的循环语句有 for 和 while。Python循环语句的控制结构图如下所示:
- 在Python中,split() 方法可以实现将一个字符串按照指定的分隔符切分成多个子串,这些子串会被保存到列表中(不包含分隔符),作为方法
- 在服务端程序开发的过程中,cookie经常被用于验证用户登录。golang 的 net/http 包中自带 http cookie的定义,下
- 打开VS2013 —> 工具 —> 选项 —> 环境 —> 字体和颜色 —> 纯文本(显示项中) —>
- 前言本文主要介绍的是Python WSGI相关内容,主要来自以下网址:What is WSGI?WSGI TutorialAn Introd
- 很多文章都有提到关于使用phpExcel实现Excel数据的导入导出,大部分文章都差不多,或者就是转载的,都会出现一些问题,下面是本人研究p
- 我们可以使用matplotlib.pyplot.locator_params()来控制刻度线 * 的行为。 即使通常会自动确定标记点的位置,
- 很早之前就在PJ的blog上看到可以用VS2005调试ASP程序,但是没有写出具体的步骤,后来一次偶尔也让我找到了方法,但是一直没把它写出来
- 前言模块在其自身的作用域里执行,而不是在全局作用域里;这意味着定义在一个模块里的变量,函数,类等等在模块外部是不可见的,除非你明确地使用ex
- 这篇文章主要介绍了python next()和iter()函数原理解析,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学
- 1. 用 Numpy ndarray 作为数据传入 plyimport numpy as npimport matplotlib as mp
- 一、开发接口的作用1、mock接口:模拟一些接口。有一些有关联的接口,在别的接口没有开发好的时候,需要用这个接口,就可以写一个假接口,返回想
- 工具与图书馆Python-3.xCV2-4.5.2矮胖-1.20.3人脸识别-1.3.0若要安装上述软件包,请使用以下命令。pip inst
- Python是一种计算机程序设计语言。是一种面向对象的动态类型语言,最初被设计用于编写自动化脚本(shell),随着版本的不断更新和语言新功
- 1.列表list是处理一组有序项目的数据结构,即你可以在一个列表中存储一个序列的项目。列表中的项目。列表中的项目应该包括在方括号中,这样py
- 大家好~ 老Amy来啦!已经n久没有给大家输出关于办公自动化的文章了…为什么呢?罗列原因:太忙!(被领导“压榨”)太忙!(没有额外的精力揣测
- 要自己写一个存储系统,可以依照以下步骤:1.写一个继承自django.core.files.storage.Storage的子类。from
- 缘起最近实验课上需要重构以前写过的一个项目(垃圾堆),需要添加发生邮件提醒的功能,记得以前写过一个PHP版的实现,所以想把PHP写的功能整理
- 二元函数为y=x1^2+x2^2,x∈[-5,5]NIND=121; %初始种群的个数(Number of individual
- 很多网站现在都有使用QQ作为在线客服工具,我们点击它可以很方便的和网站人员联系,本站为你整理了在网站上使用QQ在线客服的代码,共13种风格,