Xpath语法

Xpath语法

2026年9月19日·#编程学习/python学习笔记Python/爬虫·638 字 3 分钟
浏览量加载中...
AI 摘要

Xpath 常用表达式速查:路径、序号、last()、属性过滤、通配符与 text(),配合 lxml 使用

Xpath 是什么#

Xpath:一种在 HTML/XML 文档中导航或定位元素的查询语言,让你能够准确地定位文档中的特定元素、属性或文本。

下面这份简化 HTML 是本篇所有表达式的练兵场:

<html>
<head><title>仙逆人物志 - 修真世界</title></head>
<body>
<div>
<h1>Python</h1>
<p>一门简介、快速、易用的编程语言。</p>
<p>人生苦短,我用Python。</p>
<p color="red">AI大模型开发、AI智能应用开发。</p>
<a href="https://www.itcast.cn">黑马程序员</a>
</div>
</body>
</html>

常用表达式速查表#

表达式描述样例
/从根节点的直接子元素/html/body/div/h1
//从任意位置选择节点//h1
.当前节点下查找./a.//a
[n]选择第 n 个元素//p[2]
[last()]选择最后一个元素//p[last()]
[@attr]选择该属性的元素//p[@color]
[@attr='value']选择该属性值等于指定值的元素//p[@color='red']
*匹配任何元素节点//body/div/*
@*匹配元素的任何属性//body/div/a/@*
text()获取文本内容//div/p/text()
267

配合 lxml 使用#

from lxml import html
with open("resources/仙逆人物志.html", "r", encoding="utf-8") as f:
html_text = f.read()
document = html.fromstring(html_text)
th_list = document.xpath("//thead/tr/th/text()") # // : 任意位置开始
print(th_list)
td_list = document.xpath("//tbody/tr[2]/td/text()") # [2] : 第 2 个 tr
print(td_list)
td_list = document.xpath("//tbody/tr[last()-1]/td/text()") # last()-1 : 倒数第 2 个
print(td_list)
p_list = document.xpath("//p[@class]/text()") # 有 class 属性的 p
print(p_list)
p_list = document.xpath("//p[@class='xn']/text()") # class 恰好等于 xn 的 p
print(p_list)
th_list = document.xpath("//thead/tr/*/text()") # * : 任意标签
print(th_list)
a_list = document.xpath("//td/img/@*") # @* : 任意属性(如 src)
print(a_list)
Tip

属性值的写法是去掉 text()、直接写属性名://td/img/@src(取图片地址),//div/a/@href(取链接地址)。

相关#

练习题#

一、回忆填空(写完再展开对答案)#

  1. 从根节点的直接子元素开始找,用 ____;从任意位置选择节点,用 ____
  2. 在当前节点下查找,用 ____;选择第 n 个元素用 ____;选最后一个用 ____
  3. 选择 class 属性的元素://p[____];class 值等于 xn 的://p[____]
  4. 匹配任何元素节点的通配符是 ____;匹配任何属性的是 ____
  5. 取元素的文本内容用 ____;取元素的 href 属性用 ____
  6. //tbody/tr[last()-1] 里的 last()-1 表示 ____
填空答案(做完再点开)
  1. /// 2. .[n][last()] 3. @class@class='xn' 4. *@* 5. text()@href 6. 倒数第二个

二、裸写题#

对着 resources/仙逆人物 志.html(或本篇开头的简化 HTML)写出 Xpath 表达式:

  • 2-1<h1> 的文本
  • 2-2 取链接 <a> 的 href 属性值
  • 2-3 取”有 target 属性且值为 _blank”的 <a> 的文本
  • 2-4 取第二个 <div> 里最后一个 <p> 的文本
参考答案(做完再点开)
2-1 //h1/text() (或 /html/body/div/h1/text())
2-2 //a/@href
2-3 //a[@target='_blank']/text()
2-4 //div[2]/p[last()]/text()

评论区

[ 标签 ]
# AI37# AI 编程2# AI工具1# Ajax2# Apifox1# AstrBot3# Astro2# CC Switch1# CDN2# Claude Code1# claudecode2# ClaudeCode1# Cloudflare2# CloudFlare2# CloudFlare-ImgBed3# coc3# CSS6# DeepSeek6# deepseek2# DELETE1# Docker1# EdgeOne3# Gist1# git1# GitHub1# hexo-circle-of-friends1# HTML6# HTTP5# ImageManager1# Java23# java13# JavaScript5# JDBC3# JSON2# JUnit1# LangChain25# Logback1# Maven6# Muse Spark1# Mybatis1# MyBatis4# MySQL28# MySql1# NapCat1# Node.js1# obsidian2# Obsidian5# OpenCode4# ORM1# PathVariable1# PicGo1# PyCharm1# Python65# RequestBody1# RequestMapping1# RESTful风格1# skills1# Slf4j1# SpringBoot11# SQL2# Streamlit5# Svelte2# TailwindCSS1# Telegram3# Tlias2# Vercel1# vscode2# Vue7# Waline3# WebDAV1# Web基础6# Web开发6# WinSCP1# YAML1# 三层架构1# 中二宣言1# 书籍1# 使用文档10# 写作1# 函数2# 刷步数1# 前端32# 动态1# 动漫1# 包1# 单词2# 博客7# 博客工作流1# 博客开发2# 参数接收1# 友链1# 反思2# 图床6# 地图1# 备份2# 大模型1# 奇思妙想1# 存储1# 学习方法6# 学校1# 宝塔面板3# 宝宝10# 对象1# 导航栏1# 工具2# 开发1# 开发工具1# 开发规范1# 开心1# 异常处理1# 影视2# 微信1# 性能优化2# 总结1# 想法15# 感受1# 感悟11# 指南1# 提示词工程1# 插件5# 故障排除1# 效率工具2# 教程10# 数据分析9# 数据库27# 数据结构1# 文件操作2# 斩神1# 日常92# 日志框架1# 朋友圈1# 朱元璋1# 模块1# 模板1# 正则表达式2# 测试1# 游戏2# 爬虫7# 生活迁移1# 电影2# 电脑1# 碎碎念1# 视觉识别1# 类1# 类型注解1# 网络基础2# 网络教室1# 羊毛2# 脚本2# 脚本工具1# 自动化2# 蓝奏云1# 订阅推荐2# 记录2# 评论系统1# 词根1# 词缀1# 说说1# 足迹1# 跑步2# 路径参数1# 转载2# 运动1# 部落冲突1# 配置1# 随机图1# 面向对象5# 音乐3# 音标1# 饮食1# 驼峰命名1# 高德地图1
[ 公告 ]

如果你喜欢,那么欢迎来到我的世界!

了解更多
[ 音乐 ]
封面

音乐

暂未播放

0:000:00
暂无歌词
找不到相关结果。
[ contents ]
[ 全部文章 ]