python 提取整个 HTML 节点

本文转载自查看原文 2019-07-09 20:25 1110 python/ unescape/ lxml/ 中文乱码/ html/ Python

有的时候，需要把整个 HTML 节点原封不动地取下来，也就是包括节点标签、节点内容，甚至也包括内容中的空格、各种特殊符号等等。

假设已获取到页面源码，并将其保存在变量 src 中。则可有代码如下：


from html import unescape
from lxml import etree
from lxml import html


# 先加载页面源码，便于后续使用 XPath 解析
root = etree.HTML(src)

# 根据 XPath 路径提取节点
script = root.xpath('//script')[-1]

# 关键的一步：把整个节点转为字符串
raw_tab = html.tostring(script)

# 此时 print(raw_tab) 会遇到中文乱码（其实不是乱码，是另一种编码显示了）的情况，需要使用 unescape
json_str = json.loads(raw_tab)
print(unescape(json_str['$meta']['cityName']))

# 如果本身不是 json 字符串，则因为 unescape 函数接收的是 bytes-like 对象，所以需要先 decode
print(unescape(raw_tab.decode()))

免责声明！

本站转载的文章为个人学习借鉴使用，本站对版权不负任何法律责任。如果侵犯了您的隐私权益，请联系本站邮箱yoyou2525@163.com删除。

猜您在找 Python Xpath 提取html整个元素（标签与内容） python 正则提取HTml标签文本内容的 Python中BeautifulSoup中对HTML标签的提取用WKWebView 截取整个Html页面 HTML DIV充满整个屏幕 python(初学提取html页面元素，借用老师) 从html中提取纯文本 html 提取公用部分从html中提取纯文本 JS获取整个网页html代码