【Python】python3 正则爬取网页输出中文乱码解决

本文转载自查看原文 2017-12-03 19:23 1957 Python

爬取网页时候print输出的时候有中文输出乱码

例如：

\\xe4\\xb8\\xad\\xe5\\x8d\\x8e\\xe4\\xb9\\xa6\\xe5\\xb1\\x80

#爬取https://read.douban.com/provider/all出版社
pattern='<div class="name">(.*?)</div>'
import urllib.request
data = urllib.request.urlopen("https://read.douban.com/provider/all").read()
result = re.compile(pattern).findall(str(data))

print(result)

百度了使用encode 和decode 使用codecs都不好使。

应该在爬取网页read()的时候就修改编码格式

#爬取https://read.douban.com/provider/all出版社
pattern='<div class="name">(.*?)</div>'
import urllib.request
data = urllib.request.urlopen("https://read.douban.com/provider/all").read().decode("UTF-8")
result = re.compile(pattern).findall(str(data))
print(result)

还有一些中文乱码的处理在这儿可能详细点儿，也是这给我启发让我搞定这个乱码。https://www.cnblogs.com/lmei/p/5333644.html

----------------------------------------------------------分割线-----------------------------------------------

直接 data = urllib.request.urlopen(url).read().decode("utf-8","ignore")

免责声明！

本站转载的文章为个人学习借鉴使用，本站对版权不负任何法律责任。如果侵犯了您的隐私权益，请联系本站邮箱yoyou2525@163.com删除。

猜您在找 解决python3爬取网页（GB2312编码）中文乱码问题 python3：爬取的内容包含中文，输出后乱码的问题 python3 输出中文、日文等等乱码问题的解决办法 python爬取html中文乱码 python用beautifulsoup爬取网页时出现乱码的解决方法 python3爬取网页图片路径并写入文件 python3爬取网页中的邮箱地址 Python3批量爬取网页图片 python爬虫学习（四）：爬取网页图片-正则解析数据 Python爬取中文页面的时候出现的乱码问题