安裝
pip install requests-html
使用
官方文檔:https://pypi.org/project/requests-html/
獲取網頁
requests-html和其他解析HTML庫最大的不同點在於HTML解析庫一般都是專用的,所以我們需要用另一個HTTP庫先把網頁下載下來,然后傳給那些HTML解析庫。而requests-html既可以下載網頁,又能解析網頁。
返回的對象r是requests.Reponse類型,更確切的說是繼承自前者的requests_html.HTMLResponse類型。這里其實和requests庫的使用方法差不多,獲取到的響應對象其實其實也沒啥用,這里的關鍵就在於r.html這個屬性,它會返回requests_html.HTML這個類型,它是整個requests_html庫中最核心的一個類,負責對HTML進行解析。
from requests_html import HTMLSession session = HTMLSession() url = "https://www.jianshu.com/u/18d731821bfc" r = session.get(url=url) print(r.html.html)
得到網頁中的所有鏈接:
# 相對路徑 print(r.html.links) # 絕對路徑 print(r.html.absolute_links)
獲取元素
request-html支持CSS選擇器和XPATH兩種語法來選取HTML元素。首先先來看看CSS選擇器語法,它需要使用HTML的find函數,該函數有5個參數,作用如下:
- selector,要用的CSS選擇器;
- clean,布爾值,如果為真會忽略HTML中style和script標簽造成的影響(原文是sanitize,大概這么理解);
- containing,如果設置該屬性,會返回包含該屬性文本的標簽;
- first,布爾值,如果為真會返回第一個元素,否則會返回滿足條件的元素列表;
- _encoding,編碼格式。
下面是幾個簡單例子:
# 首頁菜單文本 print(r.html.find('div#menu', first=True).text) # 首頁菜單元素 print(r.html.find('div#menu a'))
文本內容
e = r.html.find("div.title", first=True) print(e.text)
要獲取元素的attribute,用attr屬性
print(e.attrs)
獲取元素的html代碼
print(e.html)
文本搜索,用search函數
print(e.search('還是{}沒頭腦')[0])
然后是XPATH語法,這需要另一個函數xpath的支持,它有4個參數如下:
- selector,要用的XPATH選擇器;
- clean,布爾值,如果為真會忽略HTML中style和script標簽造成的影響(原文是sanitize,大概這么理解);
- first,布爾值,如果為真會返回第一個元素,否則會返回滿足條件的元素列表;
- _encoding,編碼格式。
還是上面的例子,不過這次使用XPATH語法:
print(r.html.xpath("//div[@id='menu']", first=True).text) print(r.html.xpath("//div[@id='menu']//a"))
JavaScript支持
有些網站是使用JavaScript渲染的,這樣的網站爬取到的結果只有一堆JS代碼,這樣的網站requests-html也可以處理,關鍵一步就是在HTML結果上調用一下render函數,它會在用戶目錄(默認是~/.pyppeteer/)中下載一個chromium,然后用它來執行JS代碼。
下載過程只在第一次執行,以后就可以直接使用chromium來執行了。
r.html.render()
render函數還有一些參數,順便介紹一下(這些參數有的還有默認值,直接看源代碼方法參數列表即可):
- retries: 加載頁面失敗的次數
- script: 頁面上需要執行的JS腳本(可選)
- wait: 加載頁面錢的等待時間(秒),防止超時(可選)
- scrolldown: 頁面向下滾動的次數
- sleep: 在頁面初次渲染之后的等待時間
- reload: 如果為假,那么頁面不會從瀏覽器中加載,而是從內存中加載
- keep_page: 如果為真,允許你用r.html.page訪問頁面
比如說簡書的用戶頁面上用戶的文章列表就是一個異步加載的例子,初始只顯示最近幾篇文章,如果想爬取所有文章,就需要使用scrolldown配合sleep參數模擬下滑頁面,促使JS代碼加載所有文章。
自定義請求
自定義用戶代理
有些網站會使用UA來識別客戶端類型,有時候需要偽造UA來實現某些操作。可以防止封ip。
from pprint import pprint # 提供了可以按照某個格式正確的顯示python已知類型數據的一種方法 import json pp_r = session.get('http://httpbin.org/get') pprint(json.loads(pp_r.html.html))
返回的結果如下:
{'args': {}, 'headers': {'Accept': '*/*', 'Accept-Encoding': 'gzip, deflate', 'Host': 'httpbin.org', 'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_6) ' 'AppleWebKit/603.3.8 (KHTML, like Gecko) ' 'Version/10.1.2 Safari/603.3.8'}, 'origin': '150.95.184.46, 150.95.184.46', 'url': 'https://httpbin.org/get'}
這里的UA是requests-html自帶的UA,下面換一個UA:
ua = 'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:62.0) Gecko/20100101 Firefox/62.0' ppp_r = session.get('http://httpbin.org/get',headers={'user-agent': ua}) pprint(json.loads(ppp_r.html.html))
看到UA確實發生了變化:
{'args': {}, 'headers': {'Accept': '*/*', 'Accept-Encoding': 'gzip, deflate', 'Host': 'httpbin.org', 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:62.0) ' 'Gecko/20100101 Firefox/62.0'}, 'origin': '150.95.184.46, 150.95.184.46', 'url': 'https://httpbin.org/get'}
模擬表單登陸
post請求
r = session.post('http://httpbin.org/post', data={'username': 'python', 'passwd': 123456}) pprint(json.loads(r.html.html))
實例:爬自己博客園所有文章標題
from requests_html import HTMLSession base_url = 'https://www.cnblogs.com/lfri/default.html?page=' id = 0 def get_title(url): global id #在函數內部修改全局變量的值,要先用global聲明全局變量。 session = HTMLSession() r = session.get(url) r.html.render(scrolldown=10, sleep=.1) titles = r.html.find('a.postTitle2') #print(len(titles)) for i, title in enumerate(titles): print(f'{id} [{title.text}]({title.attrs["href"]})') id = id + 1 if __name__ == '__main__': for x in range(1,74): print('當前頁面: '+ str(x)) get_title(base_url+str(x))