requests-html簡介

本文轉載自查看原文 2020-01-15 16:55 750

安裝

pip install requests-html

使用

官方文檔：https://pypi.org/project/requests-html/

獲取網頁

requests-html和其他解析HTML庫最大的不同點在於HTML解析庫一般都是專用的，所以我們需要用另一個HTTP庫先把網頁下載下來，然后傳給那些HTML解析庫。而requests-html既可以下載網頁，又能解析網頁。

返回的對象r是requests.Reponse類型，更確切的說是繼承自前者的requests_html.HTMLResponse類型。這里其實和requests庫的使用方法差不多，獲取到的響應對象其實其實也沒啥用，這里的關鍵就在於r.html這個屬性，它會返回requests_html.HTML這個類型，它是整個requests_html庫中最核心的一個類，負責對HTML進行解析。

from requests_html import HTMLSession

session = HTMLSession()
url = "https://www.jianshu.com/u/18d731821bfc"
r = session.get(url=url)
print(r.html.html)

得到網頁中的所有鏈接：

# 相對路徑
print(r.html.links)
# 絕對路徑
print(r.html.absolute_links)

獲取元素

request-html支持CSS選擇器和XPATH兩種語法來選取HTML元素。首先先來看看CSS選擇器語法，它需要使用HTML的find函數，該函數有5個參數，作用如下：

selector，要用的CSS選擇器；
clean，布爾值，如果為真會忽略HTML中style和script標簽造成的影響（原文是sanitize，大概這么理解）;
containing，如果設置該屬性，會返回包含該屬性文本的標簽；
first，布爾值，如果為真會返回第一個元素，否則會返回滿足條件的元素列表；
_encoding，編碼格式。

下面是幾個簡單例子:

# 首頁菜單文本
print(r.html.find('div#menu', first=True).text)
# 首頁菜單元素
print(r.html.find('div#menu a'))

文本內容

e = r.html.find("div.title", first=True)
print(e.text)

要獲取元素的attribute，用attr屬性

print(e.attrs)

獲取元素的html代碼

print(e.html)

文本搜索，用search函數

print(e.search('還是{}沒頭腦')[0])

然后是XPATH語法，這需要另一個函數xpath的支持，它有4個參數如下：

selector，要用的XPATH選擇器；
clean，布爾值，如果為真會忽略HTML中style和script標簽造成的影響（原文是sanitize，大概這么理解）;
first，布爾值，如果為真會返回第一個元素，否則會返回滿足條件的元素列表；
_encoding，編碼格式。

還是上面的例子，不過這次使用XPATH語法：

print(r.html.xpath("//div[@id='menu']", first=True).text)
print(r.html.xpath("//div[@id='menu']//a"))

JavaScript支持

有些網站是使用JavaScript渲染的，這樣的網站爬取到的結果只有一堆JS代碼，這樣的網站requests-html也可以處理，關鍵一步就是在HTML結果上調用一下render函數，它會在用戶目錄（默認是~/.pyppeteer/）中下載一個chromium，然后用它來執行JS代碼。

下載過程只在第一次執行，以后就可以直接使用chromium來執行了。

r.html.render()

render函數還有一些參數，順便介紹一下（這些參數有的還有默認值，直接看源代碼方法參數列表即可）：

retries: 加載頁面失敗的次數
script: 頁面上需要執行的JS腳本（可選）
wait: 加載頁面錢的等待時間（秒），防止超時（可選）
scrolldown: 頁面向下滾動的次數
sleep: 在頁面初次渲染之后的等待時間
reload: 如果為假，那么頁面不會從瀏覽器中加載，而是從內存中加載
keep_page: 如果為真，允許你用r.html.page訪問頁面

比如說簡書的用戶頁面上用戶的文章列表就是一個異步加載的例子，初始只顯示最近幾篇文章，如果想爬取所有文章，就需要使用scrolldown配合sleep參數模擬下滑頁面，促使JS代碼加載所有文章。

自定義請求

自定義用戶代理

有些網站會使用UA來識別客戶端類型，有時候需要偽造UA來實現某些操作。可以防止封ip。

from pprint import pprint   # 提供了可以按照某個格式正確的顯示python已知類型數據的一種方法
import json

pp_r = session.get('http://httpbin.org/get')
pprint(json.loads(pp_r.html.html))

返回的結果如下：

{'args': {},
 'headers': {'Accept': '*/*',
             'Accept-Encoding': 'gzip, deflate',
             'Host': 'httpbin.org',
             'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_6) '
                           'AppleWebKit/603.3.8 (KHTML, like Gecko) '
                           'Version/10.1.2 Safari/603.3.8'},
 'origin': '150.95.184.46, 150.95.184.46',
 'url': 'https://httpbin.org/get'}

這里的UA是requests-html自帶的UA，下面換一個UA：

ua = 'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:62.0) Gecko/20100101 Firefox/62.0'
ppp_r = session.get('http://httpbin.org/get',headers={'user-agent': ua})
pprint(json.loads(ppp_r.html.html))

看到UA確實發生了變化：

{'args': {},
 'headers': {'Accept': '*/*',
             'Accept-Encoding': 'gzip, deflate',
             'Host': 'httpbin.org',
             'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:62.0) '
                           'Gecko/20100101 Firefox/62.0'},
 'origin': '150.95.184.46, 150.95.184.46',
 'url': 'https://httpbin.org/get'}

模擬表單登陸

post請求

r = session.post('http://httpbin.org/post', data={'username': 'python', 'passwd': 123456})
pprint(json.loads(r.html.html))

實例：爬自己博客園所有文章標題

from requests_html import HTMLSession

base_url = 'https://www.cnblogs.com/lfri/default.html?page='
id = 0

def get_title(url):
    global id #在函數內部修改全局變量的值，要先用global聲明全局變量。
    session = HTMLSession()
    r = session.get(url)
    r.html.render(scrolldown=10, sleep=.1)
    titles = r.html.find('a.postTitle2')
    #print(len(titles))
    for i, title in enumerate(titles):
        print(f'{id} [{title.text}]({title.attrs["href"]})')
        id = id + 1

if __name__ == '__main__':
    for x in range(1,74):
        print('當前頁面: '+ str(x))
        get_title(base_url+str(x))

參考鏈接：https://www.jianshu.com/p/380974ba9540

免責聲明！

本站轉載的文章為個人學習借鑒使用，本站對版權不負任何法律責任。如果侵犯了您的隱私權益，請聯系本站郵箱yoyou2525@163.com刪除。

猜您在找 requests-html的基本使用 requests-html requests-html快速入門 Python requests-HTML使用 requests-html的安裝與使用 requests-html模塊(下) requests-html添加header Python 爬蟲實戰（二）：使用 requests-html requests-html庫render方法的使用 requests-html 文檔坑較多