Python爬蟲使用selenium爬取qq群的成員信息（全自動實現自動登陸）

本文轉載自查看原文 2019-11-29 13:54 825 Python爬蟲

前言

本文的文字及圖片來源於網絡,僅供學習、交流使用,不具有任何商業用途,版權歸原作者所有,如有問題請及時聯系我們以作處理。

作者： python小爬蟲

PS：如有需要Python學習資料的小伙伴可以加點擊下方鏈接自行獲取

http://note.youdao.com/noteshare?id=3054cce4add8a909e784ad934f956cef

效果圖，其中涉及一些真名我就打碼了，還有qq號我也打碼了，見諒
分析登陸的元素，下圖一目了然，怎么獲取這個登陸元素應該都知道了
代碼奉上

1 url = 'https://qun.qq.com/'
2 # 構建谷歌驅動器
3 browser = webdriver.Chrome()
4 # 請求url
5 browser.get(url)
6 # 模擬登陸，首先找到登陸的id，並點擊
7 browser.find_element_by_css_selector('#headerInfo p a').click()

點擊之后出現這么一個框框（這個框框可把我折磨的阿）原因是這樣的，尋常的獲取這個框框是不能獲取到的

5.先看看這個框所在的位置，這個框框竟然在另一個html代碼里面，也就是說在瀏覽器看的時候，出現了兩個html標簽，老實說，我是第一次看到這種情況的，奈何我的html也不好，連入門都算不上，沒辦法，我就去百度了，果然黃天不負有心人，說是因為iframe這個標簽可以再放html代碼，所以就是這種情況了

在這里插入圖片描述

既然知道了是怎么一回事之后，那就可以繼續操作了，首先我們先找到iframe這個標簽，然后獲取它的src屬性，這個鏈接就是這個框框登陸的鏈接了，如果不獲取這個iframe標簽的src屬性，那么我們使用selenium是獲取不到這個框框的元素的。

 1 # 點擊之后會彈出一個登陸框，這時候我們用顯示等待來等待這個登陸框加載出來
 2 WebDriverWait(browser, 1000).until(
 3     EC.presence_of_all_elements_located(
 4         (By.CSS_SELECTOR, '#loginWin iframe')
 5     )
 6 )
 7 print('登陸框已加載')
 8 # 登陸框加載之后，我們發現整個登陸框其實就是另一個網網頁
 9 # 如果在原網頁操作這個登陸框的話，是不能操作的
10 # 所以我們只需要提取iframe標簽的src屬性，然后再去訪問這個url即可實現
11 # 自動登陸
12 # 找到iframe標簽並獲取src
13 iframe_url = browser.find_element_by_css_selector('#loginWin iframe').get_attribute('src')
14 # 再訪問這個url
15 browser.get(iframe_url)
16 # 找到快捷登陸的頭像並點擊
17 # 首先用顯示等待這個頭像已經加載完成
18 WebDriverWait(browser, 1000).until(
19     EC.presence_of_all_elements_located(
20         (By.ID, 'qlogin_list')
21     )
22 )
23 browser.find_element_by_css_selector('#qlogin_list a').click()
24 print('登陸成功')

登陸成功之后我們需要的是群管理，是ul標簽的第四個li標簽，通過xpath獲取

1 # 登陸成功之后，我們就找到群管理的標簽並點擊,首先等待這個元素加載完成
2 WebDriverWait(browser, 1000).until(
3     EC.presence_of_all_elements_located(
4         (By.XPATH, './/ul[@id="headerNav"]/li[4]')
5     )
6 )
7 browser.find_element_by_xpath('.//ul[@id="headerNav"]/li[4]').click()

8.點擊群管理之后，進入群管理界面，我們需要的是成員管理

在這里插入圖片描述

1 # 點擊之后，我們找到成員管理標簽並點擊
2 WebDriverWait(browser, 1000).until(
3     EC.presence_of_all_elements_located(
4         (By.CLASS_NAME, 'color-tit')
5     )
6 )
7 browser.find_element_by_class_name('color-tit').click()

9.點擊成員管理之后會重新新建一個窗口，這個時候就會出現句柄，我們需要將當然窗口的句柄切換到新打開的這個界面，不然的話，是獲取不到新打開界面的信息的，注釋已經寫了

在這里插入圖片描述

 1 # 打印全部窗口句柄
 2 # print(browser.window_handles)
 3 # 打印當前窗口句柄
 4 # print(browser.current_window_handle)
 5 # 注意這里點擊成員管理之后會自動跳轉到一個新窗口打開這個頁面
 6 # 所以我們需要將窗口句柄切換到這個新窗口
 7 
 8 browser.switch_to.window(browser.window_handles[1])
 9 
10 # 解釋一下browser.switch_to.window是獲取當前一共有幾個窗口
11 # 這里是2個
12 # browser.switch_to.window這個是指定當前游標切換到哪個窗口
13 # 其實也可以這么寫
14 # all_window = browser.switch_to.window返回的是一個列表
15 # browser.switch_to.window(all_window[1])
16 # 效果是一樣的

10.我們需要的是我加入的群信息

在這里插入圖片描述

1 # 切換句柄之后，我們顯示等待窗口出來
2     WebDriverWait(browser, 1000).until(
3         EC.presence_of_all_elements_located(
4             (By.CLASS_NAME, 'my-all-group')
5         )
6     )
7 
8     # 篩選出我加入的群標簽
9     lis = browser.find_elements_by_xpath('.//div[@class="my-all-group"]/ul[2]/li')

11.遍歷列表，取出信息

# 遍歷
num= 0
while True:
    if num == len(lis):
        break
    try:
        # 按順序選擇群並獲取信息
        # 先點擊該群獲取成員信息
        lis[num].click()
        # 顯示等待信息加載完成
        WebDriverWait(browser, 1000).until(
            EC.presence_of_all_elements_located(
                (By.CLASS_NAME, 'list')
            )
        )
        # 獲取該群當前有多少人，后面翻頁需要
        groupMemberNum = eval(browser.find_element_by_id('groupMemberNum').text)
        # 每一次翻頁都會刷新21條信息，所以寫個循環
        # 這里加1是因為假如一個群有36人，那么count=1，如果循環的話就不會翻頁了
        # 也就是只能抓到一頁的數據，大家可以自己想想其中的流程就知道了
        count = groupMemberNum // 21 + 1
        # 這里我只爬取每個群的一部分，如果想爬取全部成員信息
        # 請注釋下面的if語句
        if count > 2:
            count = 1
        # 每次循環都進行翻頁
        # while count:
        #     count -= 1
        #
        #     browser.execute_script('document.documentElement.scrollTop=100000')
        #     time.sleep(2)
        time.sleep(2)
        # 開始獲取成員信息
        trs = browser.find_elements_by_class_name('mb')
        if trs:
            # 遍歷
            for tr in trs:
                tds = tr.find_elements_by_tag_name('td')[2:]
                if len(tds) == 8:
                    # qq網名
                    qq_name = tds[0].text
                    # 群名稱
                    group_name = tds[1].text
                    # qq號
                    qq_number = tds[2].text
                    # 性別
                    gender = tds[3].text
                    # qq年齡
                    qq_year = tds[4].text
                    # 入群時間
                    join_time = tds[5].text
                    # 等級（積分）
                    level = None
                    # 最后發言時間
                    end_time = tds[6].text

                    # 聲明一個字典存儲數據
                    data_dict = {}
                    data_dict['qq_name'] = qq_name
                    data_dict['group_name'] = group_name
                    data_dict['qq_number'] = qq_number
                    data_dict['gender'] = gender
                    data_dict['qq_year'] = qq_year
                    data_dict['join_time'] = join_time
                    data_dict['level'] = level
                    data_dict['end_time'] = end_time

                    print(data_dict)
                elif len(tds) == 9:
                    # qq網名
                    qq_name = tds[0].text
                    # 群名稱
                    group_name = tds[1].text
                    # qq號
                    qq_number = tds[2].text
                    # 性別
                    gender = tds[3].text
                    # qq年齡
                    qq_year = tds[4].text
                    # 入群時間
                    join_time = tds[5].text
                    # 等級（積分）
                    level = tds[6].text
                    # 最后發言時間
                    end_time = tds[7].text

                    # 聲明一個字典存儲數據
                    data_dict = {}
                    data_dict['qq_name'] = qq_name
                    data_dict['group_name'] = group_name
                    data_dict['qq_number'] = qq_number
                    data_dict['gender'] = gender
                    data_dict['qq_year'] = qq_year
                    data_dict['join_time'] = join_time
                    data_dict['level'] = level
                    data_dict['end_time'] = end_time
                    data_list.append(data_dict)

                    print(data_dict)

        browser.find_element_by_id('changeGroup').click()
        time.sleep(3)
        WebDriverWait(browser, 1000).until(
            EC.presence_of_all_elements_located(
                (By.CLASS_NAME, 'ui-dialog')
            )
        )
        lis = browser.find_elements_by_xpath('.//div[@class="my-all-group"]/ul[2]/li')
        num += 1
    except Exception as e:
        lis = browser.find_elements_by_xpath('.//div[@class="my-all-group"]/ul[2]/li')
        num += 1
        continue

完整代碼附上

  1 # 導入需要的包
  2 # 爬取qq群的成員信息
  3 from selenium import webdriver
  4 from selenium.webdriver.support.ui import WebDriverWait
  5 from selenium.webdriver.support import expected_conditions as EC
  6 from selenium.webdriver.common.by import By
  7 import time
  8 import json
  9 import csv
 10 
 11 
 12 # 開始登陸
 13 def login_spider():
 14 
 15     url = 'https://qun.qq.com/'
 16     # 構建谷歌驅動器
 17     browser = webdriver.Chrome()
 18     # 請求url
 19     browser.get(url)
 20     # 模擬登陸，首先找到登陸的id，並點擊
 21     browser.find_element_by_css_selector('#headerInfo p a').click()
 22     # 點擊之后會彈出一個登陸框，這時候我們用顯示等待來等待這個登陸框加載出來
 23     WebDriverWait(browser, 1000).until(
 24         EC.presence_of_all_elements_located(
 25             (By.CSS_SELECTOR, '#loginWin iframe')
 26         )
 27     )
 28     print('登陸框已加載')
 29     # 登陸框加載之后，我們發現整個登陸框其實就是另一個網網頁
 30     # 如果在原網頁操作這個登陸框的話，是不能操作的
 31     # 所以我們只需要提取iframe標簽的src屬性，然后再去訪問這個url即可實現
 32     # 自動登陸
 33     # 找到iframe標簽並獲取是如此熟悉
 34     iframe_url = browser.find_element_by_css_selector('#loginWin iframe').get_attribute('src')
 35     # 再訪問這個url
 36     browser.get(iframe_url)
 37     # 找到快捷登陸的頭像並點擊
 38     # 首先用顯示等待這個頭像已經加載完成
 39     WebDriverWait(browser, 1000).until(
 40         EC.presence_of_all_elements_located(
 41             (By.ID, 'qlogin_list')
 42         )
 43     )
 44     browser.find_element_by_css_selector('#qlogin_list a').click()
 45     print('登陸成功')
 46 
 47     return browser
 48 
 49 
 50 # 切換句柄操作
 51 def switch_spider(browser):
 52     # 登陸成功之后，我們就找到群管理的標簽並點擊,首先等待這個元素加載完成
 53     WebDriverWait(browser, 1000).until(
 54         EC.presence_of_all_elements_located(
 55             (By.XPATH, './/ul[@id="headerNav"]/li[4]')
 56         )
 57     )
 58     browser.find_element_by_xpath('.//ul[@id="headerNav"]/li[4]').click()
 59     # 點擊之后，我們找到成員管理標簽並點擊
 60     WebDriverWait(browser, 1000).until(
 61         EC.presence_of_all_elements_located(
 62             (By.CLASS_NAME, 'color-tit')
 63         )
 64     )
 65     browser.find_element_by_class_name('color-tit').click()
 66     # 打印全部窗口句柄
 67     # print(browser.window_handles)
 68     # 打印當前窗口句柄
 69     # print(browser.current_window_handle)
 70     # 注意這里點擊成員管理之后會自動跳轉到一個新窗口打開這個頁面
 71     # 所以我們需要將窗口句柄切換到這個新窗口
 72     browser.switch_to.window(browser.window_handles[1])
 73     # 解釋一下browser.switch_to.window是獲取當前一共有幾個窗口
 74     # 這里是2個
 75     # browser.switch_to.window這個是指定當前游標切換到哪個窗口
 76     # 其實也可以這么寫
 77     # all_window = browser.switch_to.window返回的是一個列表
 78     # browser.switch_to.window(all_window[1])
 79     # 效果是一樣的
 80 
 81     return browser
 82 
 83 
 84 # 開始采集數據
 85 def start_spider(browser):
 86     # 聲明一個列表存儲字典
 87     data_list = []
 88     # 切換句柄之后，我們顯示等待窗口出來
 89     WebDriverWait(browser, 1000).until(
 90         EC.presence_of_all_elements_located(
 91             (By.CLASS_NAME, 'my-all-group')
 92         )
 93     )
 94 
 95     # 篩選出我加入的群標簽
 96     lis = browser.find_elements_by_xpath('.//div[@class="my-all-group"]/ul[2]/li')
 97     # 遍歷
 98     num = 0
 99     while True:
100         try:
101             # 按順序選擇群並獲取信息
102             # 先點擊該群獲取成員信息
103             lis[num].click()
104             # 顯示等待信息加載完成
105             WebDriverWait(browser, 1000).until(
106                 EC.presence_of_all_elements_located(
107                     (By.CLASS_NAME, 'list')
108                 )
109             )
110             # 獲取該群當前有多少人，后面翻頁需要
111             groupMemberNum = eval(browser.find_element_by_id('groupMemberNum').text)
112             # 每一次翻頁都會刷新21條信息，所以寫個循環
113             # 這里加1是因為假如一個群有36人，那么count=1，如果循環的話就不會翻頁了
114             # 也就是只能抓到一頁的數據，大家可以自己想想其中的流程就知道了
115             count = groupMemberNum // 21 + 1
116             # 這里我只爬取每個群的一部分，如果想爬取全部成員信息
117             # 請注釋下面的if語句
118             if count > 5:
119                 count = 5
120             # 每次循環都進行翻頁
121             while count:
122                 count -= 1
123 
124                 browser.execute_script('document.documentElement.scrollTop=100000')
125                 time.sleep(2)
126             time.sleep(3)
127             # 開始獲取成員信息
128             trs = browser.find_elements_by_class_name('mb')
129             if trs:
130                 # 遍歷
131                 for tr in trs:
132                     tds = tr.find_elements_by_tag_name('td')[2:]
133                     if len(tds) == 8:
134                         # qq網名
135                         qq_name = tds[0].text
136                         # 群名稱
137                         group_name = tds[1].text
138                         # qq號
139                         qq_number = tds[2].text
140                         # 性別
141                         gender = tds[3].text
142                         # qq年齡
143                         qq_year = tds[4].text
144                         # 入群時間
145                         join_time = tds[5].text
146                         # 等級（積分）
147                         level = None
148                         # 最后發言時間
149                         end_time = tds[6].text
150 
151                         # 聲明一個字典存儲數據
152                         data_dict = {}
153                         data_dict['qq_name'] = qq_name
154                         data_dict['group_name'] = group_name
155                         data_dict['qq_number'] = qq_number
156                         data_dict['gender'] = gender
157                         data_dict['qq_year'] = qq_year
158                         data_dict['join_time'] = join_time
159                         data_dict['level'] = level
160                         data_dict['end_time'] = end_time
161 
162                         print(data_dict)
163                     elif len(tds) == 9:
164                         # qq網名
165                         qq_name = tds[0].text
166                         # 群名稱
167                         group_name = tds[1].text
168                         # qq號
169                         qq_number = tds[2].text
170                         # 性別
171                         gender = tds[3].text
172                         # qq年齡
173                         qq_year = tds[4].text
174                         # 入群時間
175                         join_time = tds[5].text
176                         # 等級（積分）
177                         level = tds[6].text
178                         # 最后發言時間
179                         end_time = tds[7].text
180 
181                         # 聲明一個字典存儲數據
182                         data_dict = {}
183                         data_dict['qq_name'] = qq_name
184                         data_dict['group_name'] = group_name
185                         data_dict['qq_number'] = qq_number
186                         data_dict['gender'] = gender
187                         data_dict['qq_year'] = qq_year
188                         data_dict['join_time'] = join_time
189                         data_dict['level'] = level
190                         data_dict['end_time'] = end_time
191                         data_list.append(data_dict)
192 
193                         print(data_dict)
194 
195             browser.find_element_by_id('changeGroup').click()
196             time.sleep(3)
197             WebDriverWait(browser, 1000).until(
198                 EC.presence_of_all_elements_located(
199                     (By.CLASS_NAME, 'ui-dialog')
200                 )
201             )
202             lis = browser.find_elements_by_xpath('.//div[@class="my-all-group"]/ul[2]/li')
203             num += 1
204         except Exception as e:
205             continue
206 
207     return data_list
208 
209 
210 def main():
211 
212     browser = login_spider()
213     browser = switch_spider(browser)
214     data_list = start_spider(browser)
215 
216     # 將數據寫入json文件
217     with open('data_json.json', 'a+', encoding='utf-8') as f:
218         json.dump(data_list, f)
219     print('json文件寫入完成')
220   # 這里的編碼格式不要寫錯了，不然會出現亂碼，因為群里面的大神名字賊騷
221     with open('data_csv.csv', 'w', encoding='utf-8-sig', newline='') as f:
222         # 表頭
223         title = data_list[0].keys()
224         # 聲明writer
225         writer = csv.DictWriter(f, title)
226         # 寫入表頭
227         writer.writeheader()
228         # 批量寫入數據
229         writer.writerows(data_list)
230     print('csv文件寫入完成')
231 
232 
233 if __name__ == '__main__':
234 
235     main()

免責聲明！

本站轉載的文章為個人學習借鑒使用，本站對版權不負任何法律責任。如果侵犯了您的隱私權益，請聯系本站郵箱yoyou2525@163.com刪除。

猜您在找 Python爬蟲:基於Scrapy的淘寶登陸后實現數據爬取並保存到Mysql python3 selenium實現自動登陸網頁 python爬蟲---實現項目(一) Requests爬取HTML信息 python網絡爬蟲之使用scrapy自動爬取多個網頁 python 爬蟲 booking爬取酒店信息 Python爬蟲將爬取的信息變為字典 [python爬蟲] Selenium定向爬取PubMed生物醫學摘要信息 Python爬蟲學習筆記之模擬登陸並爬去GitHub 使用HTTPURLConnection模擬登陸，爬取網頁內容爬蟲之selenium爬取京東商品信息