本文的文字及圖片來源於網絡,僅供學習、交流使用,不具有任何商業用途,版權歸原作者所有,如有問題請及時聯系我們以作處理。
作者: python小爬蟲
PS:如有需要Python學習資料的小伙伴可以加點擊下方鏈接自行獲取
http://note.youdao.com/noteshare?id=3054cce4add8a909e784ad934f956cef
-
效果圖,其中涉及一些真名我就打碼了,還有qq號我也打碼了,見諒
-
-
分析登陸的元素,下圖一目了然,怎么獲取這個登陸元素應該都知道了
-
-
代碼奉上
1 url = 'https://qun.qq.com/' 2 # 構建谷歌驅動器 3 browser = webdriver.Chrome() 4 # 請求url 5 browser.get(url) 6 # 模擬登陸,首先找到登陸的id,並點擊 7 browser.find_element_by_css_selector('#headerInfo p a').click()
-
點擊之后出現這么一個框框(這個框框可把我折磨的阿)原因是這樣的,尋常的獲取這個框框是不能獲取到的
5.先看看這個框所在的位置,這個框框竟然在另一個html代碼里面,也就是說在瀏覽器看的時候,出現了兩個html標簽,老實說,我是第一次看到這種情況的,奈何我的html也不好,連入門都算不上,沒辦法,我就去百度了,果然黃天不負有心人,說是因為iframe這個標簽可以再放html代碼,所以就是這種情況了
-
既然知道了是怎么一回事之后,那就可以繼續操作了,首先我們先找到iframe這個標簽,然后獲取它的src屬性,這個鏈接就是這個框框登陸的鏈接了,如果不獲取這個iframe標簽的src屬性,那么我們使用selenium是獲取不到這個框框的元素的。
1 # 點擊之后會彈出一個登陸框,這時候我們用顯示等待來等待這個登陸框加載出來 2 WebDriverWait(browser, 1000).until( 3 EC.presence_of_all_elements_located( 4 (By.CSS_SELECTOR, '#loginWin iframe') 5 ) 6 ) 7 print('登陸框已加載') 8 # 登陸框加載之后,我們發現整個登陸框其實就是另一個網網頁 9 # 如果在原網頁操作這個登陸框的話,是不能操作的 10 # 所以我們只需要提取iframe標簽的src屬性,然后再去訪問這個url即可實現 11 # 自動登陸 12 # 找到iframe標簽並獲取src 13 iframe_url = browser.find_element_by_css_selector('#loginWin iframe').get_attribute('src') 14 # 再訪問這個url 15 browser.get(iframe_url) 16 # 找到快捷登陸的頭像並點擊 17 # 首先用顯示等待這個頭像已經加載完成 18 WebDriverWait(browser, 1000).until( 19 EC.presence_of_all_elements_located( 20 (By.ID, 'qlogin_list') 21 ) 22 ) 23 browser.find_element_by_css_selector('#qlogin_list a').click() 24 print('登陸成功')
-
登陸成功之后我們需要的是群管理,是ul標簽的第四個li標簽,通過xpath獲取
-
1 # 登陸成功之后,我們就找到群管理的標簽並點擊,首先等待這個元素加載完成 2 WebDriverWait(browser, 1000).until( 3 EC.presence_of_all_elements_located( 4 (By.XPATH, './/ul[@id="headerNav"]/li[4]') 5 ) 6 ) 7 browser.find_element_by_xpath('.//ul[@id="headerNav"]/li[4]').click()
8.點擊群管理之后,進入群管理界面,我們需要的是成員管理
1 # 點擊之后,我們找到成員管理標簽並點擊 2 WebDriverWait(browser, 1000).until( 3 EC.presence_of_all_elements_located( 4 (By.CLASS_NAME, 'color-tit') 5 ) 6 ) 7 browser.find_element_by_class_name('color-tit').click()
9.點擊成員管理之后會重新新建一個窗口,這個時候就會出現句柄,我們需要將當然窗口的句柄切換到新打開的這個界面,不然的話,是獲取不到新打開界面的信息的,注釋已經寫了
1 # 打印全部窗口句柄 2 # print(browser.window_handles) 3 # 打印當前窗口句柄 4 # print(browser.current_window_handle) 5 # 注意這里點擊成員管理之后會自動跳轉到一個新窗口打開這個頁面 6 # 所以我們需要將窗口句柄切換到這個新窗口 7 8 browser.switch_to.window(browser.window_handles[1]) 9 10 # 解釋一下browser.switch_to.window是獲取當前一共有幾個窗口 11 # 這里是2個 12 # browser.switch_to.window這個是指定當前游標切換到哪個窗口 13 # 其實也可以這么寫 14 # all_window = browser.switch_to.window返回的是一個列表 15 # browser.switch_to.window(all_window[1]) 16 # 效果是一樣的
10.我們需要的是我加入的群信息
1 # 切換句柄之后,我們顯示等待窗口出來 2 WebDriverWait(browser, 1000).until( 3 EC.presence_of_all_elements_located( 4 (By.CLASS_NAME, 'my-all-group') 5 ) 6 ) 7 8 # 篩選出我加入的群標簽 9 lis = browser.find_elements_by_xpath('.//div[@class="my-all-group"]/ul[2]/li')
11.遍歷列表,取出信息
# 遍歷 num= 0 while True: if num == len(lis): break try: # 按順序選擇群並獲取信息 # 先點擊該群獲取成員信息 lis[num].click() # 顯示等待信息加載完成 WebDriverWait(browser, 1000).until( EC.presence_of_all_elements_located( (By.CLASS_NAME, 'list') ) ) # 獲取該群當前有多少人,后面翻頁需要 groupMemberNum = eval(browser.find_element_by_id('groupMemberNum').text) # 每一次翻頁都會刷新21條信息,所以寫個循環 # 這里加1是因為假如一個群有36人,那么count=1,如果循環的話就不會翻頁了 # 也就是只能抓到一頁的數據,大家可以自己想想其中的流程就知道了 count = groupMemberNum // 21 + 1 # 這里我只爬取每個群的一部分,如果想爬取全部成員信息 # 請注釋下面的if語句 if count > 2: count = 1 # 每次循環都進行翻頁 # while count: # count -= 1 # # browser.execute_script('document.documentElement.scrollTop=100000') # time.sleep(2) time.sleep(2) # 開始獲取成員信息 trs = browser.find_elements_by_class_name('mb') if trs: # 遍歷 for tr in trs: tds = tr.find_elements_by_tag_name('td')[2:] if len(tds) == 8: # qq網名 qq_name = tds[0].text # 群名稱 group_name = tds[1].text # qq號 qq_number = tds[2].text # 性別 gender = tds[3].text # qq年齡 qq_year = tds[4].text # 入群時間 join_time = tds[5].text # 等級(積分) level = None # 最后發言時間 end_time = tds[6].text # 聲明一個字典存儲數據 data_dict = {} data_dict['qq_name'] = qq_name data_dict['group_name'] = group_name data_dict['qq_number'] = qq_number data_dict['gender'] = gender data_dict['qq_year'] = qq_year data_dict['join_time'] = join_time data_dict['level'] = level data_dict['end_time'] = end_time print(data_dict) elif len(tds) == 9: # qq網名 qq_name = tds[0].text # 群名稱 group_name = tds[1].text # qq號 qq_number = tds[2].text # 性別 gender = tds[3].text # qq年齡 qq_year = tds[4].text # 入群時間 join_time = tds[5].text # 等級(積分) level = tds[6].text # 最后發言時間 end_time = tds[7].text # 聲明一個字典存儲數據 data_dict = {} data_dict['qq_name'] = qq_name data_dict['group_name'] = group_name data_dict['qq_number'] = qq_number data_dict['gender'] = gender data_dict['qq_year'] = qq_year data_dict['join_time'] = join_time data_dict['level'] = level data_dict['end_time'] = end_time data_list.append(data_dict) print(data_dict) browser.find_element_by_id('changeGroup').click() time.sleep(3) WebDriverWait(browser, 1000).until( EC.presence_of_all_elements_located( (By.CLASS_NAME, 'ui-dialog') ) ) lis = browser.find_elements_by_xpath('.//div[@class="my-all-group"]/ul[2]/li') num += 1 except Exception as e: lis = browser.find_elements_by_xpath('.//div[@class="my-all-group"]/ul[2]/li') num += 1 continue
1 # 導入需要的包 2 # 爬取qq群的成員信息 3 from selenium import webdriver 4 from selenium.webdriver.support.ui import WebDriverWait 5 from selenium.webdriver.support import expected_conditions as EC 6 from selenium.webdriver.common.by import By 7 import time 8 import json 9 import csv 10 11 12 # 開始登陸 13 def login_spider(): 14 15 url = 'https://qun.qq.com/' 16 # 構建谷歌驅動器 17 browser = webdriver.Chrome() 18 # 請求url 19 browser.get(url) 20 # 模擬登陸,首先找到登陸的id,並點擊 21 browser.find_element_by_css_selector('#headerInfo p a').click() 22 # 點擊之后會彈出一個登陸框,這時候我們用顯示等待來等待這個登陸框加載出來 23 WebDriverWait(browser, 1000).until( 24 EC.presence_of_all_elements_located( 25 (By.CSS_SELECTOR, '#loginWin iframe') 26 ) 27 ) 28 print('登陸框已加載') 29 # 登陸框加載之后,我們發現整個登陸框其實就是另一個網網頁 30 # 如果在原網頁操作這個登陸框的話,是不能操作的 31 # 所以我們只需要提取iframe標簽的src屬性,然后再去訪問這個url即可實現 32 # 自動登陸 33 # 找到iframe標簽並獲取是如此熟悉 34 iframe_url = browser.find_element_by_css_selector('#loginWin iframe').get_attribute('src') 35 # 再訪問這個url 36 browser.get(iframe_url) 37 # 找到快捷登陸的頭像並點擊 38 # 首先用顯示等待這個頭像已經加載完成 39 WebDriverWait(browser, 1000).until( 40 EC.presence_of_all_elements_located( 41 (By.ID, 'qlogin_list') 42 ) 43 ) 44 browser.find_element_by_css_selector('#qlogin_list a').click() 45 print('登陸成功') 46 47 return browser 48 49 50 # 切換句柄操作 51 def switch_spider(browser): 52 # 登陸成功之后,我們就找到群管理的標簽並點擊,首先等待這個元素加載完成 53 WebDriverWait(browser, 1000).until( 54 EC.presence_of_all_elements_located( 55 (By.XPATH, './/ul[@id="headerNav"]/li[4]') 56 ) 57 ) 58 browser.find_element_by_xpath('.//ul[@id="headerNav"]/li[4]').click() 59 # 點擊之后,我們找到成員管理標簽並點擊 60 WebDriverWait(browser, 1000).until( 61 EC.presence_of_all_elements_located( 62 (By.CLASS_NAME, 'color-tit') 63 ) 64 ) 65 browser.find_element_by_class_name('color-tit').click() 66 # 打印全部窗口句柄 67 # print(browser.window_handles) 68 # 打印當前窗口句柄 69 # print(browser.current_window_handle) 70 # 注意這里點擊成員管理之后會自動跳轉到一個新窗口打開這個頁面 71 # 所以我們需要將窗口句柄切換到這個新窗口 72 browser.switch_to.window(browser.window_handles[1]) 73 # 解釋一下browser.switch_to.window是獲取當前一共有幾個窗口 74 # 這里是2個 75 # browser.switch_to.window這個是指定當前游標切換到哪個窗口 76 # 其實也可以這么寫 77 # all_window = browser.switch_to.window返回的是一個列表 78 # browser.switch_to.window(all_window[1]) 79 # 效果是一樣的 80 81 return browser 82 83 84 # 開始采集數據 85 def start_spider(browser): 86 # 聲明一個列表存儲字典 87 data_list = [] 88 # 切換句柄之后,我們顯示等待窗口出來 89 WebDriverWait(browser, 1000).until( 90 EC.presence_of_all_elements_located( 91 (By.CLASS_NAME, 'my-all-group') 92 ) 93 ) 94 95 # 篩選出我加入的群標簽 96 lis = browser.find_elements_by_xpath('.//div[@class="my-all-group"]/ul[2]/li') 97 # 遍歷 98 num = 0 99 while True: 100 try: 101 # 按順序選擇群並獲取信息 102 # 先點擊該群獲取成員信息 103 lis[num].click() 104 # 顯示等待信息加載完成 105 WebDriverWait(browser, 1000).until( 106 EC.presence_of_all_elements_located( 107 (By.CLASS_NAME, 'list') 108 ) 109 ) 110 # 獲取該群當前有多少人,后面翻頁需要 111 groupMemberNum = eval(browser.find_element_by_id('groupMemberNum').text) 112 # 每一次翻頁都會刷新21條信息,所以寫個循環 113 # 這里加1是因為假如一個群有36人,那么count=1,如果循環的話就不會翻頁了 114 # 也就是只能抓到一頁的數據,大家可以自己想想其中的流程就知道了 115 count = groupMemberNum // 21 + 1 116 # 這里我只爬取每個群的一部分,如果想爬取全部成員信息 117 # 請注釋下面的if語句 118 if count > 5: 119 count = 5 120 # 每次循環都進行翻頁 121 while count: 122 count -= 1 123 124 browser.execute_script('document.documentElement.scrollTop=100000') 125 time.sleep(2) 126 time.sleep(3) 127 # 開始獲取成員信息 128 trs = browser.find_elements_by_class_name('mb') 129 if trs: 130 # 遍歷 131 for tr in trs: 132 tds = tr.find_elements_by_tag_name('td')[2:] 133 if len(tds) == 8: 134 # qq網名 135 qq_name = tds[0].text 136 # 群名稱 137 group_name = tds[1].text 138 # qq號 139 qq_number = tds[2].text 140 # 性別 141 gender = tds[3].text 142 # qq年齡 143 qq_year = tds[4].text 144 # 入群時間 145 join_time = tds[5].text 146 # 等級(積分) 147 level = None 148 # 最后發言時間 149 end_time = tds[6].text 150 151 # 聲明一個字典存儲數據 152 data_dict = {} 153 data_dict['qq_name'] = qq_name 154 data_dict['group_name'] = group_name 155 data_dict['qq_number'] = qq_number 156 data_dict['gender'] = gender 157 data_dict['qq_year'] = qq_year 158 data_dict['join_time'] = join_time 159 data_dict['level'] = level 160 data_dict['end_time'] = end_time 161 162 print(data_dict) 163 elif len(tds) == 9: 164 # qq網名 165 qq_name = tds[0].text 166 # 群名稱 167 group_name = tds[1].text 168 # qq號 169 qq_number = tds[2].text 170 # 性別 171 gender = tds[3].text 172 # qq年齡 173 qq_year = tds[4].text 174 # 入群時間 175 join_time = tds[5].text 176 # 等級(積分) 177 level = tds[6].text 178 # 最后發言時間 179 end_time = tds[7].text 180 181 # 聲明一個字典存儲數據 182 data_dict = {} 183 data_dict['qq_name'] = qq_name 184 data_dict['group_name'] = group_name 185 data_dict['qq_number'] = qq_number 186 data_dict['gender'] = gender 187 data_dict['qq_year'] = qq_year 188 data_dict['join_time'] = join_time 189 data_dict['level'] = level 190 data_dict['end_time'] = end_time 191 data_list.append(data_dict) 192 193 print(data_dict) 194 195 browser.find_element_by_id('changeGroup').click() 196 time.sleep(3) 197 WebDriverWait(browser, 1000).until( 198 EC.presence_of_all_elements_located( 199 (By.CLASS_NAME, 'ui-dialog') 200 ) 201 ) 202 lis = browser.find_elements_by_xpath('.//div[@class="my-all-group"]/ul[2]/li') 203 num += 1 204 except Exception as e: 205 continue 206 207 return data_list 208 209 210 def main(): 211 212 browser = login_spider() 213 browser = switch_spider(browser) 214 data_list = start_spider(browser) 215 216 # 將數據寫入json文件 217 with open('data_json.json', 'a+', encoding='utf-8') as f: 218 json.dump(data_list, f) 219 print('json文件寫入完成') 220 # 這里的編碼格式不要寫錯了,不然會出現亂碼,因為群里面的大神名字賊騷 221 with open('data_csv.csv', 'w', encoding='utf-8-sig', newline='') as f: 222 # 表頭 223 title = data_list[0].keys() 224 # 聲明writer 225 writer = csv.DictWriter(f, title) 226 # 寫入表頭 227 writer.writeheader() 228 # 批量寫入數據 229 writer.writerows(data_list) 230 print('csv文件寫入完成') 231 232 233 if __name__ == '__main__': 234 235 main()