cookie和代理操作

本文轉載自查看原文 2018-10-30 16:04 898

一, 基於requests模塊的cookie操作

引言：有些時候，我們在使用爬蟲程序去爬取一些用戶相關信息的數據（爬取張三“人人網”個人主頁數據）時，如果使用之前requests模塊常規操作時，往往達不到我們想要的目的，例如：

#!/usr/bin/env python
# -*- coding:utf-8 -*-
import requests
if __name__ == "__main__":

    #張三人人網個人信息頁面的url
    url = 'http://www.renren.com/289676607/profile'

   #偽裝UA
    headers={
        'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_0) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.100 Safari/537.36',
    }
    #發送請求，獲取響應對象
    response = requests.get(url=url,headers=headers)
    #將響應內容寫入文件
    with open('./renren.html','w',encoding='utf-8') as fp:
        fp.write(response.text)

- 結果發現，寫入到文件中的數據，不是張三個人頁面的數據，而是人人網登陸的首頁面，why？首先我們來回顧下cookie的相關概念及作用：

　　- cookie概念：當用戶通過瀏覽器首次訪問一個域名時，訪問的web服務器會給客戶端發送數據，以保持web服務器與客戶端之間的狀態保持，這些數據就是cookie。

　　- cookie作用：我們在瀏覽器中，經常涉及到數據的交換，比如你登錄郵箱，登錄一個頁面。我們經常會在此時設置30天內記住我，或者自動登錄選項。那么它們是怎么記錄信息的呢，答案就是今天的主角cookie了，Cookie是由HTTP服務器設置的，保存在瀏覽器中，但HTTP協議是一種無狀態協議，在數據交換完畢后，服務器端和客戶端的鏈接就會關閉，每次交換數據都需要建立新的鏈接。就像我們去超市買東西，沒有積分卡的情況下，我們買完東西之后，超市沒有我們的任何消費信息，但我們辦了積分卡之后，超市就有了我們的消費信息。cookie就像是積分卡，可以保存積分，商品就是我們的信息，超市的系統就像服務器后台，http協議就是交易的過程。

- 經過cookie的相關介紹，其實你已經知道了為什么上述案例中爬取到的不是張三個人信息頁，而是登錄頁面。那應該如何抓取到張三的個人信息頁呢？

　　思路：

　　　　1.我們需要使用爬蟲程序對人人網的登錄時的請求進行一次抓取，獲取請求中的cookie數據

　　　　2.在使用個人信息頁的url進行請求時，該請求需要攜帶 1 中的cookie，只有攜帶了cookie后，服務器才可識別這次請求的用戶信息，方可響應回指定的用戶信息頁數據

import requests
from lxml import etree

headers = {
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.67 Safari/537.36"
}
# 1.進行登陸操作，服務器就會對當前用戶 創建一個cookie對象(存儲當前的用戶狀態信息，以及身份標識)
# 2. 進行個人主頁的請求（攜帶步驟1中創建的cookie）， 獲取當前用戶個人主頁的頁面數據

# 登陸
 #登錄請求的url（通過抓包工具獲取）
login_url = "http://www.renren.com/ajaxLogin/login?1=1&uniqueTimestamp=2018922053679 "
session = requests.session()  # #創建一個session對象，該對象會自動將請求中的cookie進行存儲和攜帶
data = {
    "captcha_type":"web_login",
    "domain":"renren.com",
    "email":"18829037944",
    "f":"",
    "icode":"",
    "key_id":"1",
    "origURL":"http://www.renren.com/home",
    "password": "30f28dff42c847e99969e7e91f8356bcb80aa2e9993893add81b6ff76c899be3",
    "rkey": "f1ace095ea75f09850cbb28b87a04b9e",
}
session.post(url=login_url, data=data, headers=headers) #  使用session發送請求，目的是為了將session保存該次請求中的cookie

get_url = "http://www.renren.com/968520666/profile"
#  再次使用session進行請求的發送，該次請求中已經攜帶了cookie
response = session.get(url=get_url, headers=headers)
#設置響應內容的編碼格式
response.encoding = 'utf-8'
page_text = response.text

#將響應內容寫入文件
with open('./renren01.html','w', encoding="utf-8") as fp:
    fp.write(response.text)
    print("over")

二, 基於requests模塊的代理操作

什么是代理
- 代理就是第三方代替本體處理相關事務。例如：生活中的代理：代購，中介，微商......
爬蟲中為什么需要使用代理
- 一些網站會有相應的反爬蟲措施，例如很多網站會檢測某一段時間某個IP的訪問次數，如果訪問頻率太快以至於看起來不像正常訪客，它可能就會會禁止這個IP的訪問。所以我們需要設置一些代理IP，每隔一段時間換一個代理IP，就算IP被禁止，依然可以換個IP繼續爬取。
代理的分類：
- 正向代理：代理客戶端獲取數據。正向代理是為了保護客戶端防止被追究責任。
- 反向代理：代理服務器提供數據。反向代理是為了保護服務器或負責負載均衡。
免費代理ip提供網站
- http://www.goubanjia.com/
- 西祠代理
- 快代理

#!/usr/bin/env python
# -*- coding:utf-8 -*-
import requests
import random
if __name__ == "__main__":
    #不同瀏覽器的UA
    header_list = [
        # 遨游
        {"user-agent": "Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1; Maxthon 2.0)"},
        # 火狐
        {"user-agent": "Mozilla/5.0 (Windows NT 6.1; rv:2.0.1) Gecko/20100101 Firefox/4.0.1"},
        # 谷歌
        {
            "user-agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_7_0) AppleWebKit/535.11 (KHTML, like Gecko) Chrome/17.0.963.56 Safari/535.11"}
    ]
    #不同的代理IP
    proxy_list = [
        {"http": "112.115.57.20:3128"},
        {'http': '121.41.171.223:3128'}
    ]
    #隨機獲取UA和代理IP
    header = random.choice(header_list)
    proxy = random.choice(proxy_list)

    url = 'http://www.baidu.com/s?ie=UTF-8&wd=ip'
    #參數3：設置代理
    response = requests.get(url=url,headers=header,proxies=proxy)
    response.encoding = 'utf-8'
    
    with open('daili.html', 'wb') as fp:
        fp.write(response.content)
    #切換成原來的IP
    requests.get(url, proxies={"http": ""})

免責聲明！

本站轉載的文章為個人學習借鑒使用，本站對版權不負任何法律責任。如果侵犯了您的隱私權益，請聯系本站郵箱yoyou2525@163.com刪除。

猜您在找 selenium（四）操作cookie，偽造cookie selenium操作cookie Flask學習——cookie操作原生js操作cookie Javascript操作cookie selenium獲取Cookie操作 springMVC操作cookie和session Flask（11）- 操作 Cookie springboot之cookie操作 nodejs操作cookie的流程