最近在抽空學了一下python,於量就拿爬是練了下手,不得不說python的上手非常簡單。在網上找了一下,大都是python2的帖子,於是隨手寫了個python3的。代碼非常簡單就不解釋了,直接貼代碼。
#test rdp import urllib.request import re
#登錄用的帳戶信息 data={} data['fromUrl']='' data['fromUrlTemp']='' data['loginId']='12345' data['password']='12345' user_agent='Mozilla/4.0 (compatible; MSIE 5.5; Windows NT)' #登錄地址 #url='http://192.168.1.111:8080/loginCheck' postdata = urllib.parse.urlencode(data) postdata = postdata.encode('utf-8') headers = { 'User-Agent' : user_agent } #登錄 res = urllib.request.urlopen(url,postdata) #取得頁面html
strResult=(res.read().decode('utf-8')) #用正則表達式取出所有A標簽 p = re.compile(r'<a href="(.*?)".*?>(.*?)</a>') for m in p.finditer(strResult): print (m.group(1))#group(1)是href里面的內容,group(2)是a標簽里的文字
關於cookie、異常等處理看了一下,沒有花時間去處理,畢竟只是想通過寫爬蟲來學習python。
想要深入的去看這個系列的文章,寫得非常詳細了。
[Python]網絡爬蟲
下面是python語法教程,真的只要幾分鍾就能看完。