python3爬蟲-爬取新浪新聞首頁所有新聞標題

本文轉載自查看原文 2017-03-23 16:20 4619 Python

准備工作：安裝requests和BeautifulSoup4。打開cmd，輸入如下命令

pip install requests pip install BeautifulSoup4

打開我們要爬取的頁面，這里以新浪新聞為例，地址為：http://news.sina.com.cn/china/

按F12打開開發人員工具，點擊左上角的圖片，然后再頁面中點擊你想查看的元素：

image_1b9cn3qf33l8r6s1skf1duh1ann9.png-104.2kB

我點擊了新聞標題處的元素，查看到該元素為class=news-item的元素：

image_1b9cn61ap1qc62f57l5isu60m.png-288.5kB

在這里，我們要獲取新聞的時間，標題和鏈接，查看到分別在如下位置：

image_1b9cnc13h1es5tc31iif1a261adr13.png-98.6kB

現在，就可以根據元素的結構編寫爬蟲代碼了：

import requests from bs4 import BeautifulSoup url = 'http://news.sina.com.cn/china/' res = requests.get(url) # 使用UTF-8編碼 res.encoding = 'UTF-8' # 使用剖析器為html.parser soup = BeautifulSoup(res.text, 'html.parser') #遍歷每一個class=news-item的節點 for news in soup.select('.news-item'): h2 = news.select('h2') #只選擇長度大於0的結果 if len(h2) > 0: #新聞時間 time = news.select('.time')[0].text #新聞標題 title = h2[0].text #新聞鏈接 href = h2[0].select('a')[0]['href'] #打印 print(time, title, href)

運行程序，結果如下圖所示：

image_1b9cndiud9cs1oleisart8hb61g.png-201.9kB

免責聲明！

本站轉載的文章為個人學習借鑒使用，本站對版權不負任何法律責任。如果侵犯了您的隱私權益，請聯系本站郵箱yoyou2525@163.com刪除。

猜您在找 Python3：爬取新浪、網易、今日頭條、UC四大網站新聞標題及內容 python爬蟲：使用urllib.request和BeautifulSoup抓取新浪新聞標題、鏈接和主要內容網絡爬蟲百度新聞標題及鏈接爬取 Python3從零開始爬取今日頭條的新聞【二、首頁熱點新聞抓取】 python快速抓取新聞標題及內容【Python網絡爬蟲三】爬取網頁新聞 Python寫網絡爬蟲爬取騰訊新聞內容 python爬蟲，爬取一系列新聞 Python爬蟲實戰教程：爬取網易新聞 Python網絡爬蟲——爬取騰訊新聞國內疫情數據