Scrapy提取多個標簽的text

本文轉載自查看原文 2016-10-01 17:39 3071 Scrapy

對於要提取嵌套標簽所有內容的情況, 使用string或//text(), 注意兩者區別

>>> from scrapy import Selector
>>> 
>>> doc = "<p id='test'>hello<b>world!</b></p>"
>>> 
>>> sel = Selector(text=doc, type='html')
>>> 
>>> sel.xpath("/p[@id='test']/text()").extract()
[]

使用text()

>>>#使用兩個反斜杠
>>> sel.xpath("//p[@id='test']/text()").extract()
[u'hello']
>>> #這樣提取出來是一個列表, 
>>> sel.xpath("//p[@id='test']//text()").extract()
[u'hello', u'world!']
>>>

使用string

>>> sel.xpath("//p[@id='test']").xpath('string(.)').extract()
[u'helloworld!']
>>> 
>>> sel.xpath("string(//p[@id='test'])").extract()
[u'helloworld!']
>>>

免責聲明！

本站轉載的文章為個人學習借鑒使用，本站對版權不負任何法律責任。如果侵犯了您的隱私權益，請聯系本站郵箱yoyou2525@163.com刪除。

猜您在找 xpath提取多個標簽下的text scrapy xpath中提取多個class值 xpath提取目錄下所有標簽內的內容，遞歸 //text（） JQuery 獲取多個select標簽option的text內容 scrapy提取數據 Scrapy怎樣同時運行多個爬蟲？ scrapy 中用selector來提取數據的用法 xshell如何同時打開多個標簽 Learning Scrapy筆記（七）- Scrapy根據Excel文件運行多個爬蟲 Scrapy中的Callback如何傳遞多個參數