文章詳情頁

python - Scrapy ItemLoader數據清洗疑問

瀏覽：188日期：2022-06-30 08:28:51

問題描述

在使用scrapy抓取數據時，利用itemloader這個類，使用selector取出的值為空時，進入scrapy.Field()里調用filter()，selector取值不為空的確返回'有值'，如果selector取出[]或'',那么value進入filter()之后，并不會返回'無值'

def filter(value): if value:return '有值' else:return '無值' # 下面就簡寫了，熟悉的應該能看的懂 scrapy.Field(filter())

有什么辦法將抓取為空的值，經過filyer()之后變成'無值'

問題解答

回答1：

謝邀~不太了解Scrapy，所以題主這個我不太好說我用PHP自己寫的爬蟲大體思路是：1.先是根據正則和一些循環，把要收集的頁面放到隊列里，按類別分類，例如分頁的列表頁一個隊列，列表里的數據內容頁一個隊列。2.然后利用xpath來爬取相關內容頁的數據，爬取的過程中對一些爬取到的數據進行如題主所需的那樣進行處理。3.組裝數據，按照自己所需的標準保存數據。

大體就是這樣，我絕對大部分爬蟲框架也大概都是這種思路吧，無非是在此基礎上增加了，反爬機制，多線程，多進程，增量爬取等等功能。所以，題主找到你這個框架的爬取數據那里進行處理或組裝數據的地方進行處理都行。

Python 編程

上一條：python - 面對一串含有亂碼的字符串，如何取下需要的信息下一條：python - 編碼問題求助

相關文章：

1. 運行python程序時出現“應用程序發生異常”的內存錯誤？2. 我在導入模板資源時遇到無法顯示的問題，請老師解答下3. macos - 無法source activate python274. java - butterknife怎么綁定多個view5. html5 - 前端面試碰到了一個緩存數據的問題，來論壇上請教一下6. css - 移動端盒子內加overflow-y:scroll后字體會變大7. PHPExcel表格導入數據庫怎么導入8. javascript - react如何獲取offsetX？9. html - 網頁的a標簽到底要不要寫上域名？10. css3 讓圖片變成灰色(filter)，但針對IE11瀏覽器無效

排行榜

					
					android - Genymotion 模擬器可以做屏幕適配檢測嗎？
我在導入模板資源時遇到無法顯示的問題，請老師解答下
css - 移動端 盒子內加overflow-y:scroll后 字體會變大
html5 - 前端面試碰到了一個緩存數據的問題，來論壇上請教一下
javascript - 打算寫一個c++的node圖像處理模塊,有沒有推薦的c++圖片處理庫？
javascript - react如何獲取offsetX？
macos - 無法source activate  python27
運行python程序時出現“應用程序發生異常”的內存錯誤？
java - butterknife怎么綁定多個view
css3 讓圖片變成灰色(filter)，但針對IE11瀏覽器無效
html - 網頁的a標簽到底要不要寫上域名？
				

熱門標簽

成人在线亚洲_国产日韩视频一区二区三区_久久久国产精品_99国内精品久久久久久久

python - Scrapy ItemLoader數據清洗疑問