Python爬蟲(chóng)使用bs4方法實(shí)現(xiàn)數(shù)據(jù)解析
聚焦爬蟲(chóng):
爬取頁(yè)面中指定的頁(yè)面內(nèi)容。
編碼流程:
1.指定url 2.發(fā)起請(qǐng)求 3.獲取響應(yīng)數(shù)據(jù) 4.數(shù)據(jù)解析 5.持久化存儲(chǔ)數(shù)據(jù)解析分類:
1.bs4 2.正則 3.xpath (***)數(shù)據(jù)解析原理概述:
解析的局部的文本內(nèi)容都會(huì)在標(biāo)簽之間或者標(biāo)簽對(duì)應(yīng)的屬性中進(jìn)行存儲(chǔ)
1.進(jìn)行指定標(biāo)簽的定位
2.標(biāo)簽或者標(biāo)簽對(duì)應(yīng)的屬性中存儲(chǔ)的數(shù)據(jù)值進(jìn)行提?。ń馕觯?/p>
bs4進(jìn)行數(shù)據(jù)解析數(shù)據(jù)解析的原理:
1.標(biāo)簽定位
2.提取標(biāo)簽、標(biāo)簽屬性中存儲(chǔ)的數(shù)據(jù)值
bs4數(shù)據(jù)解析的原理:
1.實(shí)例化一個(gè)BeautifulSoup對(duì)象,并且將頁(yè)面源碼數(shù)據(jù)加載到該對(duì)象中
2.通過(guò)調(diào)用BeautifulSoup對(duì)象中相關(guān)的屬性或者方法進(jìn)行標(biāo)簽定位和數(shù)據(jù)提取
環(huán)境安裝:
pip install bs4 -i https://pypi.tuna.tsinghua.edu.cn/simplepip install lxml -i https://pypi.tuna.tsinghua.edu.cn/simple
實(shí)例化BeautifulSoup對(duì)象步驟:
from bs4 import BeautifulSoup
對(duì)象的實(shí)例化:
1.將本地的html文檔中的數(shù)據(jù)加載到該對(duì)象中
fp = open(’./test.html’,’r’,encoding=’utf-8’)soup = BeautifulSoup(fp,’lxml’)
2.將互聯(lián)網(wǎng)上獲取的頁(yè)面源碼加載到該對(duì)象中(常用方法,推薦)
page_text = response.textsoup = BeatifulSoup(page_text,’lxml’)
提供的用于數(shù)據(jù)解析的方法和屬性:
soup.tagName:返回的是文檔中第一次出現(xiàn)的tagName對(duì)應(yīng)的標(biāo)簽soup.find():find(’tagName’):等同于soup.div
1.屬性定位:
soup.find(’div’,class_/id/attr=’song’)soup.find_all(’tagName’):返回符合要求的所有標(biāo)簽(列表)select:select(’某種選擇器(id,class,標(biāo)簽...選擇器)’),返回的是一個(gè)列表。
2.層級(jí)選擇器:
soup.select(’.tang > ul > li > a’):>表示的是一個(gè)層級(jí)soup.select(’.tang > ul a’):空格表示的多個(gè)層級(jí)
3.獲取標(biāo)簽之間的文本數(shù)據(jù):
soup.a.text/string/get_text()text/get_text():可以獲取某一個(gè)標(biāo)簽中所有的文本內(nèi)容string:只可以獲取該標(biāo)簽下面直系的文本內(nèi)容
4.獲取標(biāo)簽中屬性值:
soup.a[’href’]
案例:爬取三國(guó)演義小說(shuō)所有的章節(jié)標(biāo)題和章節(jié)內(nèi)容代碼如下:
import requestsfrom bs4 import BeautifulSoupif __name__ == '__main__': #對(duì)首頁(yè)的頁(yè)面數(shù)據(jù)進(jìn)行爬取 headers = { ’User-Agent’: ’Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_0) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/72.0.3626.121 Safari/537.36’ } url = ’http://www.shicimingju.com/book/sanguoyanyi.html’ page_text = requests.get(url=url,headers=headers).text #在首頁(yè)中解析出章節(jié)的標(biāo)題和詳情頁(yè)的url #實(shí)例化BeautifulSoup對(duì)象,需要將頁(yè)面源碼數(shù)據(jù)加載到該對(duì)象中 soup = BeautifulSoup(page_text,’lxml’) #解析章節(jié)標(biāo)題和詳情頁(yè)的url li_list = soup.select(’.book-mulu > ul > li’) fp = open(’./sanguo.txt’,’w’,encoding=’utf-8’) for li in li_list: title = li.a.string detail_url = ’http://www.shicimingju.com’+li.a[’href’] #對(duì)詳情頁(yè)發(fā)起請(qǐng)求,解析出章節(jié)內(nèi)容 detail_page_text = requests.get(url=detail_url,headers=headers).text #解析出詳情頁(yè)中相關(guān)的章節(jié)內(nèi)容 detail_soup = BeautifulSoup(detail_page_text,’lxml’) div_tag = detail_soup.find(’div’,class_=’chapter_content’) #解析到了章節(jié)的內(nèi)容 content = div_tag.text fp.write(title+’:’+content+’n’) print(title,’爬取成功?。?!’)
運(yùn)行結(jié)果:
以上就是本文的全部?jī)?nèi)容,希望對(duì)大家的學(xué)習(xí)有所幫助,也希望大家多多支持好吧啦網(wǎng)。
相關(guān)文章:
1. Laravel操作session和cookie的教程詳解2. html小技巧之td,div標(biāo)簽里內(nèi)容不換行3. XML入門(mén)的常見(jiàn)問(wèn)題(一)4. css進(jìn)階學(xué)習(xí) 選擇符5. 將properties文件的配置設(shè)置為整個(gè)Web應(yīng)用的全局變量實(shí)現(xiàn)方法6. PHP字符串前后字符或空格刪除方法介紹7. jsp實(shí)現(xiàn)登錄界面8. 解析原生JS getComputedStyle9. 淺談SpringMVC jsp前臺(tái)獲取參數(shù)的方式 EL表達(dá)式10. Echarts通過(guò)dataset數(shù)據(jù)集實(shí)現(xiàn)創(chuàng)建單軸散點(diǎn)圖
