小白，BeautifulSoup初步整理，后續(xù)添加

form bs4 import BeautifulSoup
要導入bs4模塊
注意BeautifulSoup大小寫
soup = BeautifulSoup('html','html.parser')
第一個參數(shù)html為要解析的html文檔，html是字符串

網(wǎng)站建設哪家好，找創(chuàng)新互聯(lián)！專注于網(wǎng)頁設計、網(wǎng)站建設、微信開發(fā)、微信小程序開發(fā)、集團企業(yè)網(wǎng)站建設等服務項目。為回饋新老客戶創(chuàng)新互聯(lián)還提供了敘永免費建站歡迎大家使用！

解析到soup中后才可以開始使用

soup中用的比較多的方法為find_all()
用法有：
soup.find_all('a')//找出所有的a標簽中的內(nèi)容，返回的是一個數(shù)組，數(shù)組中的每個元素又是BeautifulSoup對象
find_all()中還可以加屬性查詢，如：soup.findall('a'，class=''),如果有多個，可以soup.findall('a'，class=['c1','c2']),class_中的內(nèi)容為樣式，只要查找的內(nèi)容中有其中一個樣式就行
如：
s = '''<a href='xxx' class='c1'>aaaaaaa</a>
<a href='xxx' class='c2'></a>
<a href='xxx' class='c1 c3'></a>
<a href='xxx' class='c1 c2'></a>'''
這里面的都可以找出來
還有一種寫法：
soup.find_all('a'，attrs={'class':re.compile('')}),使用正則表達式，

拿到查找內(nèi)容后，如果要解析標簽中的內(nèi)容
find_all()要循環(huán)取
假設拿到其中一個,以a標簽為例
拿到的a1 = '<a href='xxx' class='c1'>'
拿鏈接：href = a1['href']
拿標簽中的內(nèi)容：content = a1.string

BeautifulSoup中還有find方法，用法與find_all()一樣，只是該方法只取第一個符合條件的

注：如果標簽不是成對的，如：<span><img src='xxxx' ></span>
此時，你用find('img')是拿不到img標簽的，你需要取到他的上級成對標簽span
然后在解析span標簽中的內(nèi)容，如
span = soup.find('span'),假設拿到的是'<span><img src='xxxx' ></span>'
此時你需要解析他的子標簽，使用children屬性
span.children
此時返回的結果是list_itrator對象，要么使用for循環(huán)去取，沒試過，要么使用next(list_itrator)取，可以拿到第一個子標簽<img>
然后拿到src的值：src = next(list_itrator)['src']
當然如果標簽是成對的，直接使用find('img')
注：
使用BeautifulSoup，以后所有返回帶有標簽內(nèi)容的對象都是BeautifulSoup對象（個人理解）
如果要分析的內(nèi)容太多，可以將需要的字符串內(nèi)容截取到合適的地方，因為BeautifulSoup解析實在是太耗時間了，雖然方便

網(wǎng)站標題：小白，BeautifulSoup初步整理，后續(xù)添加
本文路徑：http://jinyejixie.com/article18/ippddp.html

成都網(wǎng)站建設公司_創(chuàng)新互聯(lián)，為您提供服務器托管、小程序開發(fā)、網(wǎng)站維護、用戶體驗、虛擬主機、移動網(wǎng)站建設

聲明：本網(wǎng)站發(fā)布的內(nèi)容（圖片、視頻和文字）以用戶投稿、用戶轉載內(nèi)容為主，如果涉及侵權請盡快告知，我們將會在第一時間刪除。文章觀點不代表本網(wǎng)站立場，如需處理請聯(lián)系客服。電話：028-86922220；郵箱：631063699@qq.com。內(nèi)容未經(jīng)允許不得轉載，或轉載時需注明來源：創(chuàng)新互聯(lián)

猜你還喜歡下面的內(nèi)容

成人午夜视频全免费观看高清-秋霞福利视频一区二区三区-国产精品久久久久电影小说-亚洲不卡区三一区三区一区

小白，BeautifulSoup初步整理，后續(xù)添加

小白，BeautifulSoup初步整理，后續(xù)添加