简介
目前成都创新互联公司已为上千多家的企业提供了网站建设、域名、雅安服务器托管、网站托管、服务器租用、企业网站设计、旬阳网站维护等服务,公司将坚持客户导向、应用为本的策略,正道将秉承"和谐、参与、激情"的文化,与客户和合作伙伴齐心协力一起成长,共同发展。
Beautiful Soup提供一些简单的、python式的函数用来处理导航、搜索、修改分析树等功能。它是一个工具箱,通过解析文档为用户提供需要抓取的数据,因为简单,所以不需要多少代码就可以写出一个完整的应用程序。Beautiful Soup自动将输入文档转换为Unicode编码,输出文档转换为utf-8编码。你不需要考虑编码方式,除非文档没有指定一个编码方式,这时,Beautiful Soup就不能自动识别编码方式了。然后,你仅仅需要说明一下原始编码方式就可以了。
Beautiful Soup已成为和lxml、html6lib一样出色的python解释器,为用户灵活地提供不同的解析策略或强劲的速度。
安装
- pip install BeautifulSoup4
- 或
- easy_install BeautifulSoup4
创建BeautifulSoup对象
首先应该导入BeautifulSoup类库
- from bs4 import BeautifulSoup
下面开始创建对像,在开始之前为了方便演示,先创建一个html文本,如下:
创建对象:soup=BeautifulSoup(html,’lxml’),这里的lxml是解析的类库,目前来说个人觉得***的解析器了,一直在用这个,安装方法:
- pip install lxml
Tag
Tag就是html中的一个标签,用BeautifulSoup就能解析出来Tag的具体内容,具体的格式为soup.name,其中name是html下的标签,具体实例如下:
- print soup.title # 输出title标签下的内容,包括此标签,这个将会输出
The Dormouse's story - print soup.head
注意:
这里的格式只能获取这些标签的***个,后面会讲到获取多个标签的方法。其中对于Tag有两个重要的属性name和attrs,分别表示名字和属性,介绍如下:
get
get方法用于得到标签下的属性值,注意这是一个重要的方法,在许多场合都能用到,比如你要得到标签下的图像url,那么就可以用soup.img.get(‘src’),具体解析如下:
- print soup.p.get("class") #得到***个p标签下的src属性
string
得到标签下的文本内容,只有在此标签下没有子标签,或者只有一个子标签的情况下才能返回其中的内容,否则返回的是None具体实例如下:
- print soup.p.string #在上面的一段文本中p标签没有子标签,因此能够正确返回文本的内容
- print soup.html.string #这里得到的就是None,因为这里的html中有很多的子标签
get_text()
可以获得一个标签中的所有文本内容,包括子孙节点的内容,这是最常用的方法
搜索文档树
find_all( name , attrs , recursive , text , **kwargs )
find_all是用于搜索节点中所有符合过滤条件的节点
1. name参数:是Tag的名字,如p,div,title …..
soup.find_all("p") 查找所有的p标签,返回的是[The Dormouse's story],可以通过遍历获取每一个节点,如下:
- ps=soup.find_all("p")
- for p in ps:
- print p.get('class') #得到p标签下的class属性
传入正则表达式:soup.find_all(re.compile(r’^b’)查找以b开头的所有标签,这里的body和b标签都会被查到
传入类列表:如果传入列表参数,BeautifulSoup会将与列表中任一元素匹配的内容返回.下面代码找到文档中所有标签和标签
- soup.find_all(["a", "b"])
2. KeyWords参数,就是传入属性和对应的属性值,或者一些其他的表达式
- # [
foo!]- data_soup.find_all(attrs={"data-foo": "value"}) #注意这里的atts不仅能够搜索特殊属性,亦可以搜索普通属性
- soup.find_all("p",attrs={'class':'title','id':'value'}) #相当与soup.find_all('p',class_='title',id='value')
3. text参数:通过 text 参数可以搜搜文档中的字符串内容.与 name 参数的可选值一样, text 参数接受 字符串 , 正则表达式 , 列表, True
- soup.find_all(text="Elsie")
- # [u'Elsie']
- soup.find_all(text=["Tillie", "Elsie", "Lacie"])
- # [u'Elsie', u'Lacie', u'Tillie']
- soup.find_all(text=re.compile("Dormouse"))
- [u"The Dormouse's story", u"The Dormouse's story"]
4. limit参数:find_all() 方法返回全部的搜索结构,如果文档树很大那么搜索会很慢.如果我们不需要全部结果,可以使用 limit 参数限制返回结果的数量.效果与SQL中的limit关键字类似,当搜索到的结果数量达到 limit 的限制时,就停止搜索返回结果.
文档树中有3个tag符合搜索条件,但结果只返回了2个,因为我们限制了返回数量,代码如下:
5. recursive 参数:调用tag的 find_all() 方法时,BeautifulSoup会检索当前tag的所有子孙节点,如果只想搜索tag的直接子节点,可以使用参数 recursive=False
find( name , attrs , recursive , text , **kwargs )
它与 find_all() 方法唯一的区别是 find_all() 方法的返回结果是值包含一个元素的列表,而 find() 方法直接返回结果,就是直接返回***匹配到的元素,不是列表,不用遍历,如soup.find("p").get("class")
通过标签名查找
通过类名查找
通过id名查找
组合查找
学过 css 的都知道 css 选择器,如 p #link1 是查找 p 标签下的 id 属性为 link1 的标签
属性查找
查找时还可以加入属性元素,属性需要用中括号括起来,注意属性和标签属于同一节点,所以中间不能加空格,否则会无法匹配到。
同样,属性仍然可以与上述查找方式组合,不在同一节点的空格隔开,同一节点的不加空格,代码如下:
以上的 select 方法返回的结果都是列表形式,可以遍历形式输出,然后用 get_text() 方法来获取它的内容
- soup = BeautifulSoup(html, 'lxml')
- print type(soup.select('title'))
- print soup.select('title')[0].get_text()
- for title in soup.select('title'):
- print title.get_text()
当前文章:Python爬虫之BeautifulSoup
URL标题:http://www.csdahua.cn/qtweb/news8/302758.html
网站建设、网络推广公司-快上网,是专注品牌与效果的网站制作,网络营销seo公司;服务项目有等
声明:本网站发布的内容(图片、视频和文字)以用户投稿、用户转载内容为主,如果涉及侵权请尽快告知,我们将会在第一时间删除。文章观点不代表本网站立场,如需处理请联系客服。电话:028-86922220;邮箱:631063699@qq.com。内容未经允许不得转载,或转载时需注明来源: 快上网