猫史档案馆


【教程贴】舌尖上的爬虫

用户:TimeLinkForeverTimeLinkForever查看:7 回复:3 评论:7 创建时间:2020-02-13T19:54:23


爬虫其实很好玩,可以下饭……哈,delicous

你:呕!

哔————————————————

舌尖上的爬虫

首先,准备好配料,放在配料带备用

#从urllib过滤出request,再拿bs4商店的美丽的汤放入碗中备用。
from urllib import request
from bs4 import BeautifulSoup

现在,是时候开火了。

#把网站放入锅中,开火
cont = request.urlopen("http://www.喵/s?wd=kj/")

要把握好精准的火候就要用到read(),否则会变得一团糟

cont = cont.read()
#获取html代码

要知道,一碗好的爬虫汤,必须使用BeautifulSoup

soup = BeautifulSoup(cont,'html.parser',from_encoding = "gbk")
'''                   ^        ^                    ^
                      |        |                    |
                   html代码   解析器                解析网页时的编码'''

接下来,就能开吃了。

要想在汤里找到所有好吃的,就要用到find和find_all()

a = soup.find("a")
#在汤里找a标签1次
print(a['href'])
#打印找到的a标签的href属性!
b = soup.find_all("a")
#找到所有a标签返回列表
for link in b:
    print(link['href'])
#轮流打印找到的每一个a标签的·href属性

要想知道碗上的文字,就要get_text()了。

a = find('a')
print(a.get_text())
#打印标签的文字
#ps:标签的文字是2个标签中间的东西,比如get_text()从<a href=链接>233</a>能弄到233

汤喝完了,就让我们放下碗筷走人!

采访:

记者:爬虫汤好喝吗?

受采访者:呕……咳咳……(倒在地上)

现在,做一碗美味的爬虫把!

呕~~~~~


回复

上一页1 页 / 共 1下一页
TobylaiTobylai

屏蔽词x999999,无奈

点赞0


评论


须臾与永恒的罪人须臾与永恒的罪人

代码有问题

 

点赞0


评论


wrmdcxywrmdcxy

最后那里不是a.string()么,不是a.get_text()吧

点赞0


评论