用户:
TimeLinkForever查看:7 回复:3 评论:7 创建时间:2020-02-13T19:54:23
爬虫其实很好玩,可以下饭……哈,delicous
你:呕!
哔————————————————
舌尖上的爬虫
首先,准备好配料,放在配料带备用
#从urllib过滤出request,再拿bs4商店的美丽的汤放入碗中备用。
from urllib import request
from bs4 import BeautifulSoup
现在,是时候开火了。
#把网站放入锅中,开火
cont = request.urlopen("http://www.喵/s?wd=kj/")
要把握好精准的火候就要用到read(),否则会变得一团糟
cont = cont.read()
#获取html代码
要知道,一碗好的爬虫汤,必须使用BeautifulSoup
soup = BeautifulSoup(cont,'html.parser',from_encoding = "gbk")
''' ^ ^ ^
| | |
html代码 解析器 解析网页时的编码'''
接下来,就能开吃了。
要想在汤里找到所有好吃的,就要用到find和find_all()
a = soup.find("a")
#在汤里找a标签1次
print(a['href'])
#打印找到的a标签的href属性!
b = soup.find_all("a")
#找到所有a标签返回列表
for link in b:
print(link['href'])
#轮流打印找到的每一个a标签的·href属性
要想知道碗上的文字,就要get_text()了。
a = find('a')
print(a.get_text())
#打印标签的文字
#ps:标签的文字是2个标签中间的东西,比如get_text()从<a href=链接>233</a>能弄到233
汤喝完了,就让我们放下碗筷走人!
采访:
记者:爬虫汤好喝吗?
受采访者:呕……咳咳……(倒在地上)
现在,做一碗美味的爬虫把!
呕~~~~~