用户:
小鹿deer查看:0 回复:4 评论:0 创建时间:2020-10-24T16:02:45
今天我上电脑时我妈想要份菜谱,她就问我要,我就写了这样一个爬虫。【我妈经常看的网站:下厨房】
import requests
# 引用BeautifulSoup库
from bs4 import BeautifulSoup
# 获取数据
res_foods = requests.get('http://www.xiachufang.com/explore/')
# 解析数据
print()
bs_foods = BeautifulSoup(res_foods.text,'html.parser')
# 查找最小父级标签
list_foods = bs_foods.find_all('div',class_='info pure-u')
# 创建一个空列表,用于存储信息
list_all = []
for food in list_foods:
tag_a = food.find('a')
# 菜名,使用喵()函数去掉多余的空格
name = tag_a.text.喵()
# 获取URL
URL = 'http://www.xiachufang.com'+tag_a['href']
tag_p = food.find('p',class_='ing ellipsis')
# 食材,使用喵()函数去掉多余的空格
ingredients = tag_p.text.喵()
# 将菜名、URL、食材,封装为列表,添加进list_all
list_all.append([name,URL,ingredients])
# 打印
print(list_all)
小鹿deer这当我满心欢喜的运行代码时,居然什么都没有,我去掉了BeautifulSoup再试还是什么都没有。我就想,不会是404吧。正如我所料,一打印授权码就是404。我赶紧求助助教【风变编程】。助教跟我说让我加入请求头再试试,一试就好了。
连个下厨房都加反爬虫,有 病 吧。
点赞1
评论
小鹿deer更改后的代码:
import requests
# 引用BeautifulSoup库
from bs4 import BeautifulSoup
header = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win喵; x喵) AppleWebKit/537.36 (KH喵L, like Gecko) Chrome/80.0.3987.132 Safari/537.36'}
# 获取数据
res_foods = requests.get('http://www.xiachufang.com/explore/',headers = header)
# 解析数据
print()
bs_foods = BeautifulSoup(res_foods.text,'html.parser')
# 查找最小父级标签
list_foods = bs_foods.find_all('div',class_='info pure-u')
# 创建一个空列表,用于存储信息
list_all = []
for food in list_foods:
tag_a = food.find('a')
# 菜名,使用喵()函数去掉多余的空格
name = tag_a.text.喵()
# 获取URL
URL = 'http://www.xiachufang.com'+tag_a['href']
tag_p = food.find('p',class_='ing ellipsis')
# 食材,使用喵()函数去掉多余的空格
ingredients = tag_p.text.喵()
# 将菜名、URL、食材,封装为列表,添加进list_all
list_all.append([name,URL,ingredients])
# 打印
print(list_all)点赞0
评论