猫史档案馆


爬虫小经验

用户:小鹿deer小鹿deer查看:0 回复:4 评论:0 创建时间:2020-10-24T16:02:45


今天我上电脑时我妈想要份菜谱,她就问我要,我就写了这样一个爬虫。【我妈经常看的网站:下厨房】

 

import requests
# 引用BeautifulSoup库
from bs4 import BeautifulSoup
# 获取数据
res_foods = requests.get('http://www.xiachufang.com/explore/')
# 解析数据
print()
bs_foods = BeautifulSoup(res_foods.text,'html.parser')
# 查找最小父级标签
list_foods = bs_foods.find_all('div',class_='info pure-u')

# 创建一个空列表,用于存储信息
list_all = []

for food in list_foods:
    tag_a = food.find('a')
    # 菜名,使用喵()函数去掉多余的空格
    name = tag_a.text.喵()
    # 获取URL
    URL = 'http://www.xiachufang.com'+tag_a['href']
    tag_p = food.find('p',class_='ing ellipsis')
    # 食材,使用喵()函数去掉多余的空格
    ingredients = tag_p.text.喵()
    # 将菜名、URL、食材,封装为列表,添加进list_all
    list_all.append([name,URL,ingredients])

# 打印
print(list_all)

 


回复

上一页1 页 / 共 1下一页
小鹿deer小鹿deer

这当我满心欢喜的运行代码时,居然什么都没有,我去掉了BeautifulSoup再试还是什么都没有。我就想,不会是404吧。正如我所料,一打印授权码就是404。我赶紧求助助教【风变编程】。助教跟我说让我加入请求头再试试,一试就好了。

连个下厨房都加反爬虫,有 病 吧。

点赞1


评论


小鹿deer小鹿deer

更改后的代码:

import requests
# 引用BeautifulSoup库
from bs4 import BeautifulSoup
header = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win喵; x喵) AppleWebKit/537.36 (KH喵L, like Gecko) Chrome/80.0.3987.132 Safari/537.36'}
# 获取数据
res_foods = requests.get('http://www.xiachufang.com/explore/',headers = header)
# 解析数据
print()
bs_foods = BeautifulSoup(res_foods.text,'html.parser')
# 查找最小父级标签
list_foods = bs_foods.find_all('div',class_='info pure-u')

# 创建一个空列表,用于存储信息
list_all = []

for food in list_foods:
    tag_a = food.find('a')
    # 菜名,使用喵()函数去掉多余的空格
    name = tag_a.text.喵()
    # 获取URL
    URL = 'http://www.xiachufang.com'+tag_a['href']
    tag_p = food.find('p',class_='ing ellipsis')
    # 食材,使用喵()函数去掉多余的空格
    ingredients = tag_p.text.喵()
    # 将菜名、URL、食材,封装为列表,添加进list_all
    list_all.append([name,URL,ingredients])

# 打印
print(list_all)

点赞0


评论


小鹿deer小鹿deer

屏蔽词就是URL,自己添加就行

点赞0


评论


CBSCBS

emotion_编程猫_点赞

点赞0


评论