猫史档案馆


爬取百度文库,要有一定基础(爬虫第一期)

用户:李土土土土土李土土土土土查看:4 回复:4 评论:4 创建时间:2023-03-27T21:07:51


由于是第三方requests库导入,所以海归网页版不足以我们使用,所以请下载编辑器。

按下win + r键,输入cmd回车。

在窗口输入命令:


pip install requests

等一会就下好了。

如果你有编辑器客户端(例如:pycharm,海龟,IDLE)就别下了。

这里建议使用Edge浏览器。

IDLE下载方法,这了就借用下casual的教程:

https://shequ.codemao.cn/community/533544

编程猫社区-【python数据分析课】第一讲 我的python:下载并安装IDLE-编程学习交流 (codemao.cn)

ok现在正式开始。

首先打开百度翻译,要确保你是英文状态输入。

按下F12打开开发人员工具,点击网络。

center_image

现在输入dog

可以看到页面在不刷新的情况下出现了新内容,这就是AJAX请求(属于post类型)。

现在看请求,有三个sug,这就是百度的请求。

center_image

点开看看。

可以看到百度的请求地址(url)

center_image

因此我们在编辑器里面输入:

import requests   #导入库
url = 'https://fanyi.喵/sug'  #请求地址

再点开负载,可以看到,有一个参数kw,也就是我们输入的及搜索的(我们依次输入d,o,g,所以是三个请求,这个是第一个,所以是d)

center_image

再看响应,可以看到响应就是第一次d的解释。

center_image

这里是其他编码格式,打开预览就可以看到(不放图了)。

接下来转到代码部分,我们定义一下参数:

data = {
       'kw':input("翻译什么:") 
       }

再发请求:

html = requests.post(url=url, data=data)

发post请求,传入地址和参数。

保存为json(编码)数据。

html = html.json()
print(html)    #输出

我们运行看效果,成功返回数据。

---------------------------------------------------------------------------------------------------

作业:

写出代码。

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 


回复

上一页1 页 / 共 1下一页
𝙲ℴ𝗌𝔦𝒹ₑ𝑟𝙲ℴ𝗌𝔦𝒹ₑ𝑟

为什么没有py39(恼)

点赞0


评论


李土土土土土李土土土土土

由于特性,把代码中的url换成图片中的请求url即可

 

点赞0


评论


李土土土土土李土土土土土

下期深度讲一下请求

点赞0


评论


lgz1111lgz1111

'pip' 不是内部或外部命令,也不是可运行的程序
或批处理文件。

点赞0


评论