Lv.1
在 有谁会爬虫吗 中回复
爬虫简单来说有两部分构成
1.请求网络(一般遵循http协议(基于T喵协议))
请求一般的网站用
import requests # pip install requests
res = requests.get('网址') # 这里面res是请求的结果(result)
获取请求后网页的内容(一般为html)
res.text
接下来就可以拿这些内容做处理
2.处理
处理内容,通常使用re(正则表达式)模块。
如获得<p>标签的内容
re.findall("<p>(.*?)</p>", res.text, re.S)
(.*?)放在要获取的内容上
如何知道内容在哪个标签里呢?
1.打开浏览器的开发者人员模式
2.点击左上角的光标图标
3.选择内容的位置,从这个内容的代码上就可以看出它的标签
2022-01-26T20:24:54 点赞:1