用户:
CDQ黑暗森林查看:0 回复:3 评论:0 创建时间:2024-04-27T11:16:07
大家好 我是黑暗森林 这是我花了将近一个半小时整理出来的 制作不易,给个赞吧 imgsrc="https://static.codemao.cn/emotion/thunder_monkey/%E9%9B%B7%E7%94%B5%E7%8C%B4z.gif"alt="emotion_雷电猴_嗯嗯" 好了,接下来让我们认识一下爬虫两大巨头吧 他们分别是 requests爬虫库bs4解析库 首先,我们先导入一下这两个模块吧 importrequests,bs4 好,让我们获取一下网页代码吧 url='网址' r=requests.get(url) print(r) (以上为获取网页内容代码) gets命令是用来获取的结果是这样的:<Response[状态码*]>*这玩意是200是正常的,其他的都有毛病 变量r后面跟status_code就是获取状态吗而text获取网页源码例子: print(r.status_code) 或 print(r.text) 如果想要带要求请求就要在前面加一个输入命令如下: keywoed*=input('#') #里面可以填任意提示语 而keyword这个变量名是可以变的,但下面和它相应的变量也要变更 好了接下来我们就要用bs4解析库了第一个命令是BeautifulSoup它的作用是用来解析网页的 注意事项(一定要看!!):这条命令是有返回值的所以要用一个变量把它保存起来 完整代码如下: soup=bs4.BeautifulSoup(变量名.text,'html.parser') 但这样会找到一大堆不相关的东西所以 我们要怎么办呢? imgsrc="https://static.codemao.cn/emoji/codemao/%E7%BC%96%E7%A8%8B%E7%8C%AB_%E7%B4%A7%E5%BC%A0.gif"alt="emotion_编程猫_紧张" 我们就要用到另一个命令了find命令 它的用法是这样的: 用前注意事项(一定要看!!):这条命令是有返回值的所以要用一个变量把它保存起来 data=soup.find('div',class_='search-content') 注:上面的语句中,soup是你用来保存解析出的html代码的变量。所以用来保存解析结果的变量要与find命令前的变量名相同!(不然会报错) 然后解析出来的东西就是你想要的东西了。 好了今天的教程就到这先了下次再见吧。 886 imgsrc="https://static.codemao.cn/emoji/codemao/%E7%BC%96%E7%A8%8B%E7%8C%AB_%E5%8A%A0%E6%B2%B9.gif"alt="emotion_编程猫_加油"