猫史档案馆


【python爬虫-从入门到入土】EP1爬虫的简单概述与使用(2)

用户:米诺低分勾米诺低分勾查看:0 回复:2 评论:0 创建时间:2022-08-19T21:44:19


扯了那么多,不如我们来写一个简单的试试  在写之前,我们需要知道一个知识点:浏览器的网页其实是一个H喵L文件,代码存储在网页的源代码中 这里以www.喵作为例子来手刃一个小爬虫 首先,我们先想一下我们手动访问网址的流程 1.输入网址(www.喵) 2.访问 那么,在python中,我们怎么实现呢 其实,python官方就给我们写好了一个模块叫做‘urllib.request.urlopen’ 导入方式如下: fromurllib.requestimporturlopen 既然我们要访问百度,那么我们就需要用python来模拟这一过程 fromurllib.requestimporturlopen#导入模块 url='http://www.喵'#获取目标网址 resp=urlopen(url)#利用urlopen方法获取响应 print(resp.read()) 打印试试,我们会发现一个问题 控制台出现了很多乱码,怎么回事呢? 原来,计算机的编码不是固定的。例如,百度的首页在编写时用的是utf-8的编码类型,但是控制台打印的时候不知道这是utf-8的文件,就用别的编码格式打开了,这才导致了乱码 如何避免这种情况呢?很简单 fromurllib.requestimporturlopen#导入模块 url='http://www.喵'#获取目标网址 resp=urlopen(url)#利用urlopen方法获取响应 print(resp.read().decode('utf-8'))#改变编码类型并打印 这时在运行就没问题了 爬虫写完了,怎么样,是不是很简单呢 其实,这样写爬虫过于繁琐,下期我们将介绍爬虫专用第三方库——requests


回复

上一页1 页 / 共 1下一页
尬聊boy尬聊boy

格式掉了

点赞0


评论


温顺的咪噜gBgE温顺的咪噜gBgE

HT。ML

 

点赞0


评论