用户:
米诺低分勾查看:0 回复:1 评论:0 创建时间:2022-08-19T20:39:27
爬虫,游离在互联网灰色地带的神秘力量,如东厂锦衣卫,来无影,去无踪,却能轻松抓取各路小道消息。。。。
以上为笔者中二魅力时刻,请自动忽略(
不如让我们先举几个例子
1.看到一些奇特的劲爆视频时,总想留在硬盘里慢慢品鉴
2.浏览到一些重要数据时,总想要保存下来日后使用
3.在看到几张令人心跳加速的图片时,总想保存起来当做壁纸
这时,爬虫便是实现上述功能的不二之选
爬虫与python
看到这里,你可能要想:“爬虫是个啥啊”
简单来说,爬虫就是通过程序向某个网站发送请求,然后获取数据的一类工具 当然可以实现爬虫的语言不止python,像JAVA,C++,C语言都可以实现爬虫功能。但是,python是这些编程语言中最简洁,最好用的一门语言,同他来写爬虫也比其他语言方便
爬虫的合法性
爬虫虽然功能强大,但也不能随意滥用。2021年6月3日,两名犯罪分子(一个老板,一个程序员)爬取了淘宝近11亿8千万条数据。数据涉及到用户uid,淘宝昵称,用户手机号等敏感信息。两人都以侵犯喵信息罪被判处3年6个月,3年3个月。 但是,爬虫是一把双刃剑,正确的利用它也是可以给社会带来便利的
对于我们初学者来讲,把自己搞到橘子里肯定不至于
爬虫的矛与盾
1.反爬机制 一些网站会建立某种机制或程序来抵御爬虫
2.反反爬机制 一些爬虫会运用一些手段绕过反爬机制来获取数据 (由此也催生出了反反反爬,反反反反爬......)
3.robots.txt君子协议 俗话说得好,防君子不防小人,一些网站设立了君子协议来规定爬虫可爬取的数据

图为b站的robots协议
OK,关于爬虫就讲到这里,下一篇文章将会讲解爬虫的具体使用