猫史档案馆


爬虫使用http代理需注意的问题

用户:LaicalLaical查看:0 回复:0 评论:0 创建时间:2020-01-02T17:28:03


很多时候,提起来爬虫,很多人的第一感觉就是很炫酷,想象中的情景也是互联网大神一手敲代码一手修bug,但是实际上做网络爬虫难度重重,很不容易,很多时候辛辛苦苦写了代码,各种纷杂的数据也分门别类保存好,眼看着就要完成了,结果因为各种突发意外,前功尽弃,又要从头开始。

几乎每一个网站都会设置自己的防爬机制,防爬机制在很大程度上可以防止恶意竞争和恶意的信息采集,但是很多时候也会误伤,明明很小心,但是还是有可能被防爬机制发现,所以想办法绕开或者突破防爬机制是很重要的工作。header检验是最简单的防爬机制,用于检查HTTP请求的header信息,包括User-AgentRefererCookies等。

1User-Agent是检查用户所用客户端种类和版本。解决办法是使用浏览器UA代码伪装浏览器信息。

2Referer是检查此请求由哪里来,通常可以做图片的盗链判断。解决办法是通过代码伪造一个来源地址。

3Cookies是检查sessionID的使用次数,如果超过限制,就会触发防爬机制。解决办法是降低访问频率或者使用稳定网络资源地址。

想要做好爬虫不仅要想办法提高效率,也要想办法提高成功率,很多时候由于任务的抓取量很大,想要正常完成爬虫程序,需要大量的网络资源数据来调整当前的网络地址,从而促使爬虫任务的顺利进行。比如说,亿牛云HTTP可以提供大量稳定的网络资源数据,帮助爬虫程序突破限制。


回复

上一页1 页 / 共 0下一页