用户:Laical查看:0 回复:0 评论:0 创建时间:2020-01-16T16:32:12
爬虫现在被更多的企业和个人所利用,在使用工具解析到网页上的数据后,要想办法把数据存储起来,这也是网络爬虫的最后一步。在最近一段时间学习网络爬虫的过程中,一直想写点东西介绍一下网络爬虫数据存储方面的内容,今天就介绍网络爬虫中数据存储的三种常用方式及其python实现,三种常见方式分别是:txt文件、MySQL数据库、excel文件。
1 将数据存储到txt文件
将数据写入到txt文件或csv文件中的方法有很多,这里介绍两种比较常用的方法:
1.1 以数组的方式将数据存储到txt文件
以数组的方式将爬取到的数据写入到txt文件,是将数据存放在一维或二维数组中,然后使用numpy.savetxt()方法将数据写入到txt文件。
1.2 以列表的形式将数据存储到txt文件
以列表的方式将爬取到的数据存储到.txt文件中,是通过两层for循环遍历列表元素实现的。
2 将数据存储到MySQL数据库中
将爬取到的数据存储到数据库中,关键在于数据库中数据表的正确创建以及python程序中SQL语句的正确书写。在数据库中创建数据表,可以使用以下两种方式:设计表、新建查询,
3 将数据存储到excel文件中
将爬取到的数据存储到excel文件中的做法和将数据存储到txt文件中类似,也是通过两层for循环实现。
当然了,无论使用哪种爬虫手段爬取数据,同一个IP频繁操作,必然会导致IP受限,不过现在这也不算问题,因为亿牛云http代理都可以解决这个问题。先解决爬取,再了解如何存储,才是真的学会了如何爬虫。