用户:咸鱼王06查看:0 回复:2 评论:0 创建时间:2022-02-11T18:03:48
介于起点小说电脑版无下载选项,而mp4看小说又需要txt文件,本作者便基于requests和lxml制作了这个爬虫,此爬虫无法爬取付费内容章节进行下载,在使用过程中遇到bug还请反馈在回贴上,本人会在周末不定期查看回帖""")
import requests
from lxml import etree
##################################################
# 获取每章小说的链接
def get_url():
# 小说主页链接
chapter_url = '在此处输入网址'
response = requests.get(url=chapter_url) # 发起数据请求
data = etree.HT'防屏蔽,删去此处'ML(response.text) # 解析数据
chapter_url_list = data.xpath('//a[contains(@href, "//read")]')
# print(url_list)
book_url_list = [] # 保存完整链接的列表
for url in chapter_url_list:
url_text = url.xpath('./@href')[0] # 确认标签中链接数据
chapter_url = 'https:' + url_text # 进行连接拼接
book_url_list.append(chapter_url) # 把完整的链接追加到列表中
del book_url_list[:3] # 删除重复的前三项
return book_url_list
def get_text(url_list):
for url in url_list:
response = requests.get(url=url)
data = etree.HT'防屏蔽,删去此处'ML(response.text) # 解析数据
chapter_name = data.xpath('//span[@class="content-wrap"]//text()')
text_list = data.xpath('//div[@class="read-content j_readContent"]//text()')
book = ''.join(chapter_name)
for text in text_list:
book = book + text + '\n'
with open('书名,在同目录下要有与此处名字相同的txt文件,此处要加上后缀', 'a', encoding='utf-8') as file:
file.write(book)
print('%s下载成功' % chapter_name)
if __name__ == '__main__':
url_list = get_url()
get_text(url_list)