猫史档案馆


基于requests和lxml制作的起点小说爬虫

用户:咸鱼王06咸鱼王06查看:0 回复:2 评论:0 创建时间:2022-02-11T18:03:48


介于起点小说电脑版无下载选项,而mp4看小说又需要txt文件,本作者便基于requests和lxml制作了这个爬虫,此爬虫无法爬取付费内容章节进行下载,在使用过程中遇到bug还请反馈在回贴上,本人会在周末不定期查看回帖""")

import requests
from lxml import etree
##################################################
# 获取每章小说的链接
def get_url():
    # 小说主页链接
    chapter_url = '在此处输入网址'
    response = requests.get(url=chapter_url)   # 发起数据请求
    data = etree.HT'防屏蔽,删去此处'ML(response.text)   # 解析数据
    chapter_url_list = data.xpath('//a[contains(@href, "//read")]')
    # print(url_list)

    book_url_list = []   # 保存完整链接的列表
    for url in chapter_url_list:
        url_text = url.xpath('./@href')[0]   # 确认标签中链接数据
        chapter_url = 'https:' + url_text   # 进行连接拼接
        book_url_list.append(chapter_url)   # 把完整的链接追加到列表中

    del book_url_list[:3]   # 删除重复的前三项
    return book_url_list

def get_text(url_list):
    for url in url_list:
        response = requests.get(url=url)
        data = etree.HT'防屏蔽,删去此处'ML(response.text)   # 解析数据
        chapter_name = data.xpath('//span[@class="content-wrap"]//text()')
        text_list = data.xpath('//div[@class="read-content j_readContent"]//text()')
        book = ''.join(chapter_name)
        for text in text_list:
            book = book + text + '\n'
        with open('书名,在同目录下要有与此处名字相同的txt文件,此处要加上后缀', 'a', encoding='utf-8') as file:
            file.write(book)
        print('%s下载成功' % chapter_name)

if __name__ == '__main__':
    url_list = get_url()
    get_text(url_list)




回复

上一页1 页 / 共 1下一页
咸鱼王06咸鱼王06

自古一楼不简单

点赞1


评论


zx某zx某

收藏

 

点赞0


评论