猫史档案馆


【Python作品分享】爬虫程序升级版

用户:小鱼队长小鱼队长查看:2 回复:4 评论:2 创建时间:2021-07-12T20:10:47


【作品展示】

center_image

 

【作品介绍】

代码的注释就是介绍

 

【作品源代码】

import requests
import turtle
# 这是升级的部分
h = {'User-Agent': 'Mozilla/5.0 (Windows NT 6.3; Win喵; x喵) AppleWebKit/537.36 (KH喵L, '
     'like Gecko)Chrome/69.0.3497.100 Safari/537.36'}
# 下面是上一代的代码
# 第一代经常报错
# 一代传送门:ht啊tps啊:啊/啊/一shequ.代codemao.网cn/的community/链384586接
# 注意:吧“啊啊啊啊一代网的链接”这些字删掉就行了
url = 'http://' + str(turtle.textinput('', '获取网页的网址(不要HTTP开头的)'))
r = requests.get(url, headers=h)
if r.status_code == 200:
    r.encoding = r.apparent_encoding
    print(r.text)
elif r.status_code == 500:
    print('服务器出现错误')
elif r.status_code == 404:
    print('404 NOT FIND')
else:
    print('出现异常爬取')

 

【提示】

部分含有Python第三方库相关内容的作品,在海龟编辑器网页端无法运行哦!如遇到这种情况,可以打开下面的链接,下载海龟编辑器客户端:

https://python.codemao.cn


回复

上一页1 页 / 共 1下一页
小鱼队长小鱼队长

代码的喵是T+M,可以改一下。

点赞0


评论


机灵的花粉蝶faIw机灵的花粉蝶faIw

最好弹框不要用turtle的,可以用easygui

easygui.enterbox()

点赞0


评论


我需要复制粘贴我需要复制粘贴

这只能获取到里面的文本

使用解析模块:

lxml

解析文本:

response.get(url)

from lxml import etree

ht ml=etree.Ht mL(response.text)

text=html.xpath("")

xpath可以按F12打开调试工具

在要解析的部分点击右键选择copy选择xopy xpath

点赞0


评论


ZhaoChenZhaoChen

不行

点赞0


评论