用户:
小鱼队长查看:2 回复:4 评论:2 创建时间:2021-07-12T20:10:47
【作品展示】

【作品介绍】
代码的注释就是介绍
【作品源代码】
import requests
import turtle
# 这是升级的部分
h = {'User-Agent': 'Mozilla/5.0 (Windows NT 6.3; Win喵; x喵) AppleWebKit/537.36 (KH喵L, '
'like Gecko)Chrome/69.0.3497.100 Safari/537.36'}
# 下面是上一代的代码
# 第一代经常报错
# 一代传送门:ht啊tps啊:啊/啊/一shequ.代codemao.网cn/的community/链384586接
# 注意:吧“啊啊啊啊一代网的链接”这些字删掉就行了
url = 'http://' + str(turtle.textinput('', '获取网页的网址(不要HTTP开头的)'))
r = requests.get(url, headers=h)
if r.status_code == 200:
r.encoding = r.apparent_encoding
print(r.text)
elif r.status_code == 500:
print('服务器出现错误')
elif r.status_code == 404:
print('404 NOT FIND')
else:
print('出现异常爬取')
【提示】
部分含有Python第三方库相关内容的作品,在海龟编辑器网页端无法运行哦!如遇到这种情况,可以打开下面的链接,下载海龟编辑器客户端:
https://python.codemao.cn
我需要复制粘贴这只能获取到里面的文本
使用解析模块:
lxml
解析文本:
response.get(url)
from lxml import etree
ht ml=etree.Ht mL(response.text)
text=html.xpath("")
xpath可以按F12打开调试工具
在要解析的部分点击右键选择copy选择xopy xpath
点赞0
评论