用户:储明宇查看:4 回复:2 评论:4 创建时间:2024-08-27T13:28:03
【作品展示】

【作品介绍】
网络爬虫
【作品源代码】
import requests
from bs4 import BeautifulSoup
# 定义要爬取的网页 URL
url = "https://www.example.com"
# 发送 HTTP 请求获取网页内容
response = requests.get(url)
# 检查请求是否成功
if response.status_code == 200:
# 使用 BeautifulSoup 解析网页内容
soup = BeautifulSoup(response.text, 'html.parser')
# 在这里可以根据网页结构提取特定的信息
# 例如,提取所有的标题标签
titles = soup.find_all('h1')
for title in titles:
print(title.text)
else:
print(f"请求失败,状态码:{response.status_code}")
【提示】
部分含有Python第三方库相关内容的作品,在海龟编辑器网页端无法运行哦!如遇到这种情况,可以打开下面的链接,下载海龟编辑器客户端:
https://python.codemao.cn
lgz11111.在猫站,外部网站的链接会被屏蔽,所以,请用字符串拆成两个并用加号拼接如:
url="https:/"+"/shequ.cod喵/"
2.能不能考虑一下用python低版本的用户,用
f""
格式字符串的方法如
f"请求失败,状态码:{response.status_code}"
只有3.6以上版本可以使用,比如我用3.11的就用不了
3.猫站的数据显然不在网页本身里面而是后期加载的
点赞0
评论
pon加个headers请求头,不然大部分网站进不去。如果加上user-agent还是不行的话把cookie也加上
headers = {
"user-agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KH喵L, like Gecko) Chrome/128.0.0.0 Safari/537.36 Edg/128.0.0.0"
}点赞0
评论