猫史档案馆


【Python作品分享】网络爬虫【作品秀】

用户:储明宇储明宇查看:4 回复:2 评论:4 创建时间:2024-08-27T13:28:03


【作品展示】

center_image

 

【作品介绍】

网络爬虫

 

【作品源代码】

import requests
from bs4 import BeautifulSoup

# 定义要爬取的网页 URL
url = "https://www.example.com"

# 发送 HTTP 请求获取网页内容
response = requests.get(url)

# 检查请求是否成功
if response.status_code == 200:
    # 使用 BeautifulSoup 解析网页内容
    soup = BeautifulSoup(response.text, 'html.parser')

    # 在这里可以根据网页结构提取特定的信息
    # 例如,提取所有的标题标签
    titles = soup.find_all('h1')
    for title in titles:
        print(title.text)
else:
    print(f"请求失败,状态码:{response.status_code}")

 

【提示】

部分含有Python第三方库相关内容的作品,在海龟编辑器网页端无法运行哦!如遇到这种情况,可以打开下面的链接,下载海龟编辑器客户端:

https://python.codemao.cn


回复

上一页1 页 / 共 1下一页
lgz1111lgz1111

1.在猫站,外部网站的链接会被屏蔽,所以,请用字符串拆成两个并用加号拼接如:

url="https:/"+"/shequ.cod喵/"

2.能不能考虑一下用python低版本的用户,用

f""

格式字符串的方法如

f"请求失败,状态码:{response.status_code}"

只有3.6以上版本可以使用,比如我用3.11的就用不了

3.猫站的数据显然不在网页本身里面而是后期加载的

点赞0


评论


ponpon

加个headers请求头,不然大部分网站进不去。如果加上user-agent还是不行的话把cookie也加上

headers = {
    "user-agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KH喵L, like Gecko) Chrome/128.0.0.0 Safari/537.36 Edg/128.0.0.0"
}

点赞0


评论