Python 实现网络爬虫_基本要求 自己选择一个网站,用python语言编写一个爬虫程序,将其网站中的文字、图
以下是一个简单的Python网络爬虫示例,使用requests
库获取网页内容,并使用BeautifulSoup
库解析HTML。
首先,需要安装必要的库(如果尚未安装的话):
pip install requests beautifulsoup4
以下是爬虫的示例代码:
import requests
from bs4 import BeautifulSoup
# 目标网页URL
url = 'http://example.com'
# 发送HTTP请求
response = requests.get(url)
# 检查请求是否成功
if response.status_code == 200:
# 使用BeautifulSoup解析网页内容
soup = BeautifulSoup(response.text, 'html.parser')
# 提取网页内容
# 例如,提取标题
title = soup.title.text
print(title)
# 您可以根据需要提取其他内容,如段落、链接等
# 例如,提取所有段落文本
paragraphs = soup.find_all('p')
for p in paragraphs:
print(p.text)
else:
print("网页请求失败,状态码:", response.status_code)
# 注意:具体提取哪些内容取决于你需要爬取的网站的具体结构
确保替换url
变量的值为你想要爬取的网站的URL。根据目标网站的结构,你可能需要调整提取内容的方法。这个例子提取了网页标题和段落文本,你可以根据需要进行修改。
评论已关闭