Python简易网络爬虫开发————小白也能轻松开发
import requests
from bs4 import BeautifulSoup
# 获取网页内容的函数
def get_html(url):
try:
response = requests.get(url)
if response.status_code == 200:
return response.text
else:
return "网页获取失败"
except requests.RequestException:
return "发生错误"
# 解析网页并提取信息的函数
def parse_html(html):
soup = BeautifulSoup(html, 'html.parser')
# 假设我们要提取所有的段落文本
paragraphs = soup.find_all('p')
return [p.get_text() for p in paragraphs]
# 主函数,组装URL并调用函数
def main(url):
html = get_html(url)
paragraphs = parse_html(html)
for p in paragraphs:
print(p)
# 用例
if __name__ == "__main__":
url = "https://www.example.com" # 替换为你想爬取的网页
main(url)
这段代码提供了一个简易的网络爬虫示例,包括了网页内容的获取和解析。在这个例子中,我们使用了requests库来获取网页内容,使用BeautifulSoup来解析HTML并提取信息。这个例子假设我们要提取所有段落标签内的文本,并将其打印输出。开发者可以根据自己的需求修改这些函数,以提取不同的网页内容。
评论已关闭