Python简易网络爬虫开发————小白也能轻松开发

作者：System 时间：2024年08月19日分类：所有,爬虫字数：906

这篇文章距离上次修改已过706天，其中的内容可能已经有所变动。




import requests
from bs4 import BeautifulSoup
 
# 获取网页内容的函数
def get_html(url):
    try:
        response = requests.get(url)
        if response.status_code == 200:
            return response.text
        else:
            return "网页获取失败"
    except requests.RequestException:
        return "发生错误"
 
# 解析网页并提取信息的函数
def parse_html(html):
    soup = BeautifulSoup(html, 'html.parser')
    # 假设我们要提取所有的段落文本
    paragraphs = soup.find_all('p')
    return [p.get_text() for p in paragraphs]
 
# 主函数，组装URL并调用函数
def main(url):
    html = get_html(url)
    paragraphs = parse_html(html)
    for p in paragraphs:
        print(p)
 
# 用例
if __name__ == "__main__":
    url = "https://www.example.com"  # 替换为你想爬取的网页
    main(url)

这段代码提供了一个简易的网络爬虫示例，包括了网页内容的获取和解析。在这个例子中，我们使用了requests库来获取网页内容，使用BeautifulSoup来解析HTML并提取信息。这个例子假设我们要提取所有段落标签内的文本，并将其打印输出。开发者可以根据自己的需求修改这些函数，以提取不同的网页内容。

Python简易网络爬虫开发————小白也能轻松开发

评论已关闭

推荐阅读