Python常用模块之 urllib&&urllib3 【爬虫库】

作者：System 时间：2024年08月16日分类：所有,爬虫字数：858

这篇文章距离上次修改已过689天，其中的内容可能已经有所变动。

urllib和urllib3都是Python中用于处理URL的模块，但它们有一些区别。

urllib是Python自带的库，包含了几个用于操作URL的模块。urllib.request用于打开和读取URLs，urllib.parse用于解析URLs，urllib.error包含了由于网络操作产生的异常。

urllib3是一个专门用于HTTP客户端的模块，它提供了更高级的功能，比如并发请求、会话处理等。

以下是使用urllib.request获取网页内容的简单例子：




import urllib.request
 
# 打开一个URL
response = urllib.request.urlopen('http://www.example.com')
 
# 读取网页内容
html = response.read()
 
# 解码网页内容（如果网页使用UTF-8编码）
html_decoded = html.decode('utf-8')
 
print(html_decoded)

使用urllib3的例子：




import urllib3
 
# 创建一个PoolManager实例
http = urllib3.PoolManager()
 
# 发送一个GET请求
response = http.request('GET', 'http://www.example.com')
 
# 读取响应内容
html = response.data
 
# 解码内容
html_decoded = html.decode('utf-8')
 
print(html_decoded)

在实际应用中，如果只是需要进行简单的HTTP请求，推荐使用urllib.request。如果需要更高级的功能，比如并发请求、请求重试等，则推荐使用urllib3。

Python常用模块之 urllib&&urllib3 【爬虫库】

评论已关闭

推荐阅读