Python常用模块 之 urllib&&urllib3 【爬虫库】
urllib
和urllib3
都是Python中用于处理URL的模块,但它们有一些区别。
urllib
是Python自带的库,包含了几个用于操作URL的模块。urllib.request
用于打开和读取URLs,urllib.parse
用于解析URLs,urllib.error
包含了由于网络操作产生的异常。
urllib3
是一个专门用于HTTP客户端的模块,它提供了更高级的功能,比如并发请求、会话处理等。
以下是使用urllib.request
获取网页内容的简单例子:
import urllib.request
# 打开一个URL
response = urllib.request.urlopen('http://www.example.com')
# 读取网页内容
html = response.read()
# 解码网页内容(如果网页使用UTF-8编码)
html_decoded = html.decode('utf-8')
print(html_decoded)
使用urllib3
的例子:
import urllib3
# 创建一个PoolManager实例
http = urllib3.PoolManager()
# 发送一个GET请求
response = http.request('GET', 'http://www.example.com')
# 读取响应内容
html = response.data
# 解码内容
html_decoded = html.decode('utf-8')
print(html_decoded)
在实际应用中,如果只是需要进行简单的HTTP请求,推荐使用urllib.request
。如果需要更高级的功能,比如并发请求、请求重试等,则推荐使用urllib3
。
评论已关闭