利用Python封装爬虫完美采集拼多多商品详情数据 + 商品列表数据 + 商品优惠券数据(支持全网)
为了保证答案的精简,以下是一个简化版的代码实例,展示如何使用Python爬取拼多多上的商品详情数据、商品列表数据以及商品优惠券数据。
import requests
from pyquery import PyQuery as pq
# 请求头部信息,模拟浏览器访问
headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.3'}
# 获取商品详情页的数据
def get_item_details(item_url):
try:
response = requests.get(item_url, headers=headers)
if response.status_code == 200:
doc = pq(response.text)
# 提取商品详情页的数据,例如商品标题、价格等
title = doc('.product-title').text()
price = doc('.price').text()
return {
'title': title,
'price': price
}
except requests.exceptions.RequestException:
return None
# 获取商品列表页的数据
def get_item_list(list_url):
try:
response = requests.get(list_url, headers=headers)
if response.status_code == 200:
doc = pq(response.text)
# 提取商品列表页的数据,例如商品链接等
items = doc('.item').items()
for item in items:
item_url = item('.pic').attr('href')
yield item_url
except requests.exceptions.RequestException:
return None
# 获取商品优惠券数据
def get_item_coupons(item_url):
try:
response = requests.get(item_url, headers=headers)
if response.status_code == 200:
doc = pq(response.text)
# 提取商品优惠券数据
coupons = doc('.coupon-item').items()
for coupon in coupons:
title = coupon('.coupon-title').text()
condition = coupon('.coupon-rule').text()
yield {
'title': title,
'condition': condition
}
except requests.exceptions.RequestException:
return None
# 使用示例
if __name__ == '__main__':
item_url = 'https://www.tmall.com/item.htm?id=525388747711'
list_url = 'https://list.tmall.com/search_product.htm?q=%E5%B0%8F%E7%B1%B3'
# 获取商品详情数据
item_details = get_item_details(item_url)
print(item_details)
# 获取商品列表中的所有商品链接
for item_url in get_item_list(list_url):
print(item_url)
# 获取商品优惠券数据
for coupon in get_item_coupons(item_url):
print(coupon)
这段代码展示了如何使用Python爬取网页数据。首先定义了请求头部信息,模拟
评论已关闭