基于scrapy的豆瓣阅读top250爬虫
warning:
这篇文章距离上次修改已过200天,其中的内容可能已经有所变动。
以下是一个简化版的豆瓣阅读Top250的Scrapy爬虫示例:
import scrapy
class DoubanSpider(scrapy.Spider):
name = 'douban'
allowed_domains = ['douban.com']
start_urls = ['https://book.douban.com/subject/1084336/reviews']
def parse(self, response):
# 提取每本书的评分和评论链接
for review in response.css('div.review-item'):
item = {
'score': review.css('span.rating_nums::text').extract_first(),
'link': review.css('div.info a::attr(href)').extract_first(),
}
yield item
# 提取下一页链接并进行爬取
next_page_url = response.css('span.next a::attr(href)').extract_first
if next_page_url:
yield response.follow(next_page_url, self.parse)
这个爬虫定义了一个名为douban
的Spider,它将从豆瓣阅读的Top250书籍评论页面开始爬取,提取每条评论的评分和链接,并且如果有下一页,它会递归地爬取下一页的评论。这个例子演示了如何使用Scrapy框架的基本结构来进行爬取工作。
评论已关闭