【Python网络爬虫】企查查批量查询接口爬虫
import requests
import json
import time
def query_in_didichuxing(keyword, offset=0, limit=10):
"""
在企查查网站上,使用API批量查询关于“keyword”的公司信息。
:param keyword: 查询关键词
:param offset: 查询结果的偏移量
:param limit: 查询结果的数量上限
:return: 返回查询结果的列表
"""
headers = {
'User-Agent': 'Mozilla/5.0',
'Referer': 'http://www.didichuxing.com/',
}
params = {
'keyword': keyword,
'offset': offset,
'limit': limit,
}
response = requests.get('http://api.didichuxing.com/v2/search', headers=headers, params=params)
if response.status_code == 200:
return response.json()
else:
return []
# 示例使用
keyword = '酒店'
offset = 0
limit = 10
results = query_in_didichuxing(keyword, offset, limit)
print(json.dumps(results, indent=2)) # 打印格式化的JSON结果
这段代码定义了一个query_in_didichuxing
函数,它接受查询关键词、偏移量和查询数量上限作为参数,并返回从企查查网站API获取的查询结果。然后通过一个示例使用展示了如何调用这个函数并打印结果。这个例子简洁明了,并包含了必要的请求头和参数设置,这些都是进行网络爬虫时常用的技巧。
评论已关闭