python爬虫爬取音乐-JS逆向爬虫
要实现对音乐平台(如网易云音乐)通过JavaScript动态渲染的数据的爬取,可以使用Selenium工具配合ChromeDriver来模拟人的行为进行数据抓取。以下是一个简单的示例代码:
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.common.keys import Keys
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
import time
# 设置ChromeDriver的路径
chrome_driver_path = 'path/to/your/chromedriver'
# 配置ChromeDriver
options = webdriver.ChromeOptions()
options.add_argument('--headless') # 如果你不需要看到浏览器窗口,可以启用无头模式
# 初始化WebDriver
driver = webdriver.Chrome(executable_path=chrome_driver_path, options=options)
# 打开网易云音乐的登录页面
driver.get('https://music.163.com/')
# 等待登录按钮可点击
login_button = WebDriverWait(driver, 10).until(
EC.element_to_be_clickable((By.CSS_SELECTOR, '.u-login'))
)
# 点击登录按钮
login_button.click()
# 输入账号和密码
username_input = driver.find_element_by_id('u-name')
password_input = driver.find_element_by_id('u-pass')
username_input.send_keys('your_username')
password_input.send_keys('your_password')
# 点击登录按钮
login_button = driver.find_element_by_id('u-loginbtn')
login_button.click()
# 等待登录后的页面加载完成
play_button = WebDriverWait(driver, 10).until(
EC.presence_of_element_located((By.CSS_SELECTOR, '.play-btn'))
)
# 模拟播放音乐
play_button.click()
# 获取音乐信息
# 假设音乐信息是通过JavaScript动态加载的,我们可以通过JavaScript注入获取数据
music_info = driver.execute_script('return document.querySelector(".play-bar").innerText')
print(music_info)
# 关闭浏览器
driver.quit()
请注意,这个示例代码仅用于演示如何使用Selenium进行基本的网页操作和JavaScript注入。在实际应用中,你需要根据目标网站的具体情况调整选择器、等待条件和JavaScript注入的代码。同时,确保你的ChromeDriver版本与你的Chrome浏览器版本兼容,且有正确的路径。
评论已关闭