java文章采集爬虫代码示例,别再说你不会
以下是一个简单的Java文章采集爬虫的代码示例,使用了Jsoup
库来解析网页。
import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.nodes.Element;
import org.jsoup.select.Elements;
public class ArticleCrawler {
public static void main(String[] args) {
String url = "http://example.com"; // 替换为目标网站
try {
Document doc = Jsoup.connect(url).get();
Elements articles = doc.select("article"); // 选择符合条件的文章标签
for (Element article : articles) {
String title = article.select("h1, h2").text(); // 获取标题
String content = article.text(); // 获取内容
System.out.println("标题: " + title);
System.out.println("内容: " + content);
// 可以在这里添加保存到数据库或文件的代码
}
} catch (Exception e) {
e.printStackTrace();
}
}
}
这段代码使用了Jsoup.connect()
方法来发送HTTP请求,并使用CSS选择器来提取页面中的文章信息。你需要替换url
变量的值为你想要采集的目标网站,并根据实际情况调整文章的选择器。
请注意,实际的网站可能会有反爬机制,如cookies、user-agent、IP限制等,你可能需要设置相应的请求头来绕过这些限制。另外,爬取数据时要遵守相关的法律法规,不得侵犯知识产权或造成不良影响。
评论已关闭