我的编程空间,编程开发者的网络收藏夹
学习永远不晚

Java 实现网络爬虫框架详细代码

短信预约 -IT技能 免费直播动态提醒
省份

北京

  • 北京
  • 上海
  • 天津
  • 重庆
  • 河北
  • 山东
  • 辽宁
  • 黑龙江
  • 吉林
  • 甘肃
  • 青海
  • 河南
  • 江苏
  • 湖北
  • 湖南
  • 江西
  • 浙江
  • 广东
  • 云南
  • 福建
  • 海南
  • 山西
  • 四川
  • 陕西
  • 贵州
  • 安徽
  • 广西
  • 内蒙
  • 西藏
  • 新疆
  • 宁夏
  • 兵团
手机号立即预约

请填写图片验证码后获取短信验证码

看不清楚,换张图片

免费获取短信验证码

Java 实现网络爬虫框架详细代码

Java 实现网络爬虫框架

最近在做一个搜索相关的项目,需要爬取网络上的一些链接存储到索引库中,虽然有很多开源的强大的爬虫框架,但本着学习的态度,自己写了一个简单的网络爬虫,以便了解其中的原理。今天,就为小伙伴们分享下这个简单的爬虫程序!!

一、每个类的功能介绍

  • DownloadPage.java的功能是下载此超链接的页面源代码.
  • FunctionUtils.java 的功能是提供不同的静态方法,包括:页面链接正则表达式匹配,获取URL链接的元素,判断是否创建文件,获取页面的Url并将其转换为规范的Url,截取网页网页源文件的目标内容。
  • HrefOfPage.java 的功能是获取页面源代码的超链接。
  • UrlDataHanding.java 的功能是整合各个给类,实现url到获取数据到数据处理类。
  • UrlQueue.java 的未访问Url队列。
  • VisitedUrlQueue.java 已访问过的URL队列。

二、每个类的源代码

DownloadPage.java 此类要用到HttpClient组件。


package com.sreach.spider;

import java.io.IOException;
import org.apache.http.HttpEntity;
import org.apache.http.HttpResponse;
import org.apache.http.client.ClientProtocolException;
import org.apache.http.client.HttpClient;
import org.apache.http.client.methods.HttpGet;
import org.apache.http.impl.client.DefaultHttpClient;
import org.apache.http.util.EntityUtils;


public class DownloadPage {

 
 public static String getContentFormUrl(String url) {
  
  HttpClient client = new DefaultHttpClient();
  HttpGet getHttp = new HttpGet(url);

  String content = null;

  HttpResponse response;
  try {
   
   response = client.execute(getHttp);
   HttpEntity entity = response.getEntity();

   VisitedUrlQueue.addElem(url);

   if (entity != null) {
    
    content = EntityUtils.toString(entity);

    
    if (FunctionUtils.isCreateFile(url)
      && FunctionUtils.isHasGoalContent(content) != -1) {
     FunctionUtils.createFile(
       FunctionUtils.getGoalContent(content), url);
    }
   }

  } catch (ClientProtocolException e) {
   e.printStackTrace();
  } catch (IOException e) {
   e.printStackTrace();
  } finally {
   client.getConnectionManager().shutdown();
  }

  return content;
 }

}

 FunctionUtils.java 此类的方法均为static方法


package com.sreach.spider;

import java.io.BufferedWriter;
import java.io.File;
import java.io.FileOutputStream;
import java.io.IOException;
import java.io.OutputStreamWriter;
import java.util.regex.Matcher;
import java.util.regex.Pattern;

public class FunctionUtils {

 
 private static String pat = "http://www\\.oschina\\.net/code/explore/.*/\\w+\\.[a-zA-Z]+";
 private static Pattern pattern = Pattern.compile(pat);

 private static BufferedWriter writer = null;

 
 public static int depth = 0;

 
 public static String[] divUrl(String url) {
  return url.split("/");
 }

 
 public static boolean isCreateFile(String url) {
  Matcher matcher = pattern.matcher(url);

  return matcher.matches();
 }

 
 public static void createFile(String content, String urlPath) {
  
  String[] elems = divUrl(urlPath);
  StringBuffer path = new StringBuffer();

  File file = null;
  for (int i = 1; i < elems.length; i++) {
   if (i != elems.length - 1) {

    path.append(elems[i]);
    path.append(File.separator);
    file = new File("D:" + File.separator + path.toString());

   }

   if (i == elems.length - 1) {
    Pattern pattern = Pattern.compile("\\w+\\.[a-zA-Z]+");
    Matcher matcher = pattern.matcher(elems[i]);
    if ((matcher.matches())) {
     if (!file.exists()) {
      file.mkdirs();
     }
     String[] fileName = elems[i].split("\\.");
     file = new File("D:" + File.separator + path.toString()
       + File.separator + fileName[0] + ".txt");
     try {
      file.createNewFile();
      writer = new BufferedWriter(new OutputStreamWriter(
        new FileOutputStream(file)));
      writer.write(content);
      writer.flush();
      writer.close();
      System.out.println("创建文件成功");
     } catch (IOException e) {
      e.printStackTrace();
     }

    }
   }

  }
 }

 
 public static String getHrefOfInOut(String href) {
  
  String resultHref = null;

  
  if (href.startsWith("http://")) {
   resultHref = href;
  } else {
   
   if (href.startsWith("/")) {
    resultHref = "http://www.oschina.net" + href;
   }
  }

  return resultHref;
 }

 
 public static String getGoalContent(String content) {
  int sign = content.indexOf("<pre class=\"");
  String signContent = content.substring(sign);

  int start = signContent.indexOf(">");
  int end = signContent.indexOf("</pre>");

  return signContent.substring(start + 1, end);
 }

 
 public static int isHasGoalContent(String content) {
  return content.indexOf("<pre class=\"");
 }

}

HrefOfPage.java 此类为获取页面的超链接


package com.sreach.spider;

public class HrefOfPage {
 
 public static void getHrefOfContent(String content) {
  System.out.println("开始");
  String[] contents = content.split("<a href=\"");
  for (int i = 1; i < contents.length; i++) {
   int endHref = contents[i].indexOf("\"");

   String aHref = FunctionUtils.getHrefOfInOut(contents[i].substring(
     0, endHref));

   if (aHref != null) {
    String href = FunctionUtils.getHrefOfInOut(aHref);

    if (!UrlQueue.isContains(href)
      && href.indexOf("/code/explore") != -1
      && !VisitedUrlQueue.isContains(href)) {
     UrlQueue.addElem(href);
    }
   }
  }

  System.out.println(UrlQueue.size() + "--抓取到的连接数");
  System.out.println(VisitedUrlQueue.size() + "--已处理的页面数");

 }

}

UrlDataHanding.java 此类主要是从未访问队列中获取url,下载页面,分析url,保存已访问url等操作,实现Runnable接口


package com.sreach.spider;

public class UrlDataHanding implements Runnable {
 
 public void dataHanding(String url) {
  HrefOfPage.getHrefOfContent(DownloadPage.getContentFormUrl(url));
 }

 public void run() {
  while (!UrlQueue.isEmpty()) {
   dataHanding(UrlQueue.outElem());
  }
 }
}

UrlQueue.java 此类主要是用来存放未访问的URL队列


package com.sreach.spider;

import java.util.LinkedList;

public class UrlQueue {
 
 public static LinkedList<String> urlQueue = new LinkedList<String>();

 
 public static final int MAX_SIZE = 10000;

 public synchronized static void addElem(String url) {
  urlQueue.add(url);
 }

 public synchronized static String outElem() {
  return urlQueue.removeFirst();
 }

 public synchronized static boolean isEmpty() {
  return urlQueue.isEmpty();
 }

 public static int size() {
  return urlQueue.size();
 }

 public static boolean isContains(String url) {
  return urlQueue.contains(url);
 }

}

VisitedUrlQueue.java 主要是保存已访问过的URL,使用HashSet来保存,主要是考虑到每个访问过的URL是不同。HashSet刚好符合这个要求


package com.sreach.spider;

import java.util.HashSet;


public class VisitedUrlQueue {
 public static HashSet<String> visitedUrlQueue = new HashSet<String>();

 public synchronized static void addElem(String url) {
  visitedUrlQueue.add(url);
 }

 public synchronized static boolean isContains(String url) {
  return visitedUrlQueue.contains(url);
 }

 public synchronized static int size() {
  return visitedUrlQueue.size();
 }
}

Test.java 此类为测试类


import java.sql.SQLException;

import com.sreach.spider.UrlDataHanding;
import com.sreach.spider.UrlQueue;

public class Test {
 public static void main(String[] args) throws SQLException {
  String url = "http://www.oschina.net/code/explore/achartengine/client/AndroidManifest.xml";
  String url1 = "http://www.oschina.net/code/explore";
  String url2 = "http://www.oschina.net/code/explore/achartengine";
  String url3 = "http://www.oschina.net/code/explore/achartengine/client";

  UrlQueue.addElem(url);
  UrlQueue.addElem(url1);
  UrlQueue.addElem(url2);
  UrlQueue.addElem(url3);

  UrlDataHanding[] url_Handings = new UrlDataHanding[10];

  for (int i = 0; i < 10; i++) {
   url_Handings[i] = new UrlDataHanding();
   new Thread(url_Handings[i]).start();
  }

 }
}

说明一下:由于我抓取的是针对oschina的,所以里面的url正则表达式不适合其他网站,需要自己修改一下。你也可以写成xml来配置。

以上就是Java 实现网络爬虫框架详细代码的详细内容,更多关于Java 实现网络爬虫框架的资料请关注编程网其它相关文章!

免责声明:

① 本站未注明“稿件来源”的信息均来自网络整理。其文字、图片和音视频稿件的所属权归原作者所有。本站收集整理出于非商业性的教育和科研之目的,并不意味着本站赞同其观点或证实其内容的真实性。仅作为临时的测试数据,供内部测试之用。本站并未授权任何人以任何方式主动获取本站任何信息。

② 本站未注明“稿件来源”的临时测试数据将在测试完成后最终做删除处理。有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

Java 实现网络爬虫框架详细代码

下载Word文档到电脑,方便收藏和打印~

下载Word文档

猜你喜欢

如何实现Java手撸网络爬虫框架

这篇文章主要为大家展示了“如何实现Java手撸网络爬虫框架”,内容简而易懂,条理清晰,希望能够帮助大家解决疑惑,下面让小编带领大家一起研究并学习一下“如何实现Java手撸网络爬虫框架”这篇文章吧。首先介绍每个类的功能:DownloadPag
2023-06-20

python 网络爬虫初级实现代码

首先,我们来看一个Python抓取网页的库:urllib或urllib2。 那么urllib与urllib2有什么区别呢? 可以把urllib2当作urllib的扩增,比较明显的优势是urllib2.urlopen()可以接受Request
2022-06-04

java实现一个简单的网络爬虫代码示例

目前市面上流行的爬虫以python居多,简单了解之后,觉得简单的一些页面的爬虫,主要就是去解析目标页面(html)。那么就在想,java有没有用户方便解析html页面呢?找到了一个jsoup包,一个非常方便解析html的工具呢。使用方式也非
2023-05-30

Java中怎么实现一个网络爬虫

Java中怎么实现一个网络爬虫,针对这个问题,这篇文章详细介绍了相对应的分析和解答,希望可以帮助更多想解决这个问题的小伙伴找到更简单易行的方法。首先介绍每个类的功能:DownloadPage.java的功能是下载此超链接的页面源代码.Fun
2023-06-17

Python爬虫爬取美剧网站的实现代码

一直有爱看美剧的习惯,一方面锻炼一下英语听力,一方面打发一下时间。之前是能在视频网站上面在线看的,可是自从广电总局的限制令之后,进口的美剧英剧等貌似就不在像以前一样同步更新了。但是,作为一个宅diao的我又怎甘心没剧追呢,所以网上随便查了一
2022-06-04

Python实现网页爬虫基本实现代码怎么编写

Python实现网页爬虫基本实现代码怎么编写,很多新手对此不是很清楚,为了帮助大家解决这个难题,下面小编将为大家详细讲解,有这方面需求的人可以来学习下,希望你能有所收获。Python是一款功能强大的计算机程序语言,同时也可以被看做是一款面向
2023-06-17

java实现文件夹上传功能实例代码(SpringBoot框架)

在web项目中上传文件夹现在已经成为了一个主流的需求,下面这篇文章主要给大家介绍了关于java实现文件夹上传功能(springBoot框架)的相关资料,文中通过实例代码介绍的非常详细,需要的朋友可以参考下
2023-05-14

多线程网络实现在线聊天系统(详细源码)

这篇博客整理自韩顺平老师的多线程网络学习,在Java基础中最难的就是多线程以及网络编程了,如果不太熟悉的小伙伴可以跟着课程学习,韩老师讲得很详细,缺点就是太详细有点墨迹。实现后的效果是在一个类似命令行窗口进行聊天,网页版的聊天项目后续我也会
2023-08-30

编程热搜

  • Python 学习之路 - Python
    一、安装Python34Windows在Python官网(https://www.python.org/downloads/)下载安装包并安装。Python的默认安装路径是:C:\Python34配置环境变量:【右键计算机】--》【属性】-
    Python 学习之路 - Python
  • chatgpt的中文全称是什么
    chatgpt的中文全称是生成型预训练变换模型。ChatGPT是什么ChatGPT是美国人工智能研究实验室OpenAI开发的一种全新聊天机器人模型,它能够通过学习和理解人类的语言来进行对话,还能根据聊天的上下文进行互动,并协助人类完成一系列
    chatgpt的中文全称是什么
  • C/C++中extern函数使用详解
  • C/C++可变参数的使用
    可变参数的使用方法远远不止以下几种,不过在C,C++中使用可变参数时要小心,在使用printf()等函数时传入的参数个数一定不能比前面的格式化字符串中的’%’符号个数少,否则会产生访问越界,运气不好的话还会导致程序崩溃
    C/C++可变参数的使用
  • css样式文件该放在哪里
  • php中数组下标必须是连续的吗
  • Python 3 教程
    Python 3 教程 Python 的 3.0 版本,常被称为 Python 3000,或简称 Py3k。相对于 Python 的早期版本,这是一个较大的升级。为了不带入过多的累赘,Python 3.0 在设计的时候没有考虑向下兼容。 Python
    Python 3 教程
  • Python pip包管理
    一、前言    在Python中, 安装第三方模块是通过 setuptools 这个工具完成的。 Python有两个封装了 setuptools的包管理工具: easy_install  和  pip , 目前官方推荐使用 pip。    
    Python pip包管理
  • ubuntu如何重新编译内核
  • 改善Java代码之慎用java动态编译

目录