java正则读取html 获取标题/超链接/链接文本/内容

参考链接：http://yijianfengvip.blog.163.com/blog/static/17527343220114278593064/

import java.io.BufferedReader;
import java.io.IOException;
import java.io.InputStreamReader;
import java.net.MalformedURLException;
import java.net.URL;
import java.util.ArrayList;
import java.util.HashMap;
import java.util.List;
import java.util.regex.Matcher;
import java.util.regex.Pattern;

/**
*
* @author
*
*/
public class WebContent
{
/**
* 读取一个网页全部内容
*/

///此方法读取小量数据网站速度较快

  public static String getOneHtml(String urlString)throws Exception{

   InputStreamReader in = new InputStreamReader(new URL(urlString).openStream());

         // read contents into string buffer

         StringBuilder input = new StringBuilder();

         int ch;

         while ((ch = in.read()) != -1) input.append((char) ch);

         //System.out.println(input);

   return input.toString();

  }

///此方法读取大量数据网站速度较快但是不能太大。例如sina.com.cn 本方法运行十次耗时 7688毫秒 getOneHtml 耗时 41016毫秒

 public static String getAllHtml(String urlString)throws Exception{

 //  ConnectionManager manager = Parser.getConnectionManager();

 //  Cookie cookie = new Cookie("ASP.NET_SessionId","szpgjr45ucsacir0d1p4g255");

 //  Cookie cookie1 = new Cookie("SID", "111017");

 //  Cookie cookie2 = new Cookie("LID", "");

 //  manager.setCookie(cookie, "acad.cnki.net");

 //  manager.setCookie(cookie1, "acad.cnki.net");

 //  manager.setCookie(cookie2, "acad.cnki.net");

   //Parser parser = new Parser("");

   Parser parser = new Parser(urlString);

   parser.setEncoding("utf8");

   String filterStr = "html";

   NodeFilter innerFilter = new TagNameFilter(filterStr);

   NodeList nodes = parser.parse(innerFilter);

   return nodes.toHtml();

   //System.out.println(nodes.toHtml());

  }

  /**

   *

   * @param s

   * @return 获得网页标题

   */

  public String getTitle(final String s)

  {

   String regex;

   String title = "";

   final List<String> list = new ArrayList<String>();

   regex = "<title>.*?</title>";

   final Pattern pa = Pattern.compile(regex, Pattern.CANON_EQ);

   final Matcher ma = pa.matcher(s);

   while (ma.find())

   {

    list.add(ma.group());

   }

   for (int i = 0; i < list.size(); i++)

   {

    title = title + list.get(i);

   }

   return outTag(title);

  }

  /**

   *

   * @param s

   * @return 获得链接

   */

  public List<String> getLink(final String s)

  {

   String regex;

   final List<String> list = new ArrayList<String>();

   regex = "<a[^>]*href=(\"([^\"]*)\"|\'([^\']*)\'|([^\\s>]*))[^>]*>(.*?)</a>";

   final Pattern pa = Pattern.compile(regex, Pattern.DOTALL);

   final Matcher ma = pa.matcher(s);

   while (ma.find())

   {

    list.add(ma.group());

   }

   return list;

  }

  /**

   *

   * @param s

   * @return 获得脚本代码

   */

  public List<String> getScript(final String s)

  {

   String regex;

   final List<String> list = new ArrayList<String>();

   regex = "<script.*?</script>";

   final Pattern pa = Pattern.compile(regex, Pattern.DOTALL);

   final Matcher ma = pa.matcher(s);

   while (ma.find())

   {

    list.add(ma.group());

   }

   return list;

  }

  /**

   *

   * @param s

   * @return 获得CSS

   */

  public List<String> getCSS(final String s)

  {

   String regex;

   final List<String> list = new ArrayList<String>();

   regex = "<style.*?</style>";

   final Pattern pa = Pattern.compile(regex, Pattern.DOTALL);

   final Matcher ma = pa.matcher(s);

   while (ma.find())

   {

    list.add(ma.group());

   }

   return list;

  }

  /**

   *

   * @param s

   * @return 去掉标记

   */

  public String outTag(final String s)

  {

   return s.replaceAll("<.*?>", "");

  }

  /**

   *

   * @param s

   * @return 获取雅虎知识堂文章标题及内容

   */

  public HashMap<String, String> getFromYahoo(final String s)

  {

   final HashMap<String, String> hm = new HashMap<String, String>();

   final StringBuffer sb = new StringBuffer();

   String html = "";

   System.out.println("\n------------------开始读取网页(" + s + ")--------------------");

   try

   {

    html = getOneHtml(s);

   }

   catch (final Exception e)

   {

    e.getMessage();

   }

   // System.out.println(html);

   System.out.println("------------------读取网页(" + s + ")结束--------------------\n");

   System.out.println("------------------分析(" + s + ")结果如下--------------------\n");

   String title = outTag(getTitle(html));

   title = title.replaceAll("_雅虎知识堂", "");

   // Pattern pa=Pattern.compile("<div

   // class=\"original\">(.*?)((\r\n)*)(.*?)((\r\n)*)(.*?)</div>",Pattern.DOTALL);

   final Pattern pa = Pattern.compile("<div class=\"original\">(.*?)</p></div>", Pattern.DOTALL);

   final Matcher ma = pa.matcher(html);

   while (ma.find())

   {

    sb.append(ma.group());

   }

   String temp = sb.toString();

   temp = temp.replaceAll("(<br>)+?", "\n");// 转化换行

   temp = temp.replaceAll("<p><em>.*?</em></p>", "");// 去图片注释

   hm.put("title", title);

   hm.put("original", outTag(temp));

   return hm;

  }

  /**

   *

   * @param args

   *            测试一组网页，针对雅虎知识堂

   */

  public static void main(final String args[])

  {

   String url = "";

   final List<String> list = new ArrayList<String>();

   System.out.print("输入URL，一行一个，输入结束后输入 go 程序开始运行:   \n");

   /*

    * http://ks.cn.yahoo.com/question/1307121201133.html

    * http://ks.cn.yahoo.com/question/1307121101907.html

    * http://ks.cn.yahoo.com/question/1307121101907_2.html

    * http://ks.cn.yahoo.com/question/1307121101907_3.html

    * http://ks.cn.yahoo.com/question/1307121101907_4.html

    * http://ks.cn.yahoo.com/question/1307121101907_5.html

    * http://ks.cn.yahoo.com/question/1307121101907_6.html

    * http://ks.cn.yahoo.com/question/1307121101907_7.html

    * http://ks.cn.yahoo.com/question/1307121101907_8.html

    */

   final BufferedReader br = new BufferedReader(new InputStreamReader(System.in));

   try

   {

    while (!(url = br.readLine()).equals("go"))

    {

     list.add(url);

    }

   }

   catch (final Exception e)

   {

    e.getMessage();

   }

   final WebContent wc = new WebContent();

   HashMap<String, String> hm = new HashMap<String, String>();

   for (int i = 0; i < list.size(); i++)

   {

    hm = wc.getFromYahoo(list.get(i));

    System.out.println("标题： " + hm.get("title"));

    System.out.println("内容： \n" + hm.get("original"));

   }

   /*

    * String htmlurl[] = {

    * "http://ks.cn.yahoo.com/question/1307121201133.html",

    * "http://ks.cn.yahoo.com/question/1307121101907.html",

    * "http://ks.cn.yahoo.com/question/1307121101907_2.html",

    * "http://ks.cn.yahoo.com/question/1307121101907_3.html",

    * "http://ks.cn.yahoo.com/question/1307121101907_4.html",

    * "http://ks.cn.yahoo.com/question/1307121101907_5.html",

    * "http://ks.cn.yahoo.com/question/1307121101907_6.html",

    * "http://ks.cn.yahoo.com/question/1307121101907_7.html",

    * "http://ks.cn.yahoo.com/question/1307121101907_8.html" }; WebContent

    * wc = new WebContent(); HashMap<String, String> hm = new HashMap<String,

    * String>(); for (int i = 0; i < htmlurl.length; i++) { hm =

    * wc.getFromYahoo(htmlurl[i]); System.out.println("标题： " +

    * hm.get("title")); System.out.println("内容： \n" + hm.get("original")); }

    */

   /*

    * String html=""; String link=""; String sscript=""; String content="";

    * System.out.println(htmlurl+" 开始读取网页内容：");

    * html=wc.getOneHtml(htmlurl); System.out.println(htmlurl+"

    * 读取完毕开始分析……"); html=html.replaceAll("(<script.*?)((\r\n)*)(.*?)((\r\n)*)(.*?)(</script>)","

    * ");//去除脚本 html=html.replaceAll("(<style.*?)((\r\n)*)(.*?)((\r\n)*)(.*?)(</style>)","

    * ");//去掉CSS html=html.replaceAll("<title>.*?</title>"," ");//除去页面标题

    * html=html.replaceAll("<a[^>]*href=(\"([^\"]*)\"|\'([^\']*)\'|([^\\s>]*))[^>]*>(.*?)</a>","

    * ");//去掉链接 html=html.replaceAll("(\\s){2,}?"," ");//除去多余空格

    * html=wc.outTag(html);//多余标记 System.out.println(html);

    */

   /*

    * String s[]=html.split(" +"); for(int i=0;i<s.length;i++){

    * content=(content.length()>s[i].length())?content:s[i]; }

    * System.out.println(content);

    */

   // System.out.println(htmlurl+"网页内容结束");

   /*

    * System.out.println(htmlurl+"网页脚本开始："); List

    * script=wc.getScript(html); for(int i=0;i<script.size();i++){

    * System.out.println(script.get(i)); }

    * System.out.println(htmlurl+"网页脚本结束：");

    *

    * System.out.println(htmlurl+"CSS开始："); List css=wc.getCSS(html);

    * for(int i=0;i<css.size();i++){ System.out.println(css.get(i)); }

    * System.out.println(htmlurl+"CSS结束：");

    *

    * System.out.println(htmlurl+"全部链接内容开始："); List list=wc.getLink(html);

    * for(int i=0;i<list.size();i++){ link=list.get(i).toString(); }

    * System.out.println(htmlurl+"全部链接内容结束：");

    *

    * System.out.println("内容"); System.out.println(wc.outTag(html));

    */

  }

 }

java正则读取html 获取标题/超链接/链接文本/内容的更多相关文章

获取checkbox后面的文本内容
http://alygle.blog.51cto.com/1922399/669040 <head> <meta http-equiv="Content-Type" ...
[SoapUI]怎样获取隐藏元素的文本内容Get text of hidden element
隐藏元素无法通过gettext()获取其文本内容,须用javascript来获取 String actualDataPointName = (String) ((JavascriptExecutor) ...
APP自动化 -- 获取toast元素的文本内容
一.toast元素 1.表现形式:toast元素就是下图中 “操作成功” 那个一闪而过的标签. 2.特殊点:因为一闪而过,时间太短,用UIAutomatorView截屏截不到. 二.获取方法 1.用 ...
java 正则操作之获取
// 正则操作获取import java.util.regex.*;class Demo{ public static void main(String[] args){ String str=& ...
wpf ComboBox 获取选中项的文本内容
一:根据数据源类型获取选中项类: public class Region { public int REGION_ID { get; set; } public string REGION_CODE ...
4-4 Selector有一个方法可以获取Selector中的文本内容---extract()
####### 例如: response.xpath('//div[@class ="entry-header"]/h1/text()').extract()
Python爬虫:爬取自己博客的主页的标题，链接，和发布时间
代码 # -*- coding: utf-8 -*- """ ------------------------------------------------- File ...
js如何获取select下拉框的value以及文本内容
select下拉框在项目开发中是经常用到的,特别是在联级菜单方面的应用更为广泛.但是,对于一些初学者来说,如何获取下拉框子节点option的value值和文本内容,还是有一点难度的.其他的就不说了,现 ...
Android开发之异步获取并下载网络资源-下载图片和下载文本内容
在android网络开发过程中,经常需要获取网络资源,比如下载图片,下载文本文件内容等,这个时候就需要http请求来获取相应的网络资源.首先看看实例效果图: 下载图片截图 ...

随机推荐

numpy中的CSV文件
As we all know,we use numpy to do some data explore.CSV has a good point to get a lot data. so how c ...
002、创建第一个Java程序HelloWord
代码如下: package TIANPAN; public class TestDemo { public static void main(String args[]) { System.out.p ...
012.Oracle数据库，字符串文本大小写转换，转大写，转小写，首字母大写
/*转大写*/ SELECT UPPER(TITLE_EN) FROM ME_EO WHERE ( ISSUE_DATE BETWEEN to_date( '2017-02-04', 'yyyy-MM ...
06.Delphi接口的不对等的多重继承
uSayHello代码如下 unit uSayHello; interface uses SysUtils, Windows, Messages, Classes, Graphics, Control ...
apache端口修改为80
apache端口莫名改变为443,访问网址失败,修改Apache端口: 1.打开目录(实际而定): C:\xampp\apache\conf 编辑httpd.conf 2.ctrl + f 搜索li ...
NIO三大组件简介
NIO简介 NIO 是面向缓冲区(或者说面向块)编程的, 因为Buffer底层本质上就是内存块.数据被读取到一个缓冲区, 稍后再被它处理, 需要时数据可在缓冲区前后移动, 从而增加了处理过程中的灵活性 ...
《YouTube 网站的架构演进》阅读笔记
概述 YouTube 在国内是个404网站,需要翻墙得见,这是有用的废话,先铺垫一下. 从全球网站来看,它仅次于母公司 Google,全球排名位列第2.每天超过5亿以上视频播放量,平均每个用户点击10 ...
POJ 2823 滑动窗口单调队列模板
我们从最简单的问题开始: 给定一个长度为N的整数数列a(i),i=0,1,...,N-1和窗长度k. 要求: f(i) = max{a(i-k+1),a(i-k+2),..., a(i)},i = 0 ...
linux添加一个已经存在用户到一个用户组
在使用virtual-box的共享文件时,在虚拟机中共享文件的用户为root,用户组为vboxsf, 所以需要将自己添加到vboxsf这组当中去,一开始使用useradd老是失败,后来才查到要用use ...
时间戳和LocalDateTime和Date互转和格式化
一前言续上篇java8在日常开发中使用LocalDate和LocalTime[https://blog.csdn.net/youku1327/article/details/102771936]中 ...

java正则 读取html 获取标题/超链接/链接文本/内容

java正则 读取html 获取标题/超链接/链接文本/内容的更多相关文章

随机推荐

热门专题

java正则读取html 获取标题/超链接/链接文本/内容

java正则读取html 获取标题/超链接/链接文本/内容的更多相关文章