Java使用Jsoup获得新闻联播所有文字稿

Jsoup的maven坐标：

		<!-- https://mvnrepository.com/artifact/org.jsoup/jsoup -->

		<dependency>

		    <groupId>org.jsoup</groupId>

		    <artifactId>jsoup</artifactId>

		    <version>1.11.3</version>

		</dependency>

Java代码：

package com.zifeiy.test;

import java.io.File;

import java.io.FileOutputStream;

import java.io.IOException;

import java.io.OutputStreamWriter;

import java.util.ArrayList;

import java.util.List;

import org.jsoup.Jsoup;

import org.jsoup.nodes.Document;

import org.jsoup.nodes.Element;

import org.jsoup.select.Elements;

public class XinwenGetter {

	private static List<String> urlList = new ArrayList<String>();

	private static OutputStreamWriter out;

	private static void getUrlList() throws IOException {

		for (int i = 1; i <= 44; i ++) {

			String url = null;

			if (i == 0) {

				url = "http://www.xwlbo.com/txt.html";

			} else {

				url = "http://www.xwlbo.com/txt_" + i + ".html";

			}

			Document doc = Jsoup.connect(url).get();

			Elements xwlistElements = doc.getElementsByClass("xwlist");

			Elements aElements = xwlistElements.get(0).select("a");

			for (Element element : aElements) {

				String resUrl = element.attr("href");

				urlList.add(resUrl);

			}

		}

	}

	private static void solve(String url) throws IOException {

		Document doc = Jsoup.connect(url).get();

		System.out.println("handling " + doc.title() + " ...");

		out.write("<h3>" + doc.title() + "</h3>\r\n");

		Elements textElements = doc.getElementsByClass("text_content");

		Elements pElements = textElements.get(0).select("p");

		for (Element pElement : pElements) {

//			System.out.println(pElement);

			out.write(pElement.toString() + "\r\n");

		}

		out.write("<hr>\r\n");

	}

	public static void main(String[] args) throws IOException {

		getUrlList();

		File file = new File("D:/新闻联播大全.html");

		if (file.exists() == true) file.delete();

		out = new OutputStreamWriter(new FileOutputStream(file, true), "UTF-8");

		for (String url: urlList) {

			solve(url);

		}

        out.close();

	}

}

Java使用Jsoup获得新闻联播所有文字稿的更多相关文章

CSDN Androidclient开展(两):基于如何详细解释Java使用Jsoup爬行动物HTML数据
文章引用鸿扬大大的链接具体介绍怎样使用Jsoup包抓取HTML数据,是一个纯javaproject,并将其打包成jar包.希望了解怎样用java语言爬虫网页的能够看下. 杂家前文就又介绍用HTTP訪问 ...
java爬虫--jsoup简单的表单抓取案例
分析需求: 某农产品网站的农产品价格抓取网站链接:点击打开链接页面展示如上: 标签展示如上: 分析发现每日价格行情包括了蔬菜,水果,肉等所有的信息,所以直接抓每日行情的内容就可以实现抓取全部数据. ...
java 利用jsoup 爬取知乎首页问题
今天学了下java的爬虫,首先要下载jsoup的包,然后导入,导入过程:首先右击工程:Build Path ->configure Build Path,再点击Add External JARS ...
Java错误：结束的字符文字
编译器为NetBeans 在学习java的时候突然出现了以下错误错误代码是: Gen <Integer ,String> a = new Gen <Integer, String& ...
【图片识别】Java中使用tess4J进行图片文字识别（支持中文）（转）
http://blog.csdn.net/wsk1103/article/details/54173282 java中识别文字比较简单,使用的软件是tesseractocr(使用的版本是3.02,3以 ...
Java使用Jsoup之爬取博客数据应用实例
导入Maven依赖  <dependency> <g ...
（java）Jsoup爬虫学习--获取智联招聘（老网站）的全国java职位信息，爬取10页
Jsoup爬虫学习--获取智联招聘(老网站)的全国java职位信息,爬取10页,输出职位名称*****公司名称*****职位月薪*****工作地点*****发布日期 import java.io.I ...
（java）Jsoup爬虫学习--获取网页所有的图片，链接和其他信息，并检查url和文本信息
Jsoup爬虫学习--获取网页所有的图片,链接和其他信息,并检查url和文本信息此例将页面图片和url全部输出,重点不太明确,可根据自己的需要输出和截取: import org.jsoup.Jsou ...
Java使用Jsoup简单解析页面
jsoup 是一款 Java 的 HTML 解析器,可直接解析某个 URL 地址.HTML 文本内容.它提供了一套非常省力的 API,可通过 DOM,CSS 以及类似于 jQuery 的操作方法来取出 ...

随机推荐

SpringBoot学习（四）开发web应用
Spring Boot非常适合web应用程序开发.可以使用嵌入式Tomcat.Jetty.Undertow或Netty创建自包含的HTTP服务器.大多数web应用程序使用spring-boot-sta ...
docker 构建自己的image 镜像文件
docker build 构建自己的镜像文件. 1.在本地工程中运行生成一个springboot的可运行的jar. 因为我习惯用eclipse,所以在eclipse下新建一个springboot的工程 ...
Thinkphp远程代码执行 payload汇总
Thinkphp 5.0.22http://192.168.1.1/thinkphp/public/?s=.|think\config/get&name=database.usernameht ...
C# 异步编程（async&await）
同步:同步就是指一个进程在执行某个请求的时候,若该请求需要一段时间才能返回信息,那么这个进程将会一直等待下去,直到收到返回信息才继续执行下去异步:异步是指进程不需要一直等下去,而是继续执行下面的操作 ...
Java中的位运算及简单的算法应用介绍
众所周知,计算机底层是二进制.而java作为一门计算机编程语言,也对二进制的位运算提供了完整的支持. 在java中,int是32位的,也就是说可以用来实现32位的位运算.方便起见,我们一般用16进制对 ...
Fiddler抓取https请求证书问题【转载】
转载链接: https://www.cnblogs.com/liulinghua90/p/9109282.html
9.本地线程(ThreadLoca)
ThreadLoca 提高一个线程的局部变量,访问某个线程都有自己的局部变量,当使用ThreadLoca为每个使用该变量的线程提供独立的变量副本,所以每一个线程都可以独立的改变自己的副本,二不会影响到 ...
ICEM-管肋
原视频下载地址:https://yunpan.cn/cMgkmd7u9ZPdC 访问密码 8a73
python 两个字典对比
def commir_two_dict(dictone,dicttwo): pass_num=0 fail_num=0 try: for i in dictone.keys(): if i in di ...
linux cat 文件编码
test.log是utf-16的编码 cat test.log会报错但是我们可以cat的时候指定编码格式 iconv -f 文件编码 -t 终端编码 input.log iconv -f utf-1 ...

Java使用Jsoup获得新闻联播所有文字稿

Java使用Jsoup获得新闻联播所有文字稿的更多相关文章

随机推荐

热门专题