1 package com.lw.httpclient.test;

 2 import org.apache.http.client.methods.CloseableHttpResponse;

 3 import org.apache.http.client.methods.HttpGet;

 4 import org.apache.http.impl.client.CloseableHttpClient;

 5 import org.apache.http.impl.client.HttpClients;

 6 import org.apache.http.util.EntityUtils;

 7

 8 public class HttpClientTest {

 9     public static void main(String[] args) throws Exception {

10         // TODO Auto-generated method stub

11         get1();

12         get2();

13     }

14     /**

15      * 获取指定链接的网页的内容【初级版】

16      * @throws Exception

17      */

18     public static void get1()throws Exception{

19         //HttpClient hc=new DefaultHttpClient();

20         String url="http://www.budejie.com";

21         url="http://www.btba.com.cn";//网站限制爬，这种方式不再实用。

22         CloseableHttpClient chc=HttpClients.createDefault();

23         HttpGet hg=new HttpGet(url);

24         CloseableHttpResponse chp=chc.execute(hg);

25         System.out.println(EntityUtils.toString(chp.getEntity(),"UTF-8"));

26     }

27     /**

28      * 通过模拟浏览器获取指定链接的页面

29      * @throws Exception

30      */

31     public static void get2()throws Exception{

32         CloseableHttpClient closeableHttpClient=HttpClients.createDefault();

33         String url="http://www.btba.com.cn";

34         HttpGet httpGet=new HttpGet(url);

35         //设置请求头，模拟浏览器访问

36         httpGet.setHeader("User-Agent","Mozilla/5.0 (Windows NT 6.1; Win64; x64; rv:59.0) Gecko/20100101 Firefox/59.0");

37         CloseableHttpResponse chr=closeableHttpClient.execute(httpGet);

38         System.out.println(EntityUtils.toString(chr.getEntity(),"UTF-8"));

39     }

40 }

未完待续

将会添加如何解析获取到的内容，得到自己想要的部分。。

【apache】使用HttpClient，进行简单网页抓取的更多相关文章

Java实现简单网页抓取
需求说明:使用Java抓取网页信息,并以字符串的形式返回. 使用Java代码实现: package net.ibuluo.spider.util; import java.io.IOException ...
Python实现简单的网页抓取
现在开源的网页抓取程序有很多,各种语言应有尽有. 这里分享一下Python从零开始的网页抓取过程第一步:安装Python 点击下载适合的版本https://www.python.org/ 我这里选择 ...
Java开源网页抓取工具httpClient以及jsoup
网上看到不错的Java网页抓取工具和库先记录一下使用java开源工具httpClient及jsoup抓取解析网页数据
java网页抓取
网页抓取就是,我们想要从别人的网站上得到我们想要的,也算是窃取了,有的网站就对这个网页抓取就做了限制,比如百度直接进入正题 //要抓取的网页地址 String urlStr = "http ...
网页抓取：PHP实现网页爬虫方式小结
来源:http://www.ido321.com/1158.html 抓取某一个网页中的内容,需要对DOM树进行解析,找到指定节点后,再抓取我们需要的内容,过程有点繁琐.LZ总结了几种常用的.易于实现 ...
Python开发爬虫之动态网页抓取篇：爬取博客评论数据——通过Selenium模拟浏览器抓取
区别于上篇动态网页抓取,这里介绍另一种方法,即使用浏览器渲染引擎.直接用浏览器在显示网页时解析 HTML.应用 CSS 样式并执行 JavaScript 的语句. 这个方法在爬虫过程中会打开一个浏览器 ...
Python爬虫之三种网页抓取方法性能比较
下面我们将介绍三种抓取网页数据的方法,首先是正则表达式,然后是流行的 BeautifulSoup 模块,最后是强大的 lxml 模块. 1. 正则表达式如果你对正则表达式还不熟悉,或是需要一些提 ...
实现织梦dedecms百度主动推送(实时)网页抓取
做百度推广的时候,如何让百度快速收录呢,下面提供了三种方式,今天我们主要讲的是第一种. 如何选择链接提交方式 1.主动推送:最为快速的提交方式,推荐您将站点当天新产出链接立即通过此方式推送给百度,以保 ...
Web Scraping（网页抓取）基本原理 - 白话篇
本文主要介绍 Web Scraping 的基本原理,基于Python语言,大白话,面向可爱的小白(^-^). 易混淆的名称: 很多时候,大家会把,在网上获取Data的代码,统称为"爬虫&qu ...

随机推荐

Java 使用BigDecimal计算值没有变化？
BigDecimal 加减乘除后自身变量不会变化, 需要定义一个新的BigDecimal来获取计算好后的值
C语言入门-mingw64安装+配置
OK,大家好,结合上期所说,本期让我们来配置编译器吧! 首先先下载mingw64离线包,官网下载慢,可以去群里下载,*.7z格式(有些同学可能没有解压软件,为了照顾这部分同学,笔者提供*.exe格式的 ...
Xshell(远程)连接不上linux服务器(防火墙介绍)
一.原因远程(ssh)连接不上linux服务器的大多数原因都是因为本地服务器的防火墙策略导致的,因此我们想ssh远程能够连接上服务器,有两种方法: 修改防火墙策略关闭防火墙二.防火墙服务介绍 1 ...
python-实现链式栈
7 """ 8 用一个类来实现一个节点 9 """ 10 class Node(object): 11 def __init__(self, ...
如何配置Nginx，实现http访问重定向到https？
现在越来越多的网站,当我们输入域名时,会自动重定向到https,我们只需要简单修改下Nginx配置文件/usr/local/nginx/conf/nginx.conf(根据个人的实际存储路径)即可. ...
Tkinter教程系列01——引言和安装Tk
Tkinter教程系列01--引言和安装Tk 首发于我的个人博客 https://chens.life/tkinter-tutorial-chapter-01-introduction-and-ins ...
从网络请求过程看OkHttp拦截器
前言之前我们结合设计模式简单说了下OkHttp的大体流程,今天就继续说说它的核心部分--拦截器. 因为拦截器组成的链其实是完成了网络通信的整个流程,所以我们今天就从这个角度说说各拦截器的功能. 首先 ...
CodeForces CF862E题解
\(Part\ 1:\) 我们发现每次修改动的是\(a\)串,所以对于这个答案的公式,\(b_{i+j}\)的部分是可以求出来的.所以我们可以把公式改成如下所示: \(f(j)=|\sum_{i=1} ...
80%的人都不会的，15个Linux实用技巧
熟悉 Linux 系统的同学都知道,它高效主要体现在命令行.通过命令行,可以将很多简单的命令,通过自由的组合,得到非常强大的功能. 命令行也就意味着可以自动化,自动化会使你的工作更高效,释放很多手工操 ...
Java中获取类的运行时结构
获取运行时类的完整结构通过反射获取运行时类的完整结构 Field(属性).Method(方法).Constructor(构造器).Superclass(父类).Interface(接口).Annot ...

【apache】使用HttpClient，进行简单网页抓取

未完待续

将会添加如何解析获取到的内容，得到自己想要的部分。。

【apache】使用HttpClient，进行简单网页抓取的更多相关文章

随机推荐

热门专题