httpClient get方式抓取数据

/*
   * 爬取网页信息
   */
   private static String pickData(String url) {
       CloseableHttpClient httpclient = HttpClients.createDefault();
       try {
           HttpGet httpget = new HttpGet(url);
           CloseableHttpResponse response = httpclient.execute(httpget);
           try {
               // 获取响应实体
               HttpEntity entity = response.getEntity();
               // 打印响应状态
               if (entity != null) {
                   InputStream in = entity.getContent();
                   // byte[] b=new byte[in.available()];
                   // in.read(b);
                   BufferedReader br = new BufferedReader(new InputStreamReader(in, "gbk"));
                   String temp = "";
                   String s = "";
                   while ((temp = br.readLine()) != null) {
                       s = s + temp;
                   }
                   return s;
               } else {
                   String content = "热门综艺节目抓取失败,请检查";
                   ErrorLog el = new ErrorLog();
                   Remind remind = new Remind();
                   remind.remind(el.getVerietyLog(), content);
                   return null;
               }
           } finally {
               response.close();
           }
       } catch (ClientProtocolException e) {
           e.printStackTrace();
       } catch (ParseException e) {
           e.printStackTrace();
       } catch (IOException e) {
           e.printStackTrace();
       } finally {
           // 关闭连接,释放资源
           try {
               httpclient.close();
           } catch (IOException e) {
               e.printStackTrace();
           }
       }
       return null;
   }

/*
   * 使用jsoup解析网页信息
   */
   private static Variety analyzeHTMLByString(String html) {
       Variety v = new Variety();
       String[] arr = new String[3];
       Document document = Jsoup.parse(html);
       // document.select("meta").attr("charset", "utf-8");
       // System.out.println(document);
       Elements array = document.getElementsByClass("keyword");
       System.out.println(array.size());
       String content = "热门综艺节目抓取失败,请检查";
       ErrorLog el = new ErrorLog();
       if (array.size() == 0) {
           Remind remind = new Remind();
           remind.remind(el.getVerietyLog(), content);
           return null;
       }else{
           if (array.size() >= 3) {
               for (int i = 0; i < 3; i++) {
                   String name = array.get(i).child(0).text();
                   arr[i] = name;
               }
           } else {
               for (int i = 0; i < array.size(); i++) {
                   String name = array.get(i).child(0).text();
                   arr[i] = name;
               }
           }
           v.setHot1(arr[0]);
           v.setHot2(arr[1]);
           v.setHot3(arr[2]);
           return v;
       }

   }

httpClient get方式抓取数据的更多相关文章

使用java开源工具httpClient及jsoup抓取解析网页数据
今天做项目的时候遇到这样一个需求,需要在网页上展示今日黄历信息,数据格式如下公历时间:2016年04月11日星期一农历时间:猴年三月初五天干地支:丙申年壬辰月癸亥日宜:求子祈福开光 ...
Cacti 抓取数据方式安装spine
安装好cacti后首先要设置获取数据的方式 Cacti 获取数据的方式有两种,1.监控端的脚本(可以是php, shell, perl 或其他脚本)2.或者 snmp 协议获取. Cacti 会在固定 ...
测试开发Python培训：抓取新浪微博抓取数据-技术篇
测试开发Python培训:抓取新浪微博抓取数据-技术篇 poptest是国内唯一一家培养测试开发工程师的培训机构,以学员能胜任自动化测试,性能测试,测试工具开发等工作为目标.在poptest的se ...
C#抓取数据、正则表达式+线程池初步运用
去年底用多线程+HtmlAgilityPack.dll 写了一个抓取“慧聪网” 公司信息的小程序,代码惨不忍赌.好在能抓到数据,速度也能让人忍受就很久没管了. 最近这段时间把这个小程序发给同事看着玩 ...
PHP Curl模拟登录并抓取数据
使用PHP的Curl扩展库可以模拟实现登录,并抓取一些需要用户账号登录以后才能查看的数据.具体实现的流程如下(个人总结): 1. 首先需要对相应的登录页面的html源代码进行分析,获得一些必要的信息: ...
C#使用Selenium+PhantomJS抓取数据
本文主要介绍了C#使用Selenium+PhantomJS抓取数据的方法步骤,具有很好的参考价值,下面跟着小编一起来看下吧手头项目需要抓取一个用js渲染出来的网站中的数据.使用常用的httpclie ...
爬虫学习笔记（1）-- 利用Python从网页抓取数据
最近想从一个网站上下载资源,懒得一个个的点击下载了,想写一个爬虫把程序全部下载下来,在这里做一个简单的记录 Python的基础语法在这里就不多做叙述了,黑马程序员上有一个基础的视频教学,可以跟着学习一 ...
[Python爬虫] 之三：Selenium 调用IEDriverServer 抓取数据
接着上一遍,在用Selenium+phantomjs 抓取数据过程中发现,有时候抓取不到,所以又测试了用Selenium+浏览器驱动的方式:具体代码如下: #coding=utf-8import os ...
分布式爬虫：使用Scrapy抓取数据
分布式爬虫:使用Scrapy抓取数据 Scrapy是Python开发的一个快速,高层次的屏幕抓取和web抓取框架,用于抓取web站点并从页面中提取结构化的数据.Scrapy用途广泛,可以用于数据挖掘. ...

随机推荐

mantis基本配置及邮件服务器配置
邮件服务器配置在c:\php-5.0.3\php.ini文件中查找smtp,将localhost改为你的发件服务器,如SMTP = smtp.163.com 在php.ini文件中查找sendm ...
关于小程序button控件上下边框的显示和隐藏问题
问题: 小程序的button控件上下有一条淡灰色的边框,在空件上加上了样式 border:(none/0); 都没办法让button上下的的边框隐藏: 代码如下 <button class=&q ...
Vue 父组件传值到子组件
vue 父组件给子组件传值中这里的AccessList就是子组件如果是静态传值的话直接 msg="xxx"就好这里动态取值的话就 :msg=xxxxx ________ ...
Too Rich HDU - 5527 （贪心+dfs）
Too Rich Time Limit: 6000/3000 MS (Java/Others) Memory Limit: 262144/262144 K (Java/Others)Total ...
Spring Framework（框架）整体架构变迁
Spring Framework(框架)整体架构 2018年04月24日 11:16:41 阅读数:1444 标签: Spring框架架构更多个人分类: Spring框架版权声明:本文为博主 ...
Linux-SSH远程登陆
SSH是什么 Secure Shell 安全外壳协议建立在应用层基础上的安全协议可靠.转为远程登陆会话和其他网络提供安全性的协议 SSH客户端是用于多种平台服务器安装SSH服务安装:yum i ...
ATM-core-src
from interface import bank, shopping, userfrom lib import common user_data = { 'name': None} def log ...
Android Studio 安装与使用ADB wifi 无线调试
首先,安装ADB WIFI File->Settings->Plugins 其次,用USB连接手机与电脑(并开启手机的调试模式) 任务栏若无提示,即可拔下USB线,开始无线调试任务栏若是 ...
宏基笔记本升级bios（2012-12-28-bd 写的日志迁移
首先到宏基官网下载中心去下载你需要的新版本的bios安装包如图: 我的是宏基4750g的win7旗舰版64位,这里一定要根据自己的电脑的型号和安装的系统来选择,你可以选择最新的版本也可以选择老的版本 ...
27.28. VUE学习之--事件修饰符之stop&capture&self&once实例详解
<!DOCTYPE html> <html lang="en"> <head> <meta charset="UTF-8&quo ...

httpClient get方式抓取数据

httpClient get方式抓取数据的更多相关文章

随机推荐

热门专题