用Head方法获得百度搜索结果的真实地址

在百度中搜索“Java”，第一条结果的链接为：

https://www.baidu.com/link?url=HBOOMbhPKH4SfI0vCLVSSJ3W1eNGX1wjwg6q4hna6L3&wd=&eqid=f7bdf9e40005b5820000000357e76187

因此需要设法将其转换为真实的网站链接：http://www.java.com/。

思路很简单：

使用 HTTP HEAD方法，会返回302 Move Permanently；
在Respons Headers中查看Location中的内容，即为要跳转到的真实地址。

使用命令行工具HttpIE试验如下：

E:\>http head https://www.baidu.com/link?url=HBOOMbhPKH4SfI0vCLVSSJ3W1eNGX1wjwg6q4hna6L3&wd=&eqid=f7bdf9e40005b5820000000357e76187

HTTP/1.1 302 Moved Temporarily

BDPAGETYPE: 3

Cache-Control: no-cache, must-revalidate

Connection: keep-alive

Content-Length: 215

Content-Type: text/html;charset=utf8

Date: Sun, 25 Sep 2016 05:40:07 GMT

Expires: Fri, 01 Jan 1990 00:00:00 GMT

Location: http://www.java.com/

Pragma: no-cache

Server: bfe/1.0.8.18

Set-Cookie: BDSVRTM=0; path=/

X-UA-Compatible: IE=Edge,chrome=1

X-XSS-Protection: 1;mode=block

最后编写Java代码如下：

public static String getRealLinkFromBaiduLink(String link){

    // 需要注意的是，这里必须 disableRedirectHandling，否则会自动进行地址的跳转

    CloseableHttpClient httpClient = HttpClients.custom().disableRedirectHandling().build();

    // 这里可以使用Http Head 方法

    HttpHead httpHead = new HttpHead(link);

    try (CloseableHttpResponse response = httpClient.execute(httpHead)) {

        int status = response.getStatusLine().getStatusCode();

        if (status == 302) {

            return response.getFirstHeader("Location").getValue();

        } else {

            return null;

        }

    } catch (Exception e) {

        e.printStackTrace();

    }

}

用Head方法获得百度搜索结果的真实地址的更多相关文章

百度乐播音乐真实地址查找api接口
1.百度乐播官网:http://lebo.baidu.com: 随便点击进去一个音乐界面,如:http://lebo.baidu.com/album/9036366 2.chrome浏览器右击'检查' ...
获取百度搜索结果的真实url以及摘要和时间
利用requests库和bs4实现,demo如下: #coding:utf- import requests from bs4 import BeautifulSoup import bs4 impo ...
百度搜索URL参数搜索关键字
http://www.baidu.com/s?wd=关键字 wd(Keyword):查询的关键词: http://www.baidu.com/s?wd=关键字&cl=3 cl(Class):搜 ...
百度搜索URL参数你知道多少
http://www.baidu.com/s?wd=关键字 wd(Keyword):查询的关键词: http://www.baidu.com/s?wd=关键字&cl=3 cl(Class):搜 ...
百度搜索URL参数
http://www.baidu.com/s?wd=关键字wd(Keyword):查询的关键词:http://www.baidu.com/s?wd=关键字&cl=3cl(Class):搜索类型 ...
百度搜索常用api
http://www.baidu.com/s?wd=关键字 wd(Keyword):查询的关键词:http://www.baidu.com/s?wd=关键字&cl=3 cl(Class):搜索 ...
Chrome谷歌浏览器屏蔽百度搜索右侧广告推荐方法
先上图百度广告,其实屏蔽广告很简单主要分成以下三步: 下载Adblock Plus插件安装Adblock Plus插件开启屏蔽一.下载Adblock Plus插件(官网离线版) 二.安装Adb ...
使用python抓取百度搜索、百度新闻搜索的关键词个数
由于实验的要求,需要统计一系列的字符串通过百度搜索得到的关键词个数,于是使用python写了一个相关的脚本. 在写这个脚本的过程中遇到了很多的问题,下面会一一道来. ps:我并没有系统地学习过pyth ...
利用 lucene.net 实现高效率的 WildcardQuery ，记一次类似百度搜索下拉关键字联想功能的实现。
打开百度输入站内搜索也要实现类似功能.最基础的做法,写个方法查数据库搜索历史综合表keywordSearch(先将被搜索过的关键字记录到一张表,记录好他们被搜索的次数.上次搜索的有多少结果) 大概 ...

随机推荐

C# 导出excel文件处理科学计数法办法
在邦定gridview控件时在rowdatabound事件中队数据格式化 protected void DataGridView1_RowDataBound(object sender, GridVi ...
生成证书，用于签名Android应用
1. keytool 命令 1)使用JDK中的一个命令keytool,都有哪些命令呢,使用 keytool -help 进行查看 2)本次使用 keytool -genkeypair 命令生成签名,查 ...
Ajax回退刷新页面问题的解决办法
在脚本之家看到一篇文章,觉得以后可能会用上,但是竟然不能收藏,所以只能将其转到博客园. 以下是原文地址: http://www.jb51.net/article/87856.htm 这篇文章主要介 ...
BIND简易教程（1）：安装及基本配置
首先,为什么说是简易教程呢?因为BIND的功能实在太多,全写出来的话要连载好久,我觉得我没有那么多精力去写:而我了解的仅仅是有限的一点点,不敢造次.百度上的文章也是一抓一大把呐!所以,教点基本使用方法 ...
api的使用机制：继承、实例化、实现（继承）配置、实例（参数化）配置、机制管理模块
api的使用机制:继承.实例化.实现(继承)配置.实例(参数化)配置.机制管理模块 facade模式.管理模块
TCP建立连接和释放连接过程
TCP(Transmission Control Protocol 传输控制协议)是一种面向连接的.可靠的.基于字节流的传输层通信协议.TCP建立连接需要三次握手,释放连接需要四次握手. 1.TCP整 ...
Centos 安装libevent
1.在http://libevent.org/下载libevent-2.1.8-stable.tar.gz 2.解压缩 tar -zxvf libevent-2.1.8-stable.tar.gz c ...
Linux学习总结（十六）系统用户及用户组管理
先来认识两个文件 /etc/passwd/etc/shadow我们打印出首尾三行,来了解下:每行由:分割为7段,每段含义为:第一段:用户名,比如root 用户,普通用户test,lv,test1第二段 ...
mac终端terminal快捷键
mac终端terminal快捷键: Command + K 清屏 Command + T 新建标签 Command +W 关闭当前标签页 Command + S 保存终端输出 Command + ...
oracle空间分析
相交 sdo_relate(t.geom, sdo_geometry(:geometry,null),\'mask=ANYINTERACT\')=\'TRUE\'

用Head方法获得百度搜索结果的真实地址

用Head方法获得百度搜索结果的真实地址

用Head方法获得百度搜索结果的真实地址的更多相关文章

随机推荐

热门专题