百度贴吧纵向爬取

上一个是横向爬取的，这个纵向爬取，具体怎么做的看代码

package main

import (

	"fmt"

	"io"

	"net/http"

	"os"

	"regexp"

	"strconv"

)

func HttpGetDB(url string) (result string, err error) {

	resp, err1 := http.Get(url)

	if err1 != nil {

		err = err1

		return

	}

	defer resp.Body.Close()

	buf := make([]byte, 4096)

	for {

		n, err2 := resp.Body.Read(buf)

		if n == 0 {

			break

		}

		if err2 != nil && err2 != io.EOF {

			err = err2

			return

		}

		result += string(buf[:n])

	}

	return

}

func Save2file(idx int, fileName [][]string) {

	path := "第" + strconv.Itoa(idx) + "页" + ".txt"

	f, err := os.Create(path)

	if err != nil {

		fmt.Println("os.Create err", err)

		return

	}

	defer f.Close()

	n := len(fileName)

	f.WriteString("名称\n")

	for i := 0; i < n; i++ {

		f.WriteString(fileName[i][1] + "\n")

	}

}

func SpiderPageDB(idx int, page chan int) {

	//	url := "https://movie.douban.com/review/best/?start=" + strconv.Itoa((idx-1)*20)

	//	url := "https://movie.douban.com/annual/2018?source=navigation#" + strconv.Itoa(idx-1)

	//	https://movie.douban.com/review/best/?start=20

	url := "https://tieba.baidu.com/f?kw=vue&ie=utf-8&pn=" + strconv.Itoa((idx-1)*50)

	result, err := HttpGetDB(url)

	if err != nil {

		fmt.Println("HttpGet2 err", err)

		return

	}

	//	fmt.Println("result=", result)

	ret := regexp.MustCompile(`<span class="tb_icon_author_rely j_replyer" title="最后回复人:(?s:(.*?))"`)

	fileName := ret.FindAllStringSubmatch(result, -1)

	//	for _, name := range fileName {

	//		fmt.Println("name", name[1])

	//	}

	Save2file(idx, fileName)

	page <- idx

}

func toWork(start, end int) {

	fmt.Printf("正在爬取%d到%d页。。。\n", start, end)

	page := make(chan int)

	for i := start; i <= end; i++ {

		go SpiderPageDB(i, page)

	}

	for i := start; i <= end; i++ {

		fmt.Print("第%d页爬取完成\n", <-page)

	}

}

func main() {

	var start, end int

	fmt.Print("请输入起始页(>=1):")

	fmt.Scan(&start)

	fmt.Print("请输入终止页（>=start）:")

	fmt.Scan(&end)

	toWork(start, end)

}

go-百度贴吧-纵向爬取的更多相关文章

百度地图POI数据爬取，突破百度地图API爬取数目“400条“的限制11。
1.POI爬取方法说明 1.1AK申请登录百度账号,在百度地图开发者平台的API控制台申请一个服务端的ak,主要用到的是Place API.检校方式可设置成IP白名单,IP直接设置成了0.0.0.0 ...
利用python爬取海量疾病名称百度搜索词条目数的爬虫实现
实验原因: 目前有一个医疗百科检索项目,该项目中对关键词进行检索后,返回的结果很多,可惜结果的排序很不好,影响用户体验.简单来说,搜索出来的所有符合疾病中,有可能是最不常见的疾病是排在第一个的,而最有 ...
Java爬取百度图片Google图片Bing图片
先看看抓取的结果. 8个Java类: Startup.java - main函数 ImageCrawler.java - Crawler基类 BaiduImageCrawler.java - 百度图片 ...
Scrapy Learning笔记（四）- Scrapy双向爬取
摘要:介绍了使用Scrapy进行双向爬取(对付分类信息网站)的方法. 所谓的双向爬取是指以下这种情况,我要对某个生活分类信息的网站进行数据爬取,譬如要爬取租房信息栏目,我在该栏目的索引页看到如下页面, ...
Python 爬取热词并进行分类数据分析-[简单准备] （2020年寒假小目标05）
日期:2020.01.27 博客期:135 星期一 [本博客的代码如若要使用,请在下方评论区留言,之后再用(就是跟我说一声)] 所有相关跳转: a.[简单准备](本期博客) b.[云图制作+数据导入] ...
python 爬取全量百度POI
在网上找了很多关于爬取百度POI的文章,但是对“全量”的做法并没有得到最终的解决方案,自己写了一个,但还是不能实现全量POI抓取,能够达到至少50%的信息抓取.注意:这里所指“全量”是能够达到100% ...
python爬虫—爬取百度百科数据
爬虫框架:开发平台 centos6.7 根据慕课网爬虫教程编写代码片区百度百科url,标题,内容分为4个模块:html_downloader.py 下载器 html_outputer.py 爬取数 ...
Python爬虫爬取百度贴吧的图片
根据输入的贴吧地址,爬取想要该贴吧的图片,保存到本地文件夹,仅供参考: #!/usr/bin/python#_*_coding:utf-8_*_import urllibimport urllib2i ...
Python爬虫爬取百度贴吧的帖子
同样是参考网上教程,编写爬取贴吧帖子的内容,同时把爬取的帖子保存到本地文档: #!/usr/bin/python#_*_coding:utf-8_*_import urllibimport urlli ...

随机推荐

jQuery-实现简单的Ajax请求封装
封装的意义在于复用,在于减少重复的代码. 我在项目中做了简单的Ajax请求封装,实现方式如下: //封装Ajax请求 $.extend({ ajaxDirect:function(url,type,d ...
Centos 7 下安装 Jenkins
Jenkins介绍 Jenkins是一个开源的支持自动化构建.部署等任务的平台.基本上可以说是持续集成(CI).持续发布(CD)不可或缺的工具. 安装Java环境 CentOS 7 安装 JAVA环境 ...
python assert断言用法
作用:断言函数运行状态语法:assert condition,判断condition运行状态,若condition状态为false,则上报错误:AssertionError
CSS学习笔记-2D转换模块
2D转换模块: 1.旋转 1.1格式: transform:rotate(45deg); 1.2含义: 表示旋转多少度 ...
gradle+shell实现自动系统签名
前言有时候我们的应用需要系统级的权限来实现一些功能(如静默安装),这时候需要给应用打上系统签名,常规操作打包apk,解压apk,删除META-INF中CERT.RSA和 CERT.SF,然后压缩,用 ...
mysql 查询指定数据库中的表明和字段名
SELECT TABLE_NAME,COLUMN_NAME,COLUMN_COMMENT FROM INFORMATION_SCHEMA.COLUMNS WHERE COLUMN_COMMENT LI ...
Linux-3.14.12内存管理笔记【构建内存管理框架（4）】
虽说前文分析内存管理框架构建的实现,提到了find_zone_movable_pfns_for_nodes(),但这里不准备复述什么,仅针对required_movablecore和required_ ...
Linux 和 Windows 查看当前运行的 python 进程及 GPU、CPU、磁盘利用率
目录查看当前 python 进程 Linux Windows 查看 GPU 利用率 Linux Windows Linux CPU 利用率 Linux 磁盘利用率查看当前 python 进程 Li ...
你不知道的 flex-shrink 计算规则
对于 flex-shrink 我们都知道它在 flex 布局中控制 flex 盒子空间不足时子元素改如何收缩,平常开发中更多的是使用默认值 1 或者设置 0.那设置其他值的时候会有什么效果呢,不少文章 ...
SVO稀疏图像对齐代码分析
SVO使用稀疏直接法计算两帧之间的初始相机位姿,即使用两帧之间稀疏的4*4 patch的光度误差为损失函数,使用G-N优化算法获得两帧之间的位姿变换,由于没有特征匹配过程效率较高.相比自己实现的稀疏直 ...

go-百度贴吧-纵向爬取

百度贴吧纵向爬取

go-百度贴吧-纵向爬取的更多相关文章

随机推荐

热门专题