Linux企业级项目实践之网络爬虫（5）—

配置文件在Linux下使用得非常普遍，但是Linux下没有统一个配置文件标准。

我们把配置文件的规则制定如下：

1、把“#”视作注释开始

2、所有的配置项都都是以键值对的形式出现

3、严格区分大小写

4、允许数据类型为整型的配置项

5、允许数据类型为字符串类型的配置项

6、允许数据类型为逻辑型的配置项，取值为yes或者no。

同时我们需要对配置文件做初始化和载入两个操作。

代码如下：

/* confparser.c*/

#ifndef CONFPARSER_H

#define CONFPARSER_H

#include <vector>

using namespace std;

#define MAX_CONF_LEN  1024

#define CONF_FILE     "spider.conf"

/* see the spiderq.conf to get meaning foreach member variable below */

typedef struct Config {

   int              max_job_num;

   char            *seeds;

   char            *include_prefixes;

   char            *exclude_prefixes;

   char            *logfile;

   int              log_level;

   int              max_depth;

   int              make_hostdir;

   int              stat_interval;

   char *           module_path;

   vector<char *>   modules;

   vector<char *>  accept_types;

};

extern Config * initconfig();

extern void loadconfig(Config *conf);

#endif

/* confparser.c*/

#include "spider.h"

#include "qstring.h"

#include "confparser.h"

#define INF 0x7FFFFFFF

Config * initconfig()

{

   Config *conf = (Config *)malloc(sizeof(Config));

   conf->max_job_num = 10;

   conf->seeds = NULL;

   conf->include_prefixes = NULL;

   conf->exclude_prefixes = NULL;

   conf->logfile = NULL;

   conf->log_level = 0;

   conf->max_depth = INF;

   conf->make_hostdir = 0;

   conf->module_path = NULL;

   conf->stat_interval = 0;

   //conf->modules

   return conf;

}

void loadconfig(Config *conf)

{

   FILE *fp = NULL;

   char buf[MAX_CONF_LEN+1];

   int argc = 0;

   char **argv = NULL;

   int linenum = 0;

   char *line = NULL;

   const char *err = NULL;

   if ((fp = fopen(CONF_FILE, "r")) == NULL) {

       SPIDER_LOG(SPIDER_LEVEL_ERROR, "Can't load conf_file %s",CONF_FILE);

    }

   while (fgets(buf, MAX_CONF_LEN+1, fp) != NULL) {

       linenum++;

       line = strim(buf);

       if (line[0] == '#' || line[0] == '\0') continue;

       argv = strsplit(line, '=', &argc, 1);

       if (argc == 2) {

           if (strcasecmp(argv[0], "max_job_num") == 0) {

                conf->max_job_num =atoi(argv[1]);

           } else if (strcasecmp(argv[0], "logfile") == 0) {

               conf->logfile =strdup(argv[1]);

           } else if (strcasecmp(argv[0], "include_prefixes") == 0) {

                conf->include_prefixes =strdup(argv[1]);

           } else if (strcasecmp(argv[0], "exclude_prefixes") == 0) {

                conf->exclude_prefixes =strdup(argv[1]);

           } else if (strcasecmp(argv[0], "seeds") == 0) {

                conf->seeds =strdup(argv[1]);

           } else if (strcasecmp(argv[0], "module_path") == 0) {

                conf->module_path =strdup(argv[1]);

           } else if (strcasecmp(argv[0], "load_module") == 0) {

               conf->modules.push_back(strdup(argv[1]));

           } else if (strcasecmp(argv[0], "log_level") == 0) {

                conf->log_level =atoi(argv[1]);

           } else if (strcasecmp(argv[0],"max_depth") == 0) {

                conf->max_depth =atoi(argv[1]);

           } else if (strcasecmp(argv[0], "stat_interval") == 0) {

                conf->stat_interval =atoi(argv[1]);

           } else if (strcasecmp(argv[0], "make_hostdir") == 0) {

                conf->make_hostdir =yesnotoi(argv[1]);

           } else if (strcasecmp(argv[0], "accept_types") == 0) {

               conf->accept_types.push_back(strdup(argv[1]));

            } else {

                err = "Unknowndirective"; goto conferr;

           }

       } else {

           err = "directive must be 'key=value'"; goto conferr;

       }

    }

   return;

conferr:

   SPIDER_LOG(SPIDER_LEVEL_ERROR, "Bad directive in %s[line:%d]%s", CONF_FILE, linenum, err);

}

Linux企业级项目实践之网络爬虫（5）——处理配置文件的更多相关文章

Linux企业级项目实践之网络爬虫（1）——项目概述及准备工作
我们在学习了Linux系统编程之后,需要一些实战项目来提高自己的水平,本系列我们通过编写一个爬虫程序,将我们学习的知识进行综合应用,同时在实现项目的过程中逐渐养成一些有用的思维方式,并具有初步的软件开 ...
Linux企业级项目实践之网络爬虫（29）——遵守robots.txt
Robots协议(也称为爬虫协议.机器人协议等)的全称是"网络爬虫排除标准"(Robots Exclusion Protocol),网站通过Robots协议告诉搜索引擎哪些页面可以 ...
Linux企业级项目实践之网络爬虫（21）——扩展为多任务爬虫
高效的网络爬虫是搜索引擎的重要基础.采用多任务并发执行,实现类似于CPU的流水线(pipeline)运行方式,可极大地提高网络和计算资源的利用率等性能. #include "threads. ...
Linux企业级项目实践之网络爬虫（2）——网络爬虫的结构与工作流程
网络爬虫是捜索引擎抓取系统的重要组成部分.爬虫的主要目的是将互联网上的网页下载到本地形成一个或联网内容的镜像备份. 一个通用的网络爬虫的框架如图所示:
Linux企业级项目实践之网络爬虫（23）——系统测试：找出系统中的bug
为了验证爬虫的业务流程.性能和健壮性需要进行测试. 软件测试是描述一种用来促进鉴定软件的正确性.完整性.安全性和质量的过程.软件测试的经典定义是:在规定的条件下对程序进行操作,以发现程序错误,衡量软件 ...
Linux企业级项目实践之网络爬虫（28）——爬虫socket处理
Socket是进程之间交换数据的机制.这些进程即可以是同一台机器上的,也可以是通过网络连接起来的不同机器.一旦一个Socket连接建立,那么数据就能够双向传输,直到其中一端关闭连接. 通常,请求数据的 ...
Linux企业级项目实践之网络爬虫（19）——epoll接口
由于要实现爬虫程序的快速抓取,显然如果采用阻塞型的I/O方式,那么系统可能很长时间都处在等待内核响应的状态中,这样爬虫程序将大大地降低效率.然而,如果采用非阻塞I/O,那么就要一直调用应用进程,反复对 ...
Linux企业级项目实践之网络爬虫（6）——将程序设计成为守护进程
在linux或者unix操作系统中在系统的引导的时候会开启很多服务,这些服务就叫做守护进程.为了增加灵活性,root可以选择系统开启的模式,这些模式叫做运行级别,每一种运行级别以一定的方式配置系统. ...
Linux企业级项目实践之网络爬虫（3）——设计自己的网络爬虫
网络抓取系统分为核心和扩展组件两部分.核心部分是一个精简的.模块化的爬虫实现,而扩展部分则包括一些便利的.实用性的功能.目标是尽量的模块化,并体现爬虫的功能特点.这部分提供简单.灵活的API,在基本不 ...
Linux企业级项目实践之网络爬虫（30）——通过查阅RFC文档扩充更加复杂的功能
HTTP是一种很简单的请求.响应式协议,客户端发送一个请求.服务器返回一个响应.HTTP 1.1 版本规范由 RFC2616 定义.了解了 HTTP请求.响应消息在TCP数据流中的格式,很容易使用纯 ...

随机推荐

intent-filter data Uri 意图过滤器详解
组件的intent-filter属性如果一个 Intent 请求在一片数据(Uri)上执行一个动作(Action), Android 如何知道哪个应用程序的哪个组件能用来响应这个请求 ...
Char Tools，方便的字符编码转换小工具
工作关系,常有字符编码转换方面的需要,写了这个小工具 Char Tools是一款方便的字符编码转换小工具,基于.Net Framework 2.0 Winform开发主要功能 URL编码:URLEn ...
C复习手记(Day3)
C预处理器 C 预处理器不是编译器的组成部分,但是它是编译过程中一个单独的步骤.简言之,C 预处理器只不过是一个文本替换工具而已,它们会指示编译器在实际编译之前完成所需的预处理.我们将把 C 预处理器 ...
Ruby与sass 与compass安装
Ruby安装 windows平台下使用Rubyinstaller安装 1) 下载Rubyinstaller 2) 安装Rubyinstaller 记得勾选 add ruby executables ...
angularJS环境安装
第一步: 安装node.js,进入node.js官网(http://nodejs.org/)下载安装相应的node.js版本:
详细介绍ASP.NET页面重定向方法
ASP.NET中页面重定向的使用的很频繁,实现方法也有不同,自己也试过几种,现在总结一下. 一.Transfer Execute Redirect重定向方法介绍 1.Server.Transfer方法 ...
Sql时间函数
一.sql server日期时间函数 Sql Server中的日期与时间函数 1. 当前系统日期.时间 select getdate() 2. dateadd 在向指定日期加上一段时间 ...
完整的Ajax实例
写在前面的话: 用了很久的Asp.Net Ajax,也看了段时间的jquery中ajax的应用,但到头来,居然想不起xmlHttpRequest的该如何使用了. 以前记的也不怎么清楚,这次就重新完整的 ...
CSS学习笔记总结和技巧
跟叶老师说项目,他叫我写一个静态首页,看起来挺简单的,但是下手才发现在真的不会怎么下手啊,什么模型啊模块啊都不懂,写毛线啊!! 如图:页面下拉还有侧栏,中间内容等. 可是答应跟老师做了,不能怂啊,于是 ...
一个简单C程序的汇编代码分析
几个重要的寄存器 eip - 用于存放当前所执行的指令地址 esp - 栈(顶)指针寄存器 ebp - 基址(栈底)指针寄存器简单的C程序 int g(int x) { ; } int f(int ...

Linux企业级项目实践之网络爬虫（5）——处理配置文件

Linux企业级项目实践之网络爬虫（5）——处理配置文件的更多相关文章

随机推荐

热门专题