wget下载整个网站的方法

转自: http://blog.itpub.net/29867/viewspace-716088/

(修改部分内容)

wget --restrict-file-name=ascii -m -c -nv -np -k -E -p http://www.w3school.com.cn/
wget --restrict-file-name=ascii -m -c -nv -np -k -E -p http://scrapy-chs.readthedocs.org

参数释义如下：

--restrict-file-name=ascii ，将文件名保存为ASCII格式。这样能避免utf-8文件名带来的麻烦（注：1.12版才支持ascii参数值）

-m 整站下载，mirror的缩写，是-N -r -l inf --no-remove-listing 这几个参数的快捷方式，具体详阅各自的说明

-c 续传

-nv 不显示详细的下载详情

-np don’t ascend to the parent directory.即下载的Web页面不越过后面指定的 http://www.xxx.com的范围。当然，如果你指定的是 http://www.xxx.com/aaa，则所有的web页面都要在 http://www.xxx.com/aaa下

-k 下载完成后，将页面文件中的链接转换为本地链接，便于离线浏览和制作chm等

-E 保存html/css文件时，使用合适的文件后缀。例如，在某些网站有些文件是服务器端动态生成的，虽然是css文件，但后缀并不是css，-E选项可以调整之

-p -np对页面文件做了限制，如果不加-p，则html所需的媒体文件也会受限于-np，-p则会下载html/css文件所需的所有媒体文件（图片、音频、视频等）

-R 拒绝下载的文件后缀列表，逗号分隔

至于下载到的文件的文件名变为了形如%A7这样百分号加16进制数字的形式，可以用个python程序来改变文件名：

————————————————————————————————————

import os, urllib, sys, getopt

class Renamer:

input_encoding = ""

output_encoding = ""

path = ""

is_url = False

def __init__(self, input, output, path, is_url):

self.input_encoding = input

self.output_encoding = output

self.path = path

self.is_url = is_url

def start(self):

self.rename_dir(self.path)

def rename(self, root, path):

try:

if self.is_url:

new = urllib.unquote(path).decode(self.input_encoding).encode(self.output_encoding)

else:

new = path.decode(self.input_encoding).encode(self.output_encoding)

os.rename(os.path.join(root, path), os.path.join(root, new))

except:

pass

def rename_dir(self, path):

for root, dirs, files in os.walk(path):

for f in files:

self.rename(root, f)

if dirs == []:

for f in files:

self.rename(root, f)

else:

for d in dirs:

self.rename_dir(os.path.join(root, d))

self.rename(root, d)

def usage():

print '''This program can change encode of files or directories.

Usage: rename.py [OPTION]...

Options:

-h, --help this document.

-i, --input-encoding=ENC set original encoding, default is UTF-8.

-o, --output-encoding=ENC set output encoding, default is GBK.

-p, --path=PATH choose the path which to process.

-u, --is-url whether as a URL

'''

def main(argv):

input_encoding = "utf-8"

output_encoding = "gbk"

path = ""

is_url = True

try:

opts, args = getopt.getopt(argv, "hi:o:p:u", ["help", "input-encoding=", "output-encoding=", "path=", "is-url"])

except getopt.GetoptError:

usage()

sys.exit(2)

for opt, arg in opts:

if opt in ("-h", "--help"):

usage()

sys.exit()

elif opt in ("-i", "--input-encoding"):

input_encoding = arg

elif opt in ("-o", "--output-encoding"):

output_encoding = arg

elif opt in ("-p", "--path"):

path = arg

elif opt in ("-u", "--is-url"):

is_url = True

rn = Renamer(input_encoding, output_encoding, path, is_url)

rn.start()

if __name__ == '__main__':

main(sys.argv[1:])

————————————————————————————————————

rename.py -i utf-8 -o gbk -p <指定的下载目录> -u

文件改名方法来自于http://blog.csdn.net/kowity/article/details/6899256

wget下载整个网站的方法的更多相关文章

linux下使用wget下载整个网站
linux下可以用wget下载整个网站,而且网站链接中包含utf-8编码的中文也能正确处理. 简要方法记录如下: wget --restrict-file-name=ascii -m -c -nv - ...
wget下载整个网站
wget下载整个网站wget下载整个网站可以使用下面的命令 wget -r -p -k -np http://hi.baidu.com/phps , -r 表示递归下载,会下载所有的链接,不过要注意的 ...
wget下载整个网站---比较实用--比如抓取Smarty的document
wget下载整个网站可以使用下面的命令 wget -r -p -k -np http://hi.baidu.com/phps, -r 表示递归下载,会下载所有的链接,不过要注意的是,不要单独使用这个参 ...
为什么wget只下载某些网站的index.html？ wget --random-wait -r -p -e robots=off -U mozilla http://www.example.com wget 下载整个网站，或者特定目录
wget -c -r -np -k -L -p http://blog.hesheyou.me -c, –continue 接着下载没下载完的文件 -r, –recursive 递归下载 -np, – ...
wget下载整个网站或特定目录
下载整个网站或特定目录 wget -c -k -r -np -p http://www.yoursite.com/path -c, –continue 断点下载 -k, –convert-links ...
wget 下载整个网站，或者特定目录
需要下载某个目录下面的所有文件.命令如下 wget -c -r -np -k -L -p www.xxx.org/pub/path/ 在下载时.有用到外部域名的图片或连接.如果需要同时下载就要用-H参 ...
Centos下wget下载整个网站，或者目录全部文件
需要下载某个目录下面的所有文件.命令如下 wget -c -r -np -k -L -p www.xxx.org/pub/path/ 在下载时.有用到外部域名的图片或连接.如果需要同时下载就要用-H参 ...
[转]wget 下载整个网站，或者特定目录
FROM : http://www.cnblogs.com/lidp/archive/2010/03/02/1696447.html 需要下载某个目录下面的所有文件.命令如下 wget -c -r - ...
[No00006B]方便的网络下载工具wget 可下载网站目录下的所有文件(可下载整个网站)
wget是linux下命令行的下载工具,功能很强大,它能完成某些下载软件所不能做的,比如如果你想下载一个网页目录下的所有文件,如何做呢?网络用户有时候会遇到需要下载一批文件的情况,有时甚至需要把整个网 ...

随机推荐

python——“/”运算符和“//”运算符的区别
首先先看单斜杆的用法:举几个例子 >>> print(5/3),type(5/3)1.6666666666666667(None, <class 'float'>) &g ...
[Codeforces375D]Tree and Queries(莫队算法)
题意:给定一棵树,每个节点有颜色,对于每个询问(u,k)询问以u为根节点的子树下有多少种颜色出现次数>=k 因为是子树,跟dfs序有关,转化为一段区间,可以用莫队算法求解直接用一个数组统计出现 ...
js石头剪刀布小游戏
代码: <!DOCTYPE html> <html> <head> <meta charset="utf-8"> <title ...
Hive 的企业优化
优化数据优化一.从大表拆分成小表(更快地检索) 引用:Hive LanguageManual DDL eg2:常用于分表 create table if not exists default.ce ...
P1182 数列分段Section II
P1182 数列分段Section II 题目描述对于给定的一个长度为N的正整数数列A[i],现要将其分成M(M≤N)段,并要求每段连续,且每段和的最大值最小. 关于最大值最小: 例如一数列4 2 ...
通俗版解释网关，IP地址，ARP欺骗，DDOS攻击
计算机主机网关的作用是什么? 假设你的名字叫小不点,你住在一个大院子里,你的邻居有很多小伙伴,在门口传达室还有个看大门的李大爷,李大爷就是你的网关.当你想跟院子里的某个小伙伴玩,只要你在院子里大喊一声 ...
Mongoid Paging and Iterating Over Large Collections
遍历数据库中的所有记录时,我们首先想到的是Model.all.each.但是,当数据量很大的时候(数万?),这就不怎么合适了,因为Model.all.each会一次性加载所有记录,并将其实例化成 Mo ...
我给女朋友讲编程CSS系列(4) CSS盒子模型
什么是CSS盒子模型?如何学习CSS的盒子模型? 这篇文章,以 [分享 + 结论] 的方式来写. 1, 看w3school的[CSS 框模型概述] 网址为: http://www.w3school ...
c语言在windows下和Mac下的不同表现！
最近给一个等级考试的C语言培训班上课,学生问起一些++的问题.让我好生为难.因为这些不同的编译器处理方式,在不同的系统下表现并不一致. 不管你洋洋洒洒论述多么一大篇,在事实面前就一下显得苍白了.虽然这 ...
牛客网暑期ACM多校训练营（第一场）：J-Different Integers（分开区间不同数+树状数组）
链接:J-Different Integers 题意:给出序列a1, a2, ..., an和区间(l1, r1), (l2, r2), ..., (lq, rq),对每个区间求集合{a1, a2, ...

wget下载整个网站的方法

wget下载整个网站的方法的更多相关文章

随机推荐

热门专题