一、背景:在爬取网络小说生成的文件中,发现有些空格没法替换,使用十六进制编辑器查看,发现这些空格字符的十六进制值是“c2a0”,其来源是网页控制的特殊字符,这是一个叫做Non-breaking space的东西,用于阻止在此处自动换行和阻止多个空格被压缩成一个。就是&nbsp。

二、替换的有效方法:使用str.replace(u'\xa0',u'')命令即可

三、示例
(1)原始文件:1.txt
显示如下:(每一行前面都有四个“c2a0”,显示为4个空格,即显示?之处)
(base) [python@ELK ~]$ vi 1.txt
????第一章预言

????除了没用的肉体自杀和精神逃避,第三种自杀的态度是坚持奋斗,对抗人生的荒谬。

????这是加缪,一个存在主义大师说的,云琅非常的认同这句话。

使用:%!xxd命令进入十六进制编辑状态,显示如下:
(base) [python@ELK ~]$ vi 1.txt
0000000: c2a0 c2a0 c2a0 c2a0 e7ac ace4 b880 e7ab  ................
0000010: a0e9 a284 e8a8 800a 0ac2 a0c2 a0c2 a0c2  ................
0000020: a0e9 99a4 e4ba 86e6 b2a1 e794 a8e7 9a84  ................
0000030: e882 89e4 bd93 e887 aae6 9d80 e592 8ce7  ................
0000040: b2be e7a5 9ee9 8083 e981 bfef bc8c e7ac  ................
0000050: ace4 b889 e7a7 8de8 87aa e69d 80e7 9a84  ................
0000060: e680 81e5 baa6 e698 afe5 9d9a e68c 81e5  ................
0000070: a58b e696 97ef bc8c e5af b9e6 8a97 e4ba  ................
0000080: bae7 949f e79a 84e8 8d92 e8b0 ace3 8082  ................
0000090: 0a0a c2a0 c2a0 c2a0 c2a0 e8bf 99e6 98af  ................
00000a0: e58a a0e7 bcaa efbc 8ce4 b880 e4b8 aae5  ................
00000b0: ad98 e59c a8e4 b8bb e4b9 89e5 a4a7 e5b8  ................
00000c0: 88e8 afb4 e79a 84ef bc8c e4ba 91e7 9085  ................
00000d0: e99d 9ee5 b8b8 e79a 84e8 aea4 e590 8ce8  ................
00000e0: bf99 e58f a5e8 af9d e380 820a            ............

(2)替换代码:1.py
(base) [python@ELK ~]$ vi 1.py
# -*- coding:utf-8 -*-
import os
f=open("1.txt","r")
str=f.read()
str1=str.replace(u"\xa0", u'')   #注意,此处"\xa0"不能输入为"\xc2\xa0"!
g=open("3.txt","w",encoding="utf-8")
g.write(str1)

(3)输出的新文件:3.txt
显示如下:(每一行前面的异常空格已不见了)
(base) [python@ELK ~]$ vi 3.txt
第一章预言

除了没用的肉体自杀和精神逃避,第三种自杀的态度是坚持奋斗,对抗人生的荒谬。

这是加缪,一个存在主义大师说的,云琅非常的认同这句话。

关于替换“c2a0”十六进制字符的方法的更多相关文章

  1. JAVA中替换字符的方法replace和replaceAll 区别

    replace和replaceAll是JAVA中常用的替换字符的方法,它们的区别是:1)replace的参数是char和CharSequence,即可以支持字符的替换,也支持字符串的替换(CharSe ...

  2. Notepad++正则表达式查找替换文本中文字符

    测试需求 测试工具中xml配置文件中注释字段包含中文字符,在Win10系统下使用工具中偶尔会出现中文乱码导致配置文件失效.解决方法将配置文件中的中文注释换成英文注释或者直接替换删除.如何将配置文件中的 ...

  3. python购物&常用字符处理方法

    python 一个购物车的例子 1 #!/usr/bin/env python 2 # -*- coding:utf-8 -*- 3 '''购物车''' 4 5 goods = [ 6 7 {&quo ...

  4. ASP.NET开发中主要的字符验证方法-JS验证、正则表达式、验证控件、后台验证

    ASP.NET开发中主要的字符验证方法-JS验证.正则表达式.验证控件.后台验证 2012年03月19日 星期一 下午 8:53 在ASP.NET开发中主要的验证方法收藏 <1>使用JS验 ...

  5. 【Linux基础】tr命令替换和删除字符

    1.tr命令 tr可以对来自标准输入的字符进行替换.压缩和删除,可以将一组字符变成另外一组字符.通过使用 tr,您可以非常容易地实现 sed 的许多最基本功能.您可以将 tr 看作为 sed 的(极其 ...

  6. tr 替换或删除字符

    1.命令功能 tr 从标准输入中替换,压缩间隔或者删除字符并从定向到标准输出. 2.语法格式 tr  option  SET1  SET2 参数 参数说明 -c 取代所有SET1中字符串 -d 删除所 ...

  7. linux(centos8):用tr替换或删除字符

    一,tr命令的用途 tr命令可以替换或删除文件中的字符 它从标准输入设备读取数据, 处理完成将结果输出到标准输出设备 说明:刘宏缔的架构森林是一个专注架构的博客,地址:https://www.cnbl ...

  8. python字符串替换的2种有效方法

    python 字符串替换可以用2种方法实现:1是用字符串本身的方法.2用正则来替换字符串 下面用个例子来实验下:a = 'hello word'我把a字符串里的word替换为python1用字符串本身 ...

  9. Java中生成随机字符的方法总结

    package learnExercise; public class RandomCharacter { public static char getRandomCharacter(char ch1 ...

随机推荐

  1. 编程坑太多,Map 集合怎么也有这么多坑?一不小心又踩了好几个!

    点赞再看,养成习惯,微信搜索『程序通事』,关注就完事了! 点击查看更多历史文章 上一篇 List 踩坑文章中,我们提到几个比较容易踩坑的点.作为 List 集合好兄弟 Map,我们也是天天都在使用,一 ...

  2. Java——Spring依赖配置详解

    <properties> <junit.version>4.12</junit.version> <spring.version>4.3.9.RELEA ...

  3. Oracle触发器之替代触发器

    替代触发器 替代视图增删改操作.视图可以认为成逻辑上的一张表,类似于把一个sql语句的执行结果永久的像表存储到数据 库中,视图一般用来做查询. 创建视图的语法: create view 视图名称 as ...

  4. 王颖奇 201771010129 《面向对象程序设计(java)》第二周学习总结

    <面向对象程序设计(java)>第二周学习总结 王颖奇 201771010129 第一部分:实验目的与要求 ①理论部分目的与要求 (1)基本知识(2)数据类型(3)变量(4)运算符(5)类 ...

  5. 07_CSS入门和高级技巧(5)

    超级链接美化 1.伪类 同一个超级链接,根据用户的点击情况,有自己样式: 超级链接根据用户点选情况,有4种状态: a:link 没有访问的超级链接 a:visited 已经访问的超级链接 a:hove ...

  6. hex文件格式总结

    hex文件格式总结 文章目录 hex文件格式总结 什么是hex文件? 文件格式 指令类型(Record type) 校验和 :04 02B0 00 92020008 AE :04 0000 05 08 ...

  7. 盘点6个Kubernetes监视工具

    导读:监控可帮助您确保Kubernetes应用程序平稳运行并排除可能出现的任何问题.Prometheus是一种流行的开源监视工具,许多公司都使用它来监视其IT基础结构.但是,还有许多其他监视工具可用. ...

  8. git --添加多个文件

    今天测试,发现之前写的auto testcase,有好多发生了改变,因此需要修改脚本重新上传至git当中. 对好几个test case script 进行了修改,之前只是一个一个的修改,这次是多个,经 ...

  9. mybatis 自定义缓存 cache

    缓存不管哪个框架都是显得特别的重要,今天自己测试实现了mybatis自定义缓存,从而理解mybatis缓存的工作原理. 首先缓存类要实现Cache接口:具体实现如下package com.ibatis ...

  10. mybatis collection的使用

    Mybatis collection的使用 今天学习了mybatis中的collection使用,作为记录以后使用.首先看一下javabean的结构! public class Article {   ...