[爬虫]2.3.1 使用Python操作文件系统

博客0214 2024-06-10 13:13:00 原文

Python提供了许多内置库来处理文件系统，如os、shutil和pathlib等，这些库可以帮助你创建、删除、读取、写入文件和目录。

读取文件

在Python中，你可以使用内置的open函数来打开一个文件。open函数返回一个文件对象，你可以对这个对象进行各种操作。

以下是一个读取文件的例子：

with open('example.txt', 'r') as f:

    content = f.read()

print(content)

open函数的第一个参数是文件的路径，第二个参数是模式。在这个例子中，模式是'r'，表示读取。

使用with语句可以自动关闭文件，这是一个好习惯。

read方法可以读取文件的全部内容。如果文件很大，你可能想要使用readline或readlines方法来分行读取。

写入文件

你也可以使用open函数来写入文件。只需将模式改为'w'或'a'即可。'w'表示写入，如果文件已存在，它将被覆盖。'a'表示追加，如果文件已存在，新的内容将被添加到文件的末尾。

以下是一个写入文件的例子：

with open('example.txt', 'w') as f:

    f.write('Hello, Python!')

write方法可以将一个字符串写入文件。

操作目录

你可以使用os库来操作目录。

例如，你可以创建一个新的目录：

import os

os.mkdir('example')

你也可以删除一个目录：

os.rmdir('example')

你可以获取当前的工作目录：

cwd = os.getcwd()

print(cwd)

你也可以改变工作目录：

os.chdir('/path/to/directory')

文件路径

在处理文件路径时，你可能会遇到许多问题，如路径分隔符在不同操作系统下的差异。为了解决这些问题，你可以使用os.path或pathlib库。

以下是一些常用的路径操作：

import os

# 连接路径

path = os.path.join('directory', 'file.txt')

# 分割路径

directory, file = os.path.split(path)

# 获取文件的扩展名

extension = os.path.splitext(file)[1]

# 检查文件或目录是否存在

exists = os.path.exists(path)

这就是Python处理文件系统的基本知识。现在，你可以尝试使用这些知识来存储你爬取的数据了。

推荐阅读：

https://mp.weixin.qq.com/s/dV2JzXfgjDdCmWRmE0glDA

https://mp.weixin.qq.com/s/an83QZOWXHqll3SGPYTL5g

[爬虫]2.3.1 使用Python操作文件系统的更多相关文章

第三百五十节，Python分布式爬虫打造搜索引擎Scrapy精讲—selenium模块是一个python操作浏览器软件的一个模块，可以实现js动态网页请求
第三百五十节,Python分布式爬虫打造搜索引擎Scrapy精讲—selenium模块是一个python操作浏览器软件的一个模块,可以实现js动态网页请求 selenium模块 selenium模块为 ...
爬虫(九)：python操作MySQL、MongoDB
1. python操作MySQL 1.1 MySQL基础在java基础部分就写过了. https://www.cnblogs.com/liuhui0308/p/11891844.html 1.2 p ...
Python 操作 MySQL 的5种方式(转)
Python 操作 MySQL 的5种方式不管你是做数据分析,还是网络爬虫,Web 开发.亦或是机器学习,你都离不开要和数据库打交道,而 MySQL 又是最流行的一种数据库,这篇文章介绍 Pytho ...
Redis常用操作大全和Python操作Redis
简单使用 utils.py import redis POOL=redis.ConnectionPool(host='127.0.0.1',port=6379) view.py 第一种方式 (通用方式 ...
Python学习笔记 - day11 - Python操作数据库
MySQL的事务 MySQL的事务支持不是绑定在MySQL服务器本身,而是与存储引擎相关,MySQL的两种引擎如下: 1.MyISAM:不支持事务,用于只读程序提高性能 2.InnoDB:支持ACID ...
redis缓存数据库及Python操作redis
缓存数据库介绍 NoSQL(NoSQL = Not Only SQL ),意即“不仅仅是SQL”,泛指非关系型的数据库,随着互联网web2.0网站的兴起,传统的关系数据库在应付web2.0网站, 特 ...
redis集群配置及python操作
之前我们分析过喜马拉雅的爬取信息,使用分布式爬取,而且需要修改scrapy-redis的过滤算法为布隆过滤来减少redis内存占用,最后考虑这样还是不一定够,那么redis集群就是更好的一种选择方式了 ...
Python 操作 MySQL 的5种方式
不管你是做数据分析,还是网络爬虫,Web 开发.亦或是机器学习,你都离不开要和数据库打交道,而 MySQL 又是最流行的一种数据库,这篇文章介绍 Python 操作 MySQL 的5种方式,你可以在实 ...
python操作MySQL，SQL注入的问题，SQL语句补充，视图触发器存储过程，事务，流程控制，函数
python操作MySQL 使用过程: 引用API模块获取与数据库的连接执行sql语句与存储过程关闭数据库连接由于能操作MySQL的模块是第三方模块,我们需要pip安装. pip3 insta ...
Python（九） Python 操作 MySQL 之 pysql 与 SQLAchemy
本文针对 Python 操作 MySQL 主要使用的两种方式讲解: 原生模块 pymsql ORM框架 SQLAchemy 本章内容: pymsql 执行 sql 增\删\改\查语句 pymsql ...

随机推荐

YOLO1论文中文版
文章目录 YOLO1中文版摘要 1. 引言 2. 统一检测 2.1 网络设计 2.2 训练 2.3 推断 2.4 YOLO的限制 3. 与其它检测系统的比较 4. 实验 4. 1 与其它实时系统的比 ...
RocketMQ的简单使用
大家好,我是Leo!今天来和大家分享RocketMQ的一些用法. 领域模型介绍 Producer: 用于生产消息的运行实体. Topic: 主题,用于消息传输和存储的分组容器. MessageQueu ...
【Linux】(小白向)详解VirtualBox网络配置-配置Linux网络
本文时间 2023-05-18 作者:sugerqube漆瓷本文面向新手,重在理解会舍弃不少精密的理论,还请大佬们见谅. 本文目标:成功使用ssh工具登录linux,同时linux能连接外网. 网络 ...
深入 Hyperf：HTTP 服务启动时发生了什么？
当我们创建 Hyperf 项目之后,只需要在终端执行 php bin/hyperf.php start 启动命令,等上几秒钟,就可以看到终端输出的 Worker 进程已启动,HTTP 服务监听在 95 ...
Pyhton F字符串引起的invalid syntax
事发现场偶然运行到之前写的爬虫,发现运行不了,报错invalid syntax,于是来找bug 报错截图: 原因: 这样用法称之为 f-string f-string,亦称为格式化字符串常量(for ...
ABP - 依赖注入(1)
依赖注入实现了系统之间.模块之间和对象之间依赖关系的解耦,基本上是现代应用程序框架必不可少的一个组成部分. ABP的依赖注入系统是基于Microsoft的依赖注入扩展库(Microsoft.Exten ...
2023 5.14 虚拟环境安装Linux
1.安装配置VM虚拟机 vmare workstation 虚拟机是一款桌面计算机虚拟软件让用户能够在单一主机上同事运行多个操作系统 1.每个虚拟操作系统的硬盘与数据都是独立 2.多台虚拟机可以构建 ...
.Net Aspose.Words 生成Word文档
.Net Aspose.Words 生成Word文档在开发WinForm项目中,有一需求要生成Word文档,百度学习,记录一下实现方法 NuGet包,找到 Aspose.Words 安装 21.8. ...
《数据结构》之栈和堆结构及JVM简析
导言: 在数据结构中,我们第一了解到了栈或堆栈,它的结构特点是什么呢?先进后出,它的特点有什么用呢?我们在哪里可以使用到栈结构,栈结构那么简单,使用这么久了为什么不用其它结构替代? 一.程序在内存中的 ...
STM32 + RT-Thread + LwIp + DM9000
一.概述开发板:STM32F103ZET6(战舰) RT-Thread:5.0.0 LwIp:2.1.2 网卡芯片:DM9000 编译环境:keil 我简单了解了一下,在嵌入式中,网络芯片的使用方式 ...