怎么用Python提取txt的章节目录?_python提取txt中指定行
itomcoil 2025-09-18 20:09 2 浏览
提取txt文本中的章节
在网络上下载的小说,一般是txt格式的,并且往往是没有目录的。
那么有没办法提取出小说的目录呢?
下面是一个示例代码,用于提取txt文本中的章节作为目录:
import re
# 定义章节标题的正则表达式
# 将【正则表达式的字符串形式】编译为一个【正则表达式对象】
pattern = re.compile(r'第[一二三四五六七八九十百千万壹贰叁肆伍陆柒捌玖拾佰仟]{1,6}章')
# 读取txt文件内容
with open('book.txt', 'r', encoding='utf-8') as f:
content = f.read()
# 查找所有匹配的章节标题
for match in pattern.finditer(): # content为需要查找的内容
print(match.group()) # 打印找到的str
这段代码使用正则表达式来查找文本中所有章节标题,并将它们输出到控制台。
在这个例子中,章节标题的格式为 "第X章",其中X表示章节数,可能是中文数字。
如果您的文本中的章节格式不同,请修改正则表达式以匹配您的格式。
re.compile()
re.compile() 是 Python 中正则表达式库 re 中的一个函数。
它的作用是将【正则表达式的字符串形式】编译为一个【正则表达式对象】,这样可以提高正则匹配的效率。
使用 re.compile() 后,可以使用该对象的方法进行匹配和替换操作。
语法:
re.compile(pattern[, flags])
参数说明:
- pattern:要编译的正则表达式字符串
- flags:正则表达式的标志位,可选参数,如IGNORECASE,DOTALL,MULTILINE等
返回值:返回编译后的正则表达式对象
示例:
import re
pattern = re.compile(r'\d+')
可以看出,re.compile() 函数是将正则表达式的字符串形式转化为正则表达式对象,以便使用其方法(match,search,findall...)更高效的进行正则匹配。
re.finditer()
re.finditer() 是 Python 中正则表达式模块 re 中的一个函数,它可以在字符串中查找所有与模式匹配的部分,并返回一个迭代器。
这个迭代器返回每个匹配项作为一个 match 对象,它有一些有用的属性,如 start() 和 end(),可以用来确定匹配的文本的位置。
语法:
re.finditer(pattern, string, flags=0)
参数:
- pattern : 正则表达式模式字符串。
- string : 要查找的字符串。
- flags : 可选,正则表达式的标志参数,如 re.IGNORECASE, re.MULTILINE 等。
示例:
import re
string = "The rain in Spain"
x = re.finditer("ai", string)
for match in x:
print(match.start(), match.group())
输出:
4 ai
说明:上面程序中,在字符串中查找所有 "ai" 的所有匹配项,并使用迭代器输出每个匹配项的开始位置。
相关推荐
- ELK架构部署以及应用_elk部署方案
-
一、ELK介绍ELK代表的是Elasticsearch,Logstash,KibanaElasticsearch:日志存储、搜索分析功能Logstash:数据收集,日志收集系统Kibana:数据可视化...
- 本地部署 DeepSeek Janus Pro 文生图大模型
-
Hello,大家新年好。在这个春节期间最火的显然是DeepSeek了。据不负责统计朋友圈每天给我推送关于DeepSeek的文章超过20篇。打开知乎跟B站也全是DeepSeek相关的内容。...
- DotsOCR 环境搭建指南_dot installation
-
DotsOCR环境搭建指南支持平台:Linux(推荐)或Windows+WSL2项目地址:https://github.com/rednote-hilab/dots.ocr一、Windo...
- spark+python环境搭建_pycharm配置spark环境
-
最近项目需要用到spark大数据相关技术,周末有空spark环境搭起来...目标spark,python运行环境部署在linux服务器个人通过vscode开发通过远程python解释器执行代码准备...
- window下sublimeIDE安装python_win10安装python
-
window下开发python使用sublimeIDE1安装sublimehttp://www.sublimetext.com/22安装PackageControl提供了安装sublime...
- JupyterLab 快速环境配置 (一)_jupyter的环境配置
-
JupyterLab快速环境配置(一)一只小胖子[互联网运营|直播电商|广告行业]从业者软件说明:JupyterLab是一个基于web浏览器的在线文档/代码运行集成环境,支持文档显示/代...
- 栋察宇宙(二十一):Python 文件操作全解析
-
分享乐趣,传播快乐,增长见识,留下美好。亲爱的您,这里是LearingYard学苑!今天小编为大家带来“Python文件操作全解析”欢迎您的访问!Sharethefun,spreadthe...
- 外婆都能学会的Python教程(十八):Python读取配置文件绘制图形
-
前言Python是一个非常容易上手的编程语言,它的语法简单,而且功能强大,非常适合初学者学习,它的语法规则非常简单,只要按照规则写出代码,Python解释器就可以执行。下面是Python的入门教程介绍...
- Python自动化办公应用学习笔记38—文件读写方法2
-
1.文件迭代文件对象是可迭代的,可以逐行迭代文件。withopen('data.txt','r')asfile:forlineinfile:#逐行迭...
- 简析python 文件操作_python文件内容操作
-
一、打开并读文件1、file=open('打开文件的路径','打开文件的权限')#打开文件并赋值给file#默认权限为r及读权限str=read(num)读文件并放到字符串变量中,其中num表...
- 如何在Python中保存文件?如何读取文件?示例代码
-
Python中保存文件是一项非常基本的任务,它允许我们将程序输出保存到磁盘上,以便以后使用或与他人共享。本文将介绍如何在Python中保存文件的方法,以及如何读取已有的文件和为代码添加注释。使用ope...
- 高效办公:Python处理excel文件,摆脱无效办公
-
一、Python处理excel文件1.两个头文件importxlrdimportxlwt其中xlrd模块实现对excel文件内容读取,xlwt模块实现对excel文件的写入。2.读取exce...
- python中12个文件处理高效技巧,不允许你还不知道
-
在Python中高效处理文件是日常开发中的核心技能,尤其是处理大文件或需要高性能的场景。以下是经过实战验证的高效文件处理技巧,涵盖多种常见场景:一、基础高效操作1.始终使用上下文管理器(with语句)...
- python 目录结构的规划,应该先建立好
-
上一篇文章说了【函数、类、模块、包】,现在说一下python一般工程的目录结构一般习惯这样规划目录,在开始一个工程前,最好先把目录结构规划好。一、为什么要有一个比较清晰的目录结构此处省略一万字....
- 和尧名大叔一起从0开始学Python编程-简单读写文件
-
0基础自学编程是很痛苦的一件事情,所以我想把自己学习的这个过程记录下来,让想学编程的人少走弯路,大叔文化程度较低,可能会犯一些错误,欢迎大家督促我。今天,我们来学习一下用Python简单读写文件,这里...
- 一周热门
- 最近发表
-
- ELK架构部署以及应用_elk部署方案
- 本地部署 DeepSeek Janus Pro 文生图大模型
- DotsOCR 环境搭建指南_dot installation
- spark+python环境搭建_pycharm配置spark环境
- window下sublimeIDE安装python_win10安装python
- JupyterLab 快速环境配置 (一)_jupyter的环境配置
- 栋察宇宙(二十一):Python 文件操作全解析
- 外婆都能学会的Python教程(十八):Python读取配置文件绘制图形
- Python自动化办公应用学习笔记38—文件读写方法2
- 简析python 文件操作_python文件内容操作
- 标签列表
-
- ps图案在哪里 (33)
- super().__init__ (33)
- python 获取日期 (34)
- 0xa (36)
- super().__init__()详解 (33)
- python安装包在哪里找 (33)
- linux查看python版本信息 (35)
- python怎么改成中文 (35)
- php文件怎么在浏览器运行 (33)
- eval在python中的意思 (33)
- python安装opencv库 (35)
- python div (34)
- sticky css (33)
- python中random.randint()函数 (34)
- python去掉字符串中的指定字符 (33)
- python入门经典100题 (34)
- anaconda安装路径 (34)
- yield和return的区别 (33)
- 1到10的阶乘之和是多少 (35)
- python安装sklearn库 (33)
- dom和bom区别 (33)
- js 替换指定位置的字符 (33)
- python判断元素是否存在 (33)
- sorted key (33)
- shutil.copy() (33)