百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术文章 > 正文

python:最简单爬虫之爬取小说网Hello wrold

itomcoil 2025-05-22 10:57 4 浏览

以下用最简单的示例来演示爬取某小说网的类目名称。


新建一个retest.py,全文代码如下,读者可以复制后直接运行。代码中我尽量添加了一些注释便于理解。


需要说明的一点,该小说网站如果后续更新改版了,文中截取字符的正则表达式可能需要根据做一些变动,才能成功爬取到我们想要的名称。


一、小说网站首页


我们想爬取的是首页-》全部分类 菜单下的小说分类名称



二、retest.py代码


# -*- coding: UTF-8 -*-
import re
import urllib.request
import codecs
import time

# 使用re 与 urllib 包简单爬取小说种类名称
class Retest(object):
    def __init__(self):
        self.getText()

    # 爬取方法
    def getText(self):
        print("准备开始爬取")
        # 请求网站首页,获取页面返回内容
        url = "https://www.readnovel.com"
        response = urllib.request.urlopen(url, timeout=5)
        result = response.read().decode('utf-8') #使用utf-8 避免中文乱码
        print(result)   #网页内容
        # 网页中的原字符串
        # '
现代言情
' # 通过正则表达式与固定字符组合,过滤后得到新字符串 pr = '
.*?;.*?
' print("过滤后的文本:=====") pattern = re.compile(pr) #将正则表达式编译为正则对象 movieList = pattern.findall(result) #通过正则表达式从源字符串中截取,得到一个movieList数组 print(movieList) # 使用map函数,将movieList数组中各元素,通过lambda匿名函数内的方法,过滤掉其他标签字符,仅保留我们需要的类目中文标题如“现代言情” moveTitleList = map(lambda x: x.split("")[1].split("")[0], movieList) # 最后,依次打印出各类目名称 for movie in moveTitleList: print("%s\r\n" % movie) if __name__ == '__main__': Retest()


三、运行后结果



四、分析说明


下面结合上述代码再做一些补充说明,便于我们初学者更易于理解。


1.查找关键字,正则表达式获取字符串


我们在网站首页,查看前端页面源代码,并查找到关键字



红线标注的就是我们需要通过正则表达式从全文中定位并截取的字符串。


现代言情
古代言情


对应的正则表达式如下:


.*?;.*?


我们只需要将固定不变的关键字符串与可变的组合在一起即可。


“30020”、“”、“现代言情”这三个是动态的,我们用“.*?”代替,代表任意字符串。然后通过pattern.findall得到一个movieList数组,数组内的成员如下。


[

'

现代言情
',

'

古代言情
',

'

浪漫青春
',

'

玄幻言情
',

'

仙侠奇缘
',

'

悬疑
',

'

科幻空间
',

'

游戏竞技
',

'

?轻小说
'

]


2.二次过滤


我们仅需要类目中文名称,所有需要对得到的数据做二次过滤。


moveTitleList = map(lambda x: x.split("")[1].split("")[0], movieList)


map可以从movieList数组中逐个成员进行函数处理。而我们这里使用lambda定义了一个匿名函数


lambda x: x.split("")[1].split("")[0],意思是在成员中获取“”第二个元素,再获取""第一个元素。即

现代言情
,最终可以获取到“现代言情”这几个字。


3.尾声


以上演示了如何爬取网页中的某一组数据,读者掌握理解后,可以自己尝试爬取其他数据,如推荐栏目下的书名清单等。


如果我的文章解决了你的问题,欢迎点赞、收藏或评论。

相关推荐

使用opencv-Python进行图像锐化处理

使用OpenCV函数cv::filter2D执行一些拉普拉斯滤波以进行图像锐化使用OpenCV函数cv::distanceTransform以获得二值图像的派生(derived)表示,...

Python-OpenCV 7. 图像二值化

一、介绍图像二值化(ImageBinarization)就是将图像上的像素点的灰度值设置为0或255,也就是将整个图像呈现出明显的黑白效果的过程。在数字图像处理中,二值图像占有非常重要的地位,图...

OpenCV+Python裁剪图像

最近使用OpenCV+Python做了一个程序,功能是自动将照片中的文本部分找出来并裁剪/旋转保存为新的图片。这个功能用专业些的说法就是选择并提取感兴趣区域(ROI(RegionofInteres...

简单易懂的人脸识别!用PythonOpenCV实现(适合初...

前言:OpenCV是一个开源的计算机视觉和机器学习库。它包含成千上万优化过的算法,为各种计算机视觉应用提供了一个通用工具包。根据这个项目的关于页面,OpenCV已被广泛运用在各种项目上,从谷歌街景...

OpenCV行人检测应用方案--基于米尔全志T527开发板

本文将介绍基于米尔电子MYD-LT527开发板(米尔基于全志T527开发板)的OpenCV行人检测方案测试。摘自优秀创作者-小火苗一、软件环境安装1.在全志T527开发板安装OpenCVsudoap...

纯Python构建Web应用:Remi与 OpenCV 结合实现图像处理与展示

引言大家好,我是ICodeWR。在前几篇文章中,我们介绍了Remi的基础功能、多页面应用、动态更新、与Flask结合、与数据库结合、与Matplotlib结合以及与Pandas结合。...

【AI实战项目】基于OpenCV的“颜色识别项目”完整操作过程

OpenCV是一个广受欢迎且极为流行的计算机视觉库,它因其强大的功能、灵活性和开源特性而在开发者和研究者中备受青睐。学习OpenCV主要就是学习里面的计算机视觉算法。要学习这些算法的原理,知道它们适用...

Python自动化操控术:PyAutoGUI全场景实战指南

一、PyAutoGUI核心武器库解析1.1鼠标操控三剑客importpyautogui#绝对坐标移动(闪电速度)pyautogui.moveTo(100,200,duration=0....

从零开始学python爬虫(七):selenium自动化测试框架的介绍

本节主要学习selenium自动化测试框架在爬虫中的应用,selenium能够大幅降低爬虫的编写难度,但是也同样会大幅降低爬虫的爬取速度。在逼不得已的情况下我们可以使用selenium进行爬虫的编写。...

「干货分享」推荐5个可以让你事半功倍的Python自动化脚本

作者:俊欣来源:关于数据分析与可视化相信大家都听说自动化流水线、自动化办公等专业术语,在尽量少的人工干预的情况下,机器就可以根据固定的程序指令来完成任务,大大提高了工作效率。今天小编来为大家介绍几个P...

python+selenium+pytesseract识别图片验证码

一、selenium截取验证码#私信小编01即可获取大量Python学习资源#私信小编01即可获取大量Python学习资源#私信小编01即可获取大量Python学习资源importjso...

Python爬虫实战 | 利用多线程爬取 LOL 高清壁纸

一、背景介绍随着移动端的普及出现了很多的移动APP,应用软件也随之流行起来。最近看到英雄联盟的手游上线了,感觉还行,PC端英雄联盟可谓是爆火的游戏,不知道移动端的英雄联盟前途如何,那今天我们使用到...

一套真实的Python面试题,几十个题目汇总

1.(1)python下多线程的限制以及多进程中传递参数的方式python多线程有个全局解释器锁(globalinterpreterlock),这个锁的意思是任一时间只能有一个线程使用解释器,跟...

一文读透,Python暴力(BF)字符串匹配算法到 KMP 算法之间的变化

1.字符串匹配算法所谓字符串匹配算法,简单地说就是在一个目标字符串中查找是否存在另一个模式字符串。如在字符串"ABCDEFG"中查找是否存在“EF”字符串。可以把字符...

Python实现屏幕自动截图

教程目录需要实现的功能:自动屏幕截图具体需求:1.支持设置截图频率和截图文件存储路径2.在存储截图时判断与前一张截图的相似度,只有屏幕发生了显著的变化才存储截图所需技术(搜索关键词):1.屏幕截...