百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术文章 > 正文

python爬虫神器--Scrapy(python爬虫详细教程)

itomcoil 2025-07-10 15:58 3 浏览

什么是爬虫,爬虫能用来做什么?文章中给你答案。*_*

今天我们就开发一个简单的项目,来爬取一下itcast.cn中c/c++ 教师的职位以及名称等信息。网站链接:
http://www.itcast.cn/channel/teacher.shtml#ac

本教程将指导您完成以下任务:

  1. pycharm以及scrapy的安装
  2. scrapy的架构流程讲解
  3. 创建一个新的scrapy项目
  4. 编写蜘蛛以爬网站点并提取导出数据

一、pycharm以及scrapy的安装

pycharm是Python的解释器,为什么不用Python自带的ipython而用pycharm的IDE呢,是因为pycharm是可视化的IDE,窗口交互习惯比较好,并且有大量的方便功能。

安装的时候没有什么特殊的,下一步就好。

scrapy的安装比较方便:如图一所示:在pycharm中FIle->settings->Project+项目名称->选择“+”->输入Scrapy->左下角的install package。等待一会就会自动安装并显示安装成功(如果有安装失败的,可以私信我解决)。

二、Scrapy架构流程讲解。

如图二所示:

1、首先Spiders(爬虫)将需要发送请求的url(requests)经ScrapyEngine(引擎)交给Scheduler(调度器),这个是需要我们手动敲代码必要部分。

2、Scheduler(排序,入队)处理后,经ScrapyEngine,DownloaderMiddlewares(可选,主要有User_Agent, Proxy代理)交给Downloader。

3、Downloader向互联网发送请求,并接收下载响应(response)。将响应(response)经ScrapyEngine,SpiderMiddlewares(可选)交给Spiders。

4、Spiders处理response,提取数据并将数据经ScrapyEngine交给ItemPipeline保存(可以是本地,可以是数据库)。提取url重新经ScrapyEngine交给Scheduler进行下一个循环。直到无Url请求程序停止结束。

5、DownloaderMiddlewares(下载中间件)以及SpiderMiddlewares(爬虫中间件)不是必要的可以省略(如果你要爬取的网页有反爬虫机制,则需要用到)。

三、创建一个新的scrapy项目

创建scrapy项目的时候用cmd环境,命令行方式创建,scrapy会自动给我增加一些文件和选项。省去爬虫开发者大量的时间。

然后我们打开工程可以看一下,scrapy会自动生成这个几个文件:

spiders目录:我们的爬虫文件的所在目录也是我们要开发爬虫的文件位置;

items.py:要爬取的数据字段

middlewares.py:中间件(下载中间件和爬虫中间件)都在这个位置

piplines.py:管道文件存放我们筛选过的数据

settings.py:scrapy的配置文件,所有的设置都可以写在配置文件中

接下来就是创建我们的爬虫文件了 有两种方法:

a.用scrapy命令行:scrapy genspider myspider -t "itcast.cn"

解释一下 genspider 是生成爬虫

myspider 是我们的爬虫名字,后续启动爬虫也是需要这个名字

itcast.cn 是我们本次爬虫要爬取的网站域名

b.在pycharm中的spiders目录下新建一个文件也可以。

我们一般用第一种,因为scrapy可以帮我们写部分代码。*_*

到此为止我们的爬虫项目就建立完毕。接下来就是利用scrapy框架写代码获取数据。

四、编写蜘蛛以爬网站点并提取数据

1.items.py

再此处我们写上自己要回去的网站的一些内容。会映射到相应的变量上。

class ScrapytestItem(scrapy.Item):

# define the fields for your item here like:

name = scrapy.Field()

title = scrapy.Field()

info = scrapy.Field()

2.写我们的爬虫文件

import scrapy

from ScrapyTest.items import ScrapytestItem

class MyspiderSpider(scrapy.Spider):

name = 'myspider' # 爬虫名

allowed_domains = ['www.itcast.cn'] # 要爬取网站的域名,不在此域内的网站不爬取。

# 要爬取的网站

start_urls = ['http://www.itcast.cn/channel/teacher.shtml#ac']

# 下载器返回的网页请求连接

def parse(self, response):

# //div[@class='li_txt']/p xpath方法获取相应的字段

print("*" * 100)

items_xpath_list = response.xpath("//div[@class='li_txt']")

# print(items_xpath_list)

# 存放教师信息列表

items = []

for item_xpath in items_xpath_list:

# 创建一个item 并赋值会返回pipelines中

item = ScrapytestItem()

name = item_xpath.xpath("./h3/text()").extract()

title = item_xpath.xpath("./h4/text()").extract()

info = item_xpath.xpath("./p/text()").extract()

item['name'] = name

item['title'] = title

item['info'] = info

#items.append(item)

yield item

return item

3.pipelines.py

import json

class ScrapytestPipeline(object):

def __init__(self):

self.f = open("myspider.json","w") #创建一个json文件对象

def process_item(self, item, spider):

content = json.dumps(dict(item),ensure_ascii = False) + ",\n"

self.f.write(content) # 爬取到的item信息写入文件

return item

def close_spider(self, spider):

self.f.close()

4.settings.py

ROBOTSTXT_OBEY = False # 修改ROBOTSTXT_OBEY

# 打开我们的管道文件(默认是注释状态)

ITEM_PIPELINES = {

'ScrapyTest.pipelines.ScrapytestPipeline': 300,

}

五、运行程序获取相应结果

运行程序有两种方法,

a.用scrapy命令

scrapy crawl myspider (注意这里的myspider 是通过genspider创建出来的那个名称)

b.用pycharm

新建文件start.py引入scrapy命令行模块

from scrapy import cmdline

cmdline.execute("scrapy crawl myspider".split())

启动start.py 就启动了scrapy项目

这个简单的项目到此,位置了。麻雀虽小,五脏俱全。赶紧上手试一下吧。

如果有问题可以私信我,项目源码:

链接:
https://pan.baidu.com/s/1_VGsxHr2t2tgSfkqkrAEOA

提取码:hmvq

相关推荐

Java 如何从一个 List 中随机获得元素

概述从一个List中随机获得一个元素是有关List的一个基本操作,但是这个操作又没有非常明显的实现。本页面主要向你展示如何有效的从List中获得一个随机的元素和可以使用的一些方法。选择一个...

想月薪过万吗?计算机安卓开发之"集合"

集合的总结:/***Collection*List(存取有序,有索引,可以重复)*ArrayList*底层是数组实现的,线程不安全,查找和修改快,增和删比较慢*LinkedList*底层是...

China Narrows AI Talent Gap With U.S. as Research Enters Engineering Phase: Report

ImagegeneratedbyAITMTPOST--ChinaisclosinginontheU.S.intheAIindustry-academia-research...

大促系统优化之应用启动速度优化实践

作者:京东零售宋维飞一、前言本文记录了在大促前针对SpringBoot应用启动速度过慢而采取的优化方案,主要介绍了如何定位启动速度慢的阻塞点,以及如何解决这些问题。希望可以帮助大家了解如何定位该类问...

MyEMS开源能源管理系统核心代码解读004

本期解读:计量表能耗数据规范化算法:myems/myems-normalization/meter.py代码见底部这段代码是一个用于计算和存储能源计量数据(如电表读数)的小时值的Python脚本。它主...

Java接口与抽象类:核心区别、使用场景与最佳实践

Java接口与抽象类:核心区别、使用场景与最佳实践一、核心特性对比1.语法定义接口:interface关键字定义,支持extends多继承接口javapublicinterfaceDrawabl...

超好看 vue2.x 音频播放器组件Vue-APlayer

上篇文章给大家分享了视频播放器组件vue-aliplayer,这次给大家推荐一款音频插件VueAplayer。vue-aplayer一个好看又好用的轻量级vue.js音乐播放器组件。清爽漂亮的U...

Linq 下的扩展方法太少了,MoreLinq 来啦

一:背景1.讲故事前几天看同事在用linq给内存中的两个model做左连接,用过的朋友都知道,你一定少不了一个叫做DefaultIfEmpty函数,这玩意吧,本来很流畅的from......

MapReduce过程详解及其性能优化(详细)

从JVM的角度看Map和ReduceMap阶段包括:第一读数据:从HDFS读取数据1、问题:读取数据产生多少个Mapper??Mapper数据过大的话,会产生大量的小文件,由于Mapper是基于虚拟...

手把手教你使用scrapy框架来爬取北京新发地价格行情(实战篇)

来源:Python爬虫与数据挖掘作者:霖hero前言关于Scrapy理论的知识,可以参考我的上一篇文章,这里不再赘述,直接上干货。实战演练爬取分析首先我们进入北京新发地价格行情网页并打开开发者工具,如...

屏蔽疯狂蜘蛛,防止CPU占用100%(mumu模拟器和雷电模拟器哪个更占用cpu)

站点总是某个时间段莫名的cpu100%,资源占用也不高,这就有必要怀疑爬虫问题。1.使用"robots.txt"规范在网站根目录新建空白文件,命名为"robots.txt&#...

Web黑客近年神作Gospider:一款基于Go语言开发的Web爬虫,要收藏

小白看黑客技术文章,一定要点首小歌放松心情哈,我最爱盆栽!开始装逼!Gospider是一款运行速度非常快的Web爬虫程序,对于爱好白帽黑客的小白来说,可谓是佳作!Gospider采用厉害的Go语言开发...

用宝塔面板免费防火墙屏蔽织梦扫描网站

今天教大家在免费的基础上屏蔽织梦扫描,首先您要安装宝塔面板,然后再安装免费的防火墙插件,我用的是Nginx免费防火墙,然后打开这个插件。设置GET-URL过滤设置一条简单的宝塔面板的正则规则就可以屏蔽...

蜘蛛人再捞4千万美元 连续三周蝉联北美票房冠军

7月15日讯老马追踪票房数据的北美院线联盟今天表示,“蜘蛛人:离家日”(Spider-Man:FarFromHome)击退两部新片的挑战,连续第2周勇夺北美票房冠军,海捞4530万美元。法新...

夏天到了,需要提防扁虱,真是又小又恐怖的动物

夏天马上要到了,你知道吗,扁虱是这个夏天最危险的动物之一,很少有动物能比它还凶猛。Whenitcomestosummer'slittledangers,fewarenastiert...