百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术文章 > 正文

Python实战:爬取哔哩哔哩【UP主投稿的所有视频】

itomcoil 2025-01-16 19:50 33 浏览

上一篇文章提供了一种新的思路,找到了一条捷径,可以绕过 JS 逆向,直接监听接口,从接口的 response 中提取想要的数据。

传送门:Python实战:绕过JS逆向,爬取抖音搜索视频结果

今天,再运用这个思路写一个案例,实现爬取爬取哔哩哔哩 UP 主投稿的所有视频。(本文首发在“程序员coding”公众号)

一、先看结果

程序运行结束后会生成一个 excel 表格,包含 UP主名称、视频标题、视频描述、视频时长、播放数、评论数、弹幕数、发布时间、作者mid、视频aid、视频bvid、是否合作视频、视频链接、作者主页链接、视频封面图、视频属性、typeid 这 17 个字段的信息。

二、环境

(本文首发在“程序员coding”公众号)
python 3.11.5
pycharm

三、模块

from DrissionPage import ChromiumPage
from DataRecorder import Recorder
import time
import os
import datetime

四、分析数据来源

首先在作者主页点击更多,来到投稿视频的页面。

浏览器的开发者工具,点击投稿视频页面的下一页,找到包含视频数据的请求。

在浏览器的开发者工具的 preview 页面查看 response ,可以看到视频在 vlist 这个列表内。

展开第一个视频,可以看到包含的信息如下,是一个 json 格式,可以通过键值对的方法提取出视频信息。

在浏览器的开发者工具的 payload 页面可以看到请求需要携带的参数很多,还有加密的参数。

这种情况下,直接去扣 JS 逆向的话难度很大。

在 headers 页面,找到 requests url ,可以通过关键词监听这个接口,把这串关键词
api.bilibili.com/x/space/wbi/arc/search复制出来,下面写代码能用到。

五、思路

1、访问主页

2、监听接口、解析数据

3、循环翻页

六、代码实现过程

1、登录

定义一个 sign_in() 函数,在函数内部使用 DrissionPage 库的 get() 方法,打开哔哩哔哩的网站首页。(本文首发在“程序员coding”公众号)

如果第一次执行代码,需要登录账号,第二次之后运行代码,可以把 sign_in() 函数注释掉不用再次执行这一步骤。

from DrissionPage import ChromiumPage
def sign_in():
    """"登录函数"""
    sign_in_page = ChromiumPage()
    sign_in_page.get('https://www.bilibili.com/')
    print('请扫码登录')

2、获取response

通过翻页,可以发现地址规律。变化的只有 pn 的值,可以方便的构造出页面的 url 地址。

(本文首发在“程序员coding”公众号)
def get_response(pn):
    """"通过监听接口,获取返回的response"""
    # 访问网址
    page = ChromiumPage()
    url = f'https://space.bilibili.com/{UID}/video?tid=0&pn={pn}&keyword=&order=pubdate'
    page.listen.start('api.bilibili.com/x/space/wbi/arc/search', method='GET')  # 开始监听,指定获取包含该文本的数据包
    page.get(url)

    # 等待并获取一个数据包
    res = page.listen.wait(timeout=10)
    # json_data和浏览器的开发者工区中response一样
    json_data = res.response.body
    return json_data

3、解析response

通过监听接口,我们获取到了 response ,这是 json 格式的。然后就可以解析 response ,提取每一条视频的信息了。

# videos是所有视频列表
videos = json_data['data']['list']['vlist']
# 提取视频信息
for v in videos:
    # 视频 aid
    aid = v['aid']
    # 视频 bvid
    bvid = v['bvid']
    # 发布 author
    author = v['author']
    # 视频标题
    title = v['title']

这里只列出其中几个字段的提取方法,其他字段也是类似的方法提取,这个很简单,就不全部介绍了。

4、保存到excel

from DataRecorder import Recorder
import time
# 新建一个excel表格,用来保存数据
formatted_time = time.strftime("%Y-%m-%d %H%M%S", current_time)
init_file_path = f'哔哩哔哩UP主发布的所有视频-{UID}-{formatted_time}.xlsx'
info = {'UP主名称': author, '视频标题': title, '视频描述': description, '视频时长': length, '播放数': play,
        '评论数': comment, '弹幕数': video_review, '发布时间': create_time,
        '作者mid': author_mid, '视频aid': aid, '视频bvid': bvid, '是否合作视频': is_union_video,
        '视频链接': video_url, '作者主页链接': author_url, '视频封面图': pic,
        '视频属性': attribute, 'typeid': typeid}
# 保存数据到缓存
r.add_data(info)
# 爬虫结束,避免丢数据,强制保存文件
r.record()

5、main()函数

if __name__ == '__main__':
    # 1、登录,第2次运行可以注释掉这一步骤
    sign_in()

    # 2、UID 是UP主的id
    UID = '99157282'

    # 3、page_num 是所有视频总共有多少页
    page_num = 20

    # 4、开始爬取数据
    run()

七、操作方法:

在浏览器地址栏可以找到 UP 主的 ID 号,
https://space.bilibili.com/99157282/video中的99157282就是UID。

然后找到视频页码数量,也就是 20 页视频。

把这 2 个参数粘贴到代码的 main() 函数中,即可运行代码。

代码运行过程中, Pycharm 控制台输出如下:

八、完整代码

完整的代码经过调试完善可以完美运行,我也亲自多次实验,生成的 excel 表格案例如下。

生成的 excel 表命名包含作者名称、UID、笔记数量、采集日期时间这些信息。

本文首发在“程序员coding”公众号,欢迎关注与我一起交流学习。还可以通过公众号添加我的私人微信。

诚信交友,欢迎沟通交流。

每一份能满足他人需求的努力都值得被付费。

完整代码下载链接:可在“程序员coding”公众号文章获取。

相关推荐

MySQL修改密码_mysql怎么改密码忘了怎么办

拥有原来的用户名账户的密码mysqladmin-uroot-ppassword"test123"Enterpassword:【输入原来的密码】忘记原来root密码第一...

数据库密码配置项都不加密?心也太大了吧!

先看一份典型的配置文件...省略...##配置MySQL数据库连接spring.datasource.driver-class-name=com.mysql.jdbc.Driverspr...

Linux基础知识_linux基础入门知识

系统目录结构/bin:命令和应用程序。/boot:这里存放的是启动Linux时使用的一些核心文件,包括一些连接文件以及镜像文件。/dev:dev是Device(设备)的缩写,该目录...

MySQL密码重置_mysql密码重置教程

之前由于修改MySQL加密模式为mysql_native_password时操作失误,导致无法登陆MySQL数据库,后来摸索了一下,对MySQL数据库密码进行重置后顺利解决,步骤如下:1.先停止MyS...

Mysql8忘记密码/重置密码_mysql密码忘了怎么办?

Mysql8忘记密码/重置密码UBUNTU下Mysql8忘记密码/重置密码步骤如下:先说下大概步骤:修改配置文件,使得用空密码可以进入mysql。然后置当前root用户为空密码。再次修改配置文件,不能...

MySQL忘记密码怎么办?Windows环境下MySQL密码重置图文教程

有不少小白在使用Windows进行搭建主机的时候,安装了一些环境后,其中有MySQL设置后,然后不少马大哈忘记了MySQL的密码,导致在一些程序安装及配置的时候无法进行。这个时候怎么办呢?重置密码呗?...

10种常见的MySQL错误,你可中招?_mysql常见错误提示及解决方法

【51CTO.com快译】如果未能对MySQL8进行恰当的配置,您非但可能遇到无法顺利访问、或调用MySQL的窘境,而且还可能给真实的应用生产环境带来巨大的影响。本文列举了十种MySQL...

Mysql解压版安装过程_mysql解压版安装步骤

Mysql是目前软件开发中使用最多的关系型数据库,具体安装步骤如下:第一步:Mysql官网下载最新版(mysql解压版(mysql-5.7.17-winx64)),Mysql官方下载地址为:https...

MySQL Root密码重置指南:Windows新手友好教程

如果你忘记了MySQLroot密码,请按照以下简单步骤进行重置。你需要准备的工具:已安装的MySQL以管理员身份访问命令提示符一点复制粘贴的能力分步操作指南1.创建密码重置文件以管理员...

安卓手机基于python3搜索引擎_python调用安卓so库

环境:安卓手机手机品牌:vivox9s4G运行内存手机软件:utermux环境安装:1.java环境的安装2.redis环境的安装aptinstallredis3.elasticsearch环...

Python 包管理 3 - poetry_python community包

Poetry是一款现代化的Python依赖管理和打包工具。它通过一个pyproject.toml文件来统一管理你的项目依赖、配置和元数据,并用一个poetry.lock文件来锁定所有依赖的精...

Python web在线服务生产环境真实部署方案,可直接用

各位志同道合的朋友大家好,我是一个一直在一线互联网踩坑十余年的编码爱好者,现在将我们的各种经验以及架构实战分享出来,如果大家喜欢,就关注我,一起将技术学深学透,我会每一篇分享结束都会预告下一专题最近经...

官方玩梗:Python 3.14(πthon)稳定版发布,正式支持自由线程

IT之家10月7日消息,当地时间10月7日,Python软件基金会宣布Python3.14.0正式发布,也就是用户期待已久的圆周率(约3.14)版本,再加上谐音梗可戏称为π...

第一篇:如何使用 uv 创建 Python 虚拟环境

想象一下,你有一个使用Python3.10的后端应用程序,系统全局安装了a2.1、b2.2和c2.3这些包。一切运行正常,直到你开始一个新项目,它也使用Python3.10,但需要...

我用 Python 写了个自动整理下载目录的工具

经常用电脑的一定会遇到这种情况:每天我们都在从浏览器、微信、钉钉里下各种文件,什么截图、合同、安装包、临时文档,全都堆在下载文件夹里。起初还想着“过两天再整理”,结果一放就是好几年。结果某天想找一个发...