百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术分类 > 正文

python爬取喜马拉雅音频,json参数解析

ztj100 2025-01-12 20:23 25 浏览 0 评论

一.抓包分析json,获取加密方式

1.抓包获取音频界面

f12打开抓包工具,播放一个(非vip)视频,点击“媒体”

单击打开

?

可以复制URL,发现就是我们要的音频。

复制“CKwRIJEEXn-cABa0TgCj-ek6”,搜索,可以找到链接的来源

?

?

2.找到json文件,分析加密

?

复制“/revision/play/v1/audio”,搜索,找到我们需要的json文件(找不到的话就刷新浏览器)

?

将json文件在‘源代码’里打开,发现"xm-sign": z.getSign() 可能是加密的方式

?

点击播放另一视频进入调试,点击getSign()函数,得

?

?

打上断点运行

?

经过断点运行分析 (运用单步运行进行分析):

?

t 始终为 himalaya-


n,e 为服务器时间戳, 通过 https://www.ximalaya.com/revision/time 可得


r 为 当前时间的时间戳


l(100)为100以内的随机数


此时我们可以得知参数被加密后的格式为


{himalaya-服务器时间戳} +(100以内随机数)+服务器时间戳 +(100以内随机数)+当前时间戳

?但是!!!!

注意还有下述操作,鼠标放在a(e)上,出现白框,点击链接,如下:

?


?

在6660行打断点运行(合理使用‘运行’和‘单步运行’)

?

可以看出输入为 {himalaya-服务器时间戳},继续运行看看输出为啥

?

返回"02d95bb6140a4626c9d447f2d3385e61",是32位数字,合理猜测是md5算法,找个md5在线转换器验证一手

?

因此,a函数就是md5算法

继续运行,看看最终返回给xm-sign的是啥

?

故可以得出结论, 参数被加密后的格式(最终版本)为:

himalaya-服务器时间戳经过md5加密 +(100以内随机数)+服务器时间戳 +(100以内随机数)+当前时间戳

二.python代码实现

Bash
import requests
import json
import time
import random
import hashlib

url = 'https://www.ximalaya.com/revision/play/v1/audio?id=48241057&ptype=1'

headers = {
'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/106.0.0.0 Safari/537.36 Edg/106.0.1370.47'
}

#服务器时间戳
severtime = requests.get('https://www.ximalaya.com/revision/time',headers=headers).text
#现在时间戳
nowtime = str(round(time.time()*1000)) #round()返回保留几位小数的值,默认为整数 //time.time()返回当前时间的时间戳//time.time()得10位数,目前时间戳为13位数

#求加密的参数
xm_sign = str(hashlib.md5('himalaya-{}'.format(severtime).encode()).hexdigest()) + '({})'.format(round(random.random()*100)) + severtime + '({})'.format(round(random.random()*100)) + nowtime
#print(xm_sign)

#更新请求头参数
headers['xm-sign'] = xm_sign

#提取及解析音频网址
resp = requests.get(url,headers=headers)
src_dic = json.loads(resp.text)
src = src_dic['data']['src']

#下载音频
with open(f'./video/1.m4a',mode='wb') as f:
    f.write(requests.get(src,headers=headers).content)

三.总结

本文主要介绍的爬取喜马拉雅过程中的参数解析,爬取音频较为简单,只爬取一个音频,之后可以替换音频地址或者爬取多个音频,可以使用异步的方法高效率爬取更多的音频。冲!!!

相关推荐

Python 操作excel的坑__真实的行和列

大佬给的建议__如何快速处理excelopenpyxl库操作excel的时候,单个表的数据量大一些处理速度还能接受,如果涉及多个表甚至多个excel文件的时候速度会很慢,还是建议用pandas来处理,...

Python os.path模块使用指南:轻松处理文件路径

前言在Python编程中,文件和目录的操作是非常重要的一部分。为了方便用户进行文件和目录的操作,Python标准库提供了os模块。其中,os.path子模块提供了一些处理文件路径的函数和方法。本文主要...

Python常用内置模块介绍——文件与系统操作详解

Python提供了多个强大的内置模块用于文件和系统操作,下面我将详细介绍最常用的几个模块及其核心功能。1.os模块-操作系统交互...

Python Flask 建站框架实操教程(flask框架网页)

下面我将带您从零开始构建一个完整的Flask网站,包含用户认证、数据库操作和前端模板等核心功能。##第一部分:基础项目搭建###1.创建项目环境```bash...

为你的python程序上锁:软件序列号生成器

序列号很多同学可能开发了非常多的程序了,并且进行了...

PO设计模式全攻略,在 UI 自动化中的实践总结(以企业微信为例)

一、什么是PO设计模式?PO(PageObject)设计模式将某个页面的所有元素对象定位和对元素对象的操作封装成一个Page类,即一个py文件,并以页面为单位来写测试用例,实现页面对象和测试用例的...

这种小工具居然也能在某鱼卖钱?我用Python一天能写...

前两天在某鱼闲逛,本来想找个二手机械键盘,结果刷着刷着突然看到有人在卖——Word批量转PDF小工具...

python打包成exe,程序有图标,但是任务栏和窗口都没有显示图标

代码中指定图标信息#设置应用ID,确保任务栏图标正确显示ifsys.platform=="win32":importctypesapp_id=...

使用Python构建电影推荐系统(用python做推荐系统)

在日常数据挖掘工作中,除了会涉及到使用Python处理分类或预测任务,有时候还会涉及推荐系统相关任务。...

python爬取并分析淘宝商品信息(python爬取淘宝商品数据)

python爬取并分析淘宝商品信息背景介绍一、模拟登陆二、爬取商品信息1.定义相关参数2.分析并定义正则3.数据爬取三、简单数据分析1.导入库2.中文显示3.读取数据4.分析价格分布5.分析销售...

OpenCV入门学习基础教程(从小白变大神)

Opencv是用于快速处理图像处理、计算机视觉问题的工具,支持多种语言进行开发如c++、python、java等,下面这篇文章主要给大家介绍了关于openCV入门学习基础教程的相关资料,需要的朋友可以...

python图像处理-一行代码实现灰度图抠图

抠图是ps的最基本技能,利用python可以实现用一行代码实现灰度图抠图。基础算法是...

从头开始学python:如何用Matplotlib绘图表

Matplotlib是一个用于绘制图表的库。如果你有用过python处理数据,那Matplotlib可以更直观的帮你把数据展示出来。直接上代码看例子:importmatplotlib.pyplot...

Python爬取爱奇艺腾讯视频 250,000 条数据分析为什么李诞不值得了

在《Python爬取爱奇艺52432条数据分析谁才是《奇葩说》的焦点人物?》这篇文章中,我们从爱奇艺爬取了5万多条评论数据,并对一些关键数据进行了分析,由此总结出了一些明面上看不到的数据,并...

Python Matplotlib 库使用基本指南

简介Matplotlib是一个广泛使用的Python数据可视化库,它可以创建各种类型的图表、图形和可视化效果。无论是简单的折线图还是复杂的热力图,Matplotlib提供了丰富的功能来满足我们...

取消回复欢迎 发表评论: