python爬取app中的音频_Python3爬取喜马拉雅页面音频文件

日期：2024-12-26 作者：35xkp 移动：http://oml01z.riyuangf.com/mobile/quote/27114.html

目的？

这是一个python练习，经过这个练习，咱们能够了解：python

使用python发起http请求

python的文件操做

python的数据库操做

1、分析列表页面

首先分析一下某网站的专辑页面要素，想办法获取页面红色列表信息数据。理论上，每一个音频大体包括：id、标题、音频地址、更新时间等等

在浏览器调试工具中，查看一下http请求。大体找一下，看看能不能找到相应的数据。看看是直接页面生成的，仍是有额外的api获取数据

在network分析中，快速浏览一下全部的http请求，查看响应的结果，很快就能找到mysql

在请求中，咱们发现了一个请求/revision/album/v1/getTracksList?albumId=18521227&pageNum=1,对就它了git

结合页面的状况，还有响应的结果，咱们应该能猜到：albumId应该就是专辑ID，而pageNum应该就是页面了，咱们验证一下web

没有错，这个就是列表信息的请求url了。json响应结果中，咱们找比较重要的信息：trackId-音频ID,title-音频标题,url-音频播放地址sql

列表信息来源应该搞清楚了，咱们接着看音频播放的时候是否能找到音频来源？数据库

2、分析音频播放页面

打开单个音频播放地址后，跟列表页面同样，咱们找单个音频信息来源。

应该能找到/revision/play/v1/audio?id=247457234&ptype=1

这个请求响应结果里面的src就是音频地址了json

3、编码实现

获取专辑列表方法api

一、使用requests发起http请求

二、获取列表信息api返回的json结果，根据本身须要, 把列表信息保持到 list 中

三、方法返回track信息的list

# 获取专辑列表

# album_id 专辑ID

# page_num 页码

def get_track_list(album_id, page_num):

url = "https://www.ximalaya.com/revision/album/v1/getTracksList?albumId=" + str(album_id) + "&pageNum=" + str(

page_num)

track_list = []

resp = requests.get(url, headers=header)

result = resp.json()

if result['ret'] == 200:

tracks = result['data']['tracks']

for tack in tracks:

track_list.append(

{'index': tack['index'], 'play_count': tack['playCount'], 'duration': tack['duration'], 'trackId': tack['trackId'], 'title': tack['title'],

'url': tack['url']})

# 加入字典(暂时没有使用)

track_map[tack['trackId']] = tack['title']

return track_list

获取单个音频信息方法浏览器

一、传入音频的id

二、使用requests发起http请求，获取单个音频的json信息

三、方法返回音频实际的http源文件地址

# 获取音频地址

def get_track_url(track_id):

url = "https://www.ximalaya.com/revision/play/v1/audio?id=" + str(track_id) + "&ptype=1"

resp = requests.get(url, headers=header)

result = resp.json()

if result['ret'] == 200:

track_audio_play = result['data']['src']

if len(track_audio_play) > 0:

return track_audio_play

保存http音频文件信息到本地app

一、使用requests发起http请求，获取单个音频的流

二、保存到响应的本地路径

#下载音频文件

def download_track_audio(url, file):

resp = requests.get(url, headers=header, stream=True)

with open(file, "wb") as f:

for data in resp.iter_content(chunk_size=1024):

if data:

f.write(data)

例子运行&保存信息到数据库

try:

dir = "H:/Temp"

# 链接 mysql 的方法：connect('ip','user','password','dbname')

con = mdb.connect(host='127.0.0.1', user='root', passwd='123456', db='py_demo', use_unicode=True, charset="utf8")

# 全部的查询，都在链接 con 的一个模块 cursor 上面运行的

cur = con.cursor()

# 执行一个查询

# cur.execute("SELECT VERSION()")

# 取得上个查询的结果，是单个结果

# data = cur.fetchone()

track_list = get_track_list(18521227, 1)

sql = """insert into track_info_demo(id,trackId,title,play_count,duration,url,file_path) values(%s,%s,%s,%s,%s,%s,%s)"""

for track_info in track_list:

# 下载

track_url = get_track_url(track_info.get('trackId'))

file_path = ""

if track_url:

# 扩展名

file_name = track_url[track_url.rindex('/'):]

# 文件名路径

file_path = dir + file_name

# 下载

download_track_audio(track_url, file_path)

# values.append(track_info.get('index'))

# values.append(track_info.get('trackId'))

values = [track_info.get('index'), track_info.get('trackId'), track_info.get('title'), track_info.get('playCount'), track_info.get('duration'),

track_info.get('url'), file_path]

cur.execute(sql, values)

con.commit()

finally:

if con:

# 不管如何，链接记得关闭

con.close()

结果

数据库保存信息

文件信息

特别提示：本信息由相关用户自行提供，真实性未证实，仅供参考。请谨慎采用，风险自负。

点赞 0举报收藏 0评论 0

0 条相关评论

相关最新动态

推荐最新动态

点击排行