前言
抖音短视频相信大家都听过,也不陌生对吧!可以看到海量的短视频,涵盖了各大行业。个人觉得抖音有毒,刷着刷着根本停不下来,一看时间就是凌晨3、4点。今天带大家爬取抖音网页版的视频数据!一睹为快吧
1、系统分析网页性质
2、正则提取数据(难点)
3、海量音频数据保存
python 3.6 pycharm requests re
1、分析目标网页,确定爬取的url路径,headers参数
2、发送请求 -- requests 模拟浏览器发送请求,获取响应数据
3、解析数据 -- 正则表达式
4、保存数据 -- 保存在目标文件夹中
1、导入工具
2、分析目标网页,确定爬取的url路径,headers参数
3、发送请求 -- requests 模拟浏览器发送请求,获取响应数据
4、解析数据 -- 正则表达式
5、构建一个for循环
6、处理文件名非法字符
7、保存数据 -- 保存在目标文件夹中