【python】遇上COS美图怎么办？当然是大胆冲呀~

魔王不会哭发布时间：2022-09-20 18:52:34 ，浏览量：10

前言

嗨喽~大家好呀，这里是魔王呐 !

在这炎热得夏天~

我不由得想要东西来放松一下~

于是，我采集起了小姐姐COS图~

开发环境:

Python 3.8
Pycharm

模块使用:

第三方模块需要安装在cmd里面进行 pip install requests / parsel

requests
parsel

如何安装python第三方模块:

win + R 输入 cmd 点击确定, 输入安装命令 pip install 模块名 (pip install requests) 回车
在pycharm中点击Terminal(终端) 输入安装命令

实现基本思路: 一. 数据来源分析:

1、分析这些图片url地址在哪?

开发者工具抓包分析, 分析图片链接在什么地方

I. F12 打开开发者工具 --> 刷新网页

II. 通过 Img 可以找图片url地址

-------------------分析图片url地址可以从哪里获得-----------------------

III. 通过图片链接参数去搜索数据从哪里来的

获取所有图集 —> 获取所有图集详情页url --> 目录页面发送请求

二. 代码实现步骤

发送请求, 对于图集目录页发送请求
获取数据, 获取服务器返回响应数据
解析数据, 提取我们想要图集详情页url地址
发送请求, 对于图集详情页url地址发送请求
获取数据, 获取服务器返回响应数据
解析数据, 提取图片url地址以及标题
保存数据, 把图片内容保存本地文件夹

代码

获取源码链接点击

# 导入数据请求模块  --> 第三方模块 需要 在cmd里面 pip install requests
import requests
# 导入数据解析模块  --> 第三方模块 需要 在cmd里面 pip install parsel
import parsel
# 导入正则模块 --> 内置模块 不需要安装
import re
# 导入文件操作模块 --> 内置模块 不需要安装
import os.path

# 构建翻页
for page in range(2, 450):
    # format 字符串格式化方法
    print(f'正在采集第{page}页的数据内容')
    # 确定请求url地址

伪装请求头防止被反爬

    headers = {
        # 浏览器基本身份信息
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/101.0.0.0 Safari/537.36'
    }

发送请求

通过requests模块里面get请求方法, 对于url地址发送请求, 并且携带上headers请求头伪装, 最后用自定义变量response接受返回数据

    response = requests.get(url=url, headers=headers)
    #   表示请求成功了 响应对象
    print(response)

获取数据, 获取服务器返回响应数据 print(response.text)

解析数据, 提取我们想要图集详情页url地址

推荐使用 parsel

获取 response.text —> 返回html字符串数据内容
css选择器根据标签属性内容, 提取数据

转换数据转成可以解析对象

关注

打赏

1665385393

查看更多评论

【python】遇上COS美图怎么办？当然是大胆冲呀~

最近更新

热门博客

[ 申请 ]友情链接：