使用python 采集某网站全站美女图片，这么好看得图还不学起来（含完整源码）

编程知识更新时间:2023-05-01 21:43:23

本次目的：

python 抓取某某站图片

本次亮点：

系统性分析页面
多页面数据解析
海量图片数据保存

开发环境 & 第三方模块：

解释器版本 >>> python 3.8
代码编辑器 >>> pycharm 2021.2
requests >>> pip install requests
parsel >>> pip install parsel

爬虫主要流程:

一. 网站分析

找到目标网站
链接
获取每个相册的地址去批量的下载图片

二. 代码实现过程

发送网络请求向相册列表页链接
获取数据网页源代码
筛选数据相册地址
发送网络请求向相册页面并且获取数据网页源代码
筛选数据图片地址
发送网络请求 & 获取数据向图片地址
保存图片

代码编写

1. 导入模块

import requests
import parsel   # lxml  re  bs4
import re
import os

2. 加一个伪装

headers = {
    'referer': 'https://www.jdlingyu/tuji',
    'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/98.0.4758.102 Safari/537.36'
}

for page in range(1, 393):
    url = f'https://www.jdlingyu/tuji/page/{page}'

3. 发送网络请求

    response = requests.get(url, headers=headers)
    # <Response [200]>: 请求成功

4. 获取数据网页源代码

    html_data = response.text

5. 筛选数据

    # re
    # url_list = re.findall('<h2><a  target="_blank" href="(.*?)">.*?</a></h2>', html_data)
    # xpath
    selector = parsel.Selector(html_data)
    url_list = selector.xpath('//div[@class="post-info"]/h2/a/@href').getall()

6. 发送网络请求向相册页面并且获取数据网页源代码

    for detail_url in url_list:
        detail_html = requests.get(detail_url, headers=headers).text

相对应的安装包/安装教程/激活码/使用教程/学习资料/工具插件可以点击免费领取

7. 筛选数据图片地址

        detail_selector = parsel.Selector(detail_html)
        title = detail_selector.xpath('//h1/text()').get()
        # 如果不存在 img/title
        if not os.path.exists('img/' + title):
            # 那就新建
            os.mkdir('img/' + title)
        img_list = detail_selector.xpath('//div[@class="entry-content"]//img/@src').getall()
        for img in img_list:
            # 获取二进制数据
            img_data = requests.get(img, headers=headers).content
            img_title = img.split('/')[-1]
            with open(f'img/{title}/{img_title}', mode='wb') as f:
                f.write(img_data)
            print(f'正在爬取: {img_title}')

尾语

好了，我的这篇文章写到这里就结束啦！

有更多建议或问题可以评论区或私信我哦！一起加油努力叭(ง •_•)ง

喜欢就关注一下博主，或点赞收藏评论一下我的文章叭！！！

更多推荐

使用python 采集某网站全站美女图片 ,这么好看得图还不学起来（含完整源码）

本文发布于:2023-04-24 03:33:00，感谢您对本站的认可！

本文链接:https://www.elefans.com/category/jswz/820643dcd65f5173ef99e14b22f2b895.html

看得全站不学源码完整

上一篇： Python采集去哪儿旅游攻略(爬虫+数据分析),快过年了,这不得全家一起出去玩一次
下一篇：返回列表

发布评论取消回复

评论列表（有 0 条评论）

使用python 采集某网站全站美女图片，这么好看得图还不学起来（含完整源码）

本次目的：

本次亮点：

开发环境 & 第三方模块：

爬虫主要流程:

一. 网站分析

二. 代码实现过程

代码编写

1. 导入模块

2. 加一个伪装

3. 发送网络请求

4. 获取数据网页源代码

5. 筛选数据

6. 发送网络请求向相册页面并且获取数据网页源代码

相对应的安装包/安装教程/激活码/使用教程/学习资料/工具插件可以点击免费领取

7. 筛选数据图片地址

尾语

发布评论取消回复

最近发表

热门文章

标签列表

使用python 采集某网站全站美女图片 ，这么好看得图还不学起来（含完整源码）

本次目的：

本次亮点：

开发环境 & 第三方模块：

爬虫主要流程:

一. 网站分析

二. 代码实现过程

代码编写

1. 导入模块

2. 加一个伪装

3. 发送网络请求

4. 获取数据 网页源代码

5. 筛选数据

6. 发送网络请求 向相册页面 并且 获取数据 网页源代码

相对应的安装包/安装教程/激活码/使用教程/学习资料/工具插件 可以点击免费领取

7. 筛选数据 图片地址

尾语

相关文章

发布评论取消回复

最近发表

热门文章

标签列表

使用python 采集某网站全站美女图片，这么好看得图还不学起来（含完整源码）

4. 获取数据网页源代码

6. 发送网络请求向相册页面并且获取数据网页源代码

相对应的安装包/安装教程/激活码/使用教程/学习资料/工具插件可以点击免费领取

7. 筛选数据图片地址