位置：首页>> 网络编程>> Python编程>> Python3.x爬虫下载网页图片的实例讲解

Python3.x爬虫下载网页图片的实例讲解

作者：hanchaobiao　　发布时间：2022-11-25 23:24:07　

标签：爬虫,下载,图片,Python

一、选取网址进行爬虫

本次我们选取pixabay图片网站

url=https://pixabay.com/

二、选择图片右键选择查看元素来寻找图片链接的规则

通过查看多个图片路径我们发现取src路径都含有 https://cdn.pixabay.com/photo/ 公共部分且图片格式都为.jpg 因此正则表达式为

re.compile(r'^https://cdn.pixabay.com/photo/.*?jpg$')

通过以上的分析我们可以开始写程序了

#-*- coding:utf-8 -*-
import re
import requests
import os
from bs4 import BeautifulSoup

url = 'https://pixabay.com/'
html = requests.get(url).text #获取网页内容
print(html)
# 这里由于有些图片可能存在网址打不开的情况，加个5秒超时控制。
#data-objurl="http://pic38.nipic.com/20140218/17995031_091821599000_2.jpg"获取这种类型链接
soup = BeautifulSoup(html,'html.parser',from_encoding='utf-8')
#^abc.*?qwe$
pic_url = soup.find_all('img',src=re.compile(r'^https://cdn.pixabay.com/photo/.*?jpg$'))
#pic_url = pic_node.get_text()
#pic_url = re.findall('"https://cdn.pixabay.com/photo/""(.*?)",',html,re.S)
print(pic_url)
i = 0
#判断image文件夹是否存在，不存在则创建
if not os.path.exists('image'):
os.makedirs('image')
for url in pic_url:
img = url['src']
try:
pic = requests.get(img,timeout=5) #超时异常判断 5秒超时
except requests.exceptions.ConnectionError:
print('当前图片无法下载')
continue
file_name = "image/"+str(i)+".jpg" #拼接图片名
print(file_name)
#将图片存入本地
fp = open(file_name,'wb')
fp.write(pic.content) #写入图片
fp.close()
i+=1

代码是不是很简单呢如果你想修改地址取爬取别的网站请注意分析下载图片路径的共性并设计合理的正则表达式，否则是无法获取到图片路径的

执行过程截图：

来源：https://blog.csdn.net/hanchaobiao/article/details/72873142

0

投稿

猜你喜欢

J2EE基础应用：J2EE中SQL语句自动构造方法
INSERT、DELETE、UPDATE 三种SQL语句是数据库技术的三大基本语句. 在通常的web开发中对它的处理可以说是无处不在. 如果
Python爬虫之获取心知天气API实时天气数据并弹窗提醒
一、心知天气API密钥获取首先，访问https://www.seniverse.com，进行登录或者注册操作，然后在控制台上创建一个免费版的
详解使用Python处理文件目录的相关方法
所有文件都包含在各个不同的目录下，不过Python也能轻松处理。os模块有许多方法能帮你创建，删除和更改目录。mkdir()方法可以使用os
HTML5 Canvas 起步(1) - 基本概念
什么是Canvas<canvas> 是一个新的 HTML 元素，这个元素在 HTML5&
解决Python传递中文参数的问题
今天有个需要需要传递中文参数给URL但是在GBK环境下的脚本传递GBK的参数老是给我报UNICODE的解码错误。烦的很。所以我们果断选择用u
在 SQL Server 数据库开发中的十大问题
在SQL Server中进行开发会让你身处险地，并且寻找快速解决方案。我们编辑了前十名关于SQL Server开发的常见问题。对常见的针对表
Python实现读取字符串按列分配后按行输出示例
本文实例讲述了Python实现读取字符串按列分配后按行输出。分享给大家供大家参考，具体如下：问题：输入一个字符串和一个数字，数字代表分为几行
flash(swf)遮住网页内容div的解决
网页中使用flash可以增强页面的动态交互效果，特别是用flash来制作广告，效果更好。经常使用flash的人，可能就碰到了flash会遮住
Elasticsearch属性单词常用解析说明
一、前言说实话，刚测试ES的时候，我的内心是崩溃的，好多单词都不知道
推荐一篇不错的新手asp编程的基本法则
一、新手常犯的错误在论坛看到很多帖子代码中都有一个共同的基本错误，字段类型错误。程序和数据库是紧紧相连的，数据库字段文本型或时间型的都使用单
Django中间件拦截未登录url实例详解
1.利用装饰器在视图中拦截未登录的url@login_required(login_url='/user/login/')d
Jmeter通过OS进程取样器调用Python脚本实现参数互传
1、 Python中 sys.argv的用法解释：sys.argv可以让python脚本从程序外部获取参数，sys.argv是一个列表，可用
详解Go语言中关于包导入必学的 8 个知识点
1. 单行导入与多行导入在 Go 语言中，一个包可包含多个 .go 文件（这些文件必须得在同一级文件夹中），只要这些 .go 文件的头部都使
如何使用postman(新手入门)
一、了解postman1. 什么是postman？------ 软件测试用来做接口测试的工具。2. 如何下载postman--
用纯CSS3绘制的网站图标
在Google Reader上看到网友分享的一个链接，真的发现自己已经out了。上面的这张图，是纯CSS实现的，没有背景图、没有Javasc
网站构成的基本元素—网页布局
网页可以说是网站构成的基本元素。当我们轻点鼠标，在网海中遨游，一幅幅精彩的网页会呈现在我们面前，那么，网页的精彩与否的因素是什么呢？色彩的搭
windows7下调试ASP+ACCESS错误“未找到提供程序该程序可能未正确安装”解决办法
刚刚换用windows7 64位旗舰版，使用其自带的iis7作为调试工具，今天调试一个ASP+ACCESS的网站的时候遇到了“ADODB.C
PHP composer更新指定依赖包过程详细讲解
composer更新依赖包compoesr 的 require/update 都可以更新指定的依赖包 (升级 / 降级)。require 更
javascript验证IP地址等验证例子
本文实例介绍了使用javascript来经验表单数据的方法，如：校验是否为英文，校验是否为数字及校验IP地址等： &l
Python-jenkins模块获取jobs的执行状态操作
1 获取jobs的当前任务状态server_1 = jenkins.Jenkins('http://％s:％s@192.168.37

Python os.access()用法实例

python 多线程应用介绍

Python语法快速入门指南

python 队列基本定义与使用方法【初始化、赋值、判断等】

Python如何实现强制数据类型转换

Python程序暂停的正常处理方法

Django框架HttpResponse对象用法实例分析

python装饰器代码深入讲解

Python cookbook（数据结构与算法）在字典中将键映射到多个值上的方法

C#调用Python的URL接口的示例

计算机二级考试真题-PPT-刘老师-小企业会计准则

使用Renamer for Mac如何批量重命名照片？

epic不能领取更多免费游戏怎么办？

word文档一二三级标题怎么设置？word文档设置一级二级三级标题教程

Win7停止服务对用户有没有影响？Win7停止服务还能用吗？

Vscode关闭空组教程

Win10打不开PS CS6提示“Configuration error:16”怎么办

通过Android trace文件分析死锁ANR实例过程

CSS注意事项: 针对 Safari（WebKit）

wps打不开简历怎么办

手机版 网络编程 asp之家 www.aspxhome.com