Python3直接爬取图片URL并保存示例
作者:TelAntiNomy 发布时间:2022-10-31 17:30:40
标签:Python3,爬取,图片URL,保存
有时候我们会需要从网络上爬取一些图片,来满足我们形形色色直至不可描述的需求。
一个典型的简单爬虫项目步骤包括两步:获取网页地址和提取保存数据。
这里是一个简单的从图片url收集图片的例子,可以成为一个小小的开始。
获取地址
这些图片的URL可能是连续变化的,如从001递增到099,这种情况可以在程序中将共同的前面部分截取,再在最后递增并字符串化后循环即可。
抑或是它们的URL都保存在某个文件中,这时可以读取到列表中:
def getUrls(path):
urls = []
with open(path,'r') as f:
for line in f:
urls.append(line.strip('\n'))
return(urls)
保存图片
在python3中,urllib提供了一系列用于操作URL的功能,其中的request模块可以非常方便地抓取URL内容,也就是发送一个GET请求到指定的页面,然后返回HTTP的响应。具体细节请看注释:
def requestImg(url, name, num_retries=3):
img_src = url
# print(img_src)
header = {
'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) \
AppleWebKit/537.36 (KHTML, like Gecko) \
Chrome/35.0.1916.114 Safari/537.36',
'Cookie': 'AspxAutoDetectCookieSupport=1'
}
# Request类可以使用给定的header访问URL
req = urllib.request.Request(url=img_src, headers=header)
try:
response = urllib.request.urlopen(req) # 得到访问的网址
filename = name + '.jpg'
with open(filename, "wb") as f:
content = response.read() # 获得图片
f.write(content) # 保存图片
response.close()
except HTTPError as e: # HTTP响应异常处理
print(e.reason)
except URLError as e: # 一定要放到HTTPError之后,因为它包含了前者
print(e.reason)
except IncompleteRead or RemoteDisconnected as e:
if num_retries == 0: # 重连机制
return
else:
requestImg(url, name, num_retries-1)
其他
捕获异常
以下是批量爬取网页时可能需要捕获的异常,同时可以看出,urllib2库对应urllib库,而httplib库对应http.client:
Python2 | Pyhton3 |
---|---|
urllib2.HTTPError | urllib.error.HTTPError |
urllib2.URLError | urllib.error.URLError (HTTPError被包含其中) |
httplib.IncompleteRead | http.client.IncompleteRead |
httplib.RemoteDisconnected | http.client.RemoteDisconnected |
重连机制
在函数参数中设置一个参数num_retries并对其进行初始化,即默认参数。在某些异常出现时可以将该参数递减,再让它递归调用自身,这就是基本的重连机制。
修饰器
有种设计模式叫修饰器模式,它可以在不修改目标函数代码的前提下,在目标函数执行前后增加一些额外功能。
def clock(func): # 修饰器函数,对函数计时
def clocked(*args):
t0 = timeit.default_timer()
result = func(*args)
elapsed = timeit.default_timer() - t0
name = func.__name__
arg_str = ', '.join(repr(arg) for arg in args)
print('[%0.8fs] %s(%s)' % (elapsed, name, arg_str))
# print('%s(%s) -> %r [%0.8fs]' % (name, arg_str, result, elapsed))
return result
return clocked
上面这段代码是修饰器函数的一个例子,用来对函数运行时间进行计时,在需要计时的函数上一行添加一点点代码即可:
@clock
完整代码
from urllib.error import HTTPError, URLError
from http.client import IncompleteRead, RemoteDisconnected
import timeit, time
import urllib.request
import socket
# timeout = 20
# socket.setdefaulttimeout(timeout) # 等待,防止被简单地反爬
def getUrls(path):
urls = []
with open(path,'r') as f:
for line in f:
urls.append(line.strip('\n'))
return(urls)
def clock(func): # 修饰器函数,对函数计时
def clocked(*args):
t0 = timeit.default_timer()
result = func(*args)
elapsed = timeit.default_timer() - t0
name = func.__name__
arg_str = ', '.join(repr(arg) for arg in args)
print('[%0.8fs] %s(%s)' % (elapsed, name, arg_str))
# print('%s(%s) -> %r [%0.8fs]' % (name, arg_str, result, elapsed))
return result
return clocked
@clock
def requestImg(url, name, num_retries=3):
img_src = url
# print(img_src)
header = {
'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) \
AppleWebKit/537.36 (KHTML, like Gecko) \
Chrome/35.0.1916.114 Safari/537.36',
'Cookie': 'AspxAutoDetectCookieSupport=1'
}
req = urllib.request.Request(url=img_src, headers=header)
try:
response = urllib.request.urlopen(req)
filename = name + '.jpg'
with open(filename, "wb") as f:
content = response.read()
f.write(content)
response.close()
except HTTPError as e:
print(e.reason)
except URLError as e:
print(e.reason)
except IncompleteRead or RemoteDisconnected as e:
if num_retries == 0:
return
else:
requestImg(url, name, num_retries-1)
if __name__ =='__main__':
urls = getUrls('./'URLS.txt') # 换成你的URL文件路径
nLines = len(urls)
print(nLines)
for index, value in enumerate(urls):
requestImg(value, './'+str(index).zfill(6)) # zfill用来格式化数字:000001
来源:https://blog.csdn.net/Tele_Anti_Nomy/article/details/88092012


猜你喜欢
- 一、简介我们来看看对 Vuex 比较专业的介绍:Vuex 是一个专为 Vue 开发的应用程序的状态管理模式,它采用集中式存储管理应用的所有组
- 这篇文章主要介绍了给Python初学者的一些编程技巧,皆是基于基础的一些编程习惯建议,需要的朋友可以参考下交换变量x = 6y = 5 x,
- 一、使用python3做webervice接口测试的第三方库选择suds-jurko库,可以直接pip命令直接下载,也可以在pypi官网下载
- 情况一:坐标上的内容是文字时如上图这样一个横向的柱状图,y坐标轴的内容太长后会导致显示不全。因为数据是由后端传过来的,有些会很长有些会比较短
- 目录结构:只需在自己的python项目下随便创建一个文件夹(下图中为:daka),然后将下载的chromedriver.exe、ask_fo
- 进程与线程想象在学校的一个机房,有固定数量的电脑,老师安排了一个爬虫任务让大家一起完成,每个学生使用一台电脑爬取部分数据,将数据放到一个公共
- 前言python2.x版本的字符编码有时让人很头疼,遇到问题,网上方法可以解决错误,但对原理还是一知半解,本文主要介绍 python 中字符
- 本文实例讲述了python实现将pvr格式转换成pvr.ccz的方法。分享给大家供大家参考。具体实现方法如下:import zlibimpo
- 在本文中,我们向您介绍一些提示和技巧,以帮助您更快地编写代码Python的可读性和设计简单性是其广受欢迎的两个主要原因。一些常见的Pytho
- 给定一个可迭代sequence,对其中的值进行出现次数统计:方法1:def get_counts(sequence): counts = {
- 变量方法举例备注用变量存储值name = "xxx"print("name ", name )小写字
- 1.安装wkhtmltopdf下载地址:https://wkhtmltopdf.org/downloads.html我测试用的是window
- 在《CSS二级菜单》中,如果一级菜单中的超链接是#,那么只要单击该一级菜单,那么与这个一级菜单对应的二级菜单就会一直显示在网页中,不能隐藏,
- 一、下载1.mysql官网下载地址:https://downloads.mysql.com/archives/community/2.下载完
- 一个网站能切换不同的CSS风格大家应该都了解,像众所周知的腾讯在今年改版时也增加了切换皮肤的功能。根据时间自动调整站点风格是不错的想法,这种
- python3 最常用的三种装饰器语法总结1.简述语法装饰器也叫函数装饰器,主要作用是在不修改原来函数的代码情况下(函数本身不会被修改,执行
- struts2.3.24 + spring4.1.6 + hibernate4.3.11+ mysql5.5.25开发环境搭建及相关说明。
- Select字句在逻辑上是SQL语句最后进行处理的最后一步,所以,以下查询会发生错误:SELECT YEAR(OrderDate) AS O
- 上个周末去书店时碰巧看到了AS3 CookeBook,我记得在apollo的alpha版快出来的时候,7yue就推荐过这个小册子,只不过我已
- 本文实例讲述了Python三元运算实现方法。分享给大家供大家参考。具体分析如下:Python中没有像C++和Java等语言中的三元运算符,但