Python使用xpath实现图片爬取
作者:lurkerzhang 发布时间:2023-07-10 16:45:42
标签:Python,xpath,爬取
高性能异步爬虫
目的:在爬虫中使用异步实现高性能的数据爬取操作
异步爬虫的方式:
- 多线程、多进程(不建议):
好处:可以为相关阻塞的操作单独开启多线程或进程,阻塞操作就可以异步执行;
弊端:无法无限制的开启多线程或多进程。
- 线程池、进程池(适当的使用):
好处:我们可以降低系统对进程或线程创建和销毁的一个频率,从而很好的降低系统的开销;
弊端:池中线程或进程的数据是有上限的。
代码如下
# _*_ coding:utf-8 _*_
"""
@FileName :6.4k图片解析爬取(异步高性能测试).py
@CreateTime :2020/8/14 0014 10:01
@Author : Lurker Zhang
@E-mail : 289735192@qq.com
@Desc. :
"""
import requests
from lxml import etree
from setting.config import *
import json
import os
import time
from multiprocessing.dummy import Pool
def main():
# 图片采集源地址
# source_url = 'http://pic.netbian.com/4kmeinv/'
# temp_url = 'http://pic.netbian.com/4kmeinv/index_{}.html'
# source_url = 'http://pic.netbian.com/4kdongman/'
# temp_url = 'http://pic.netbian.com/4kdongman/index_{}.html'
source_url = 'http://pic.netbian.com/4kmingxing/'
temp_url = 'http://pic.netbian.com/4kmingxing/index_{}.html'
# 本此采集前多少页,大于1的整数
page_sum = 136
all_pic_list_url = []
if page_sum == 1:
pic_list_url = source_url
print('开始下载:' + pic_list_url)
all_pic_list_url.append(pic_list_url)
else:
# 先采集第一页
pic_list_url = source_url
# 调用采集单页图片链接的函数
all_pic_list_url.append(pic_list_url)
# 再采集第二页开始后面的页数
for page_num in range(2, page_sum + 1):
pic_list_url = temp_url.format(page_num)
all_pic_list_url.append(pic_list_url)
# 单页图片多线程解析
pool1 = Pool(10)
pool1.map(down_pic, all_pic_list_url)
print('采集完成,本地成功下载{0}张图片,失败{1}张图片。'.format(total_success, total_fail))
# 存储已下载文件名列表:
with open("../depository/mingxing/pic_name_list.json", 'w', encoding='utf-8') as fp:
json.dump(pic_name_list, fp)
def down_pic(pic_list_url):
print("准备解析图片列表页:",pic_list_url)
# 获取图片列表页的网页数据
pic_list_page_text = requests.get(url=pic_list_url, headers=headers).text
tree_1 = etree.HTML(pic_list_page_text)
# 获取图片地址列表
pic_show_url_list = tree_1.xpath('//div[@class="slist"]/ul//a/@href')
pic_url_list = [get_pic_url('http://pic.netbian.com' + pic_show_url) for pic_show_url in pic_show_url_list]
# 开始下载并保存图片(多线程)
pool2 = Pool(5)
pool2.map(save_pic, pic_url_list)
def save_pic(pic_url):
print("准备下载图片:",pic_url)
global total_success, total_fail, pic_name_list,path
picname = get_pic_name(pic_url)
if not picname in pic_name_list:
# 获取日期作为保存位置文件夹
pic = requests.get(url=pic_url, headers=headers).content
try:
with open(path + picname, 'wb') as fp:
fp.write(pic)
except IOError:
print(picname + "保存失败")
total_fail += 1
else:
pic_name_list.append(picname)
total_success += 1
print("成功保存图片:{0},共成功采集{1}张。".format(picname, total_success))
else:
print("跳过,已下载过图片:" + picname)
total_fail += 1
def get_pic_name(pic_url):
return pic_url.split('/')[-1]
def get_pic_url(pic_show_url):
tree = etree.HTML(requests.get(url=pic_show_url, headers=headers).text)
return 'http://pic.netbian.com/' + tree.xpath('//div[@class="photo-pic"]/a/img/@src')[0]
if __name__ == '__main__':
# 读入已采集图片的名称库,名称存在重复的表示已经采集过将跳过不采集
if not os.path.exists('../depository/mingxing/pic_name_list.json'):
with open("../depository/mingxing/pic_name_list.json", 'w', encoding="utf-8") as fp:
json.dump([], fp)
with open("../depository/mingxing/pic_name_list.json", "r", encoding="utf-8") as fp:
pic_name_list = json.load(fp)
path = '../depository/mingxing/' + time.strftime('%Y%m%d', time.localtime()) + '/'
if not os.path.exists(path):
os.mkdir(path)
# 记录本次采集图片的数量
total_success = 0
total_fail = 0
main()
来源:https://www.cnblogs.com/lurkerzhang/p/13561095.html
0
投稿
猜你喜欢
- 看到别人用td和table标签模拟的办法: 设置table的上、左padding
- MySQL采用了基于开销的优化器,以确定处理查询的最解方式。在很多情况下,MySQL能够计算最佳的可能查询计划,但在某些情况下,MySQL没
- 写过一篇"正则表达式30分钟入门教程",有读者问:[^abc]表示不包含a、b、c中任意字符, 我想实现不包含字符串ab
- 整数对象在Python内部用PyIntObject结构体表示:typedef struct {PyObject_HEADlong ob_iv
- 本次爬虫思路最最重要的是分析信息接口!!!1. 获取url2. 通过请求拿到响应3. 处理反爬4. 提取信息5. 保存内容本次操练网页htt
- 一、制作播放器的思路制作一个多功能音乐播放器的思路确定播放器的需求和功能,例如支持哪些音频格式、播放列表管理、循环播放、暂停、进度条显示等等
- 1.INSERT INTO SELECT语句 语句形式为:Insert into Table2(field1,field2,...) sel
- 最近的项目涉及到很多表单的制作,特别是复选框(checkbox)和单选框(radio)。但是在前端开发过程中发现,单(复)选框和它们后面的提
- 前记在Python3.7后官方库出现了contextvars模块, 它的主要功能就是可以为多线程以及asyncio生态添加上下文功能,即使程
- server端代码:package main import ( "fmt" "net" "
- 版本 0.9来自 http://onewww.net说明:当焦点不在表格内的input时,回车键复制最后一行,delete删除键最后一行选择
- 修改镜像源的原因是pip和conda默认国外镜像源,所以每次安装模块pip install ×××或者 conda install ×××的
- 相信有些小伙伴,在没接触py之前,肯定都是有所准备的,想学语言由来已久,拿小编来说,一直趁着空挡就开始找课程学习,用记下学习历程,还会向一些
- 在pycharm使用过程中,对于每次新建的python文件的时候,关于代码编写者的一些个人信息快捷填写,使用模板的方式比较方便。方法如下:1
- 之前有写过一篇浏览器的tab设计,这回说说网站的tab设计。一说到tab很自然地就想到了导航、信息架构。随着网站信息结构的复杂化,选择tab
- 大家都知道系统存储过程是无法用工具导出的(大家可以试试 >任务>生成SQL脚本) 因为系统存储过程一般是不让开发人员修改的。 需
- 2009年2月24日,Safari 4.0 beta版正式发布,Safari从它的3.2版本开始就已经支持所有的CSS选择器(包括最新的CS
- 本文实例讲述了Python实现字符串与数组相互转换功能。分享给大家供大家参考,具体如下:字符串转数组str = '1,2,3'
- 以前的Sony Ericsson牌DVD影碟机坏掉了,上周到沃尔玛买了个philips的回来,于是又淘了一些DVD回来看。在使用遥控的时候忽
- 一、在settings.py中配置DATABASES = { 'default': { 'ENGINE&