网络编程
位置:首页>> 网络编程>> Python编程>> python 多线程爬取壁纸网站的示例

python 多线程爬取壁纸网站的示例

作者:Martina_oh  发布时间:2023-11-14 21:45:30 

标签:python,多线程,爬虫,壁纸网站

基本开发环境

· Python 3.6

· Pycharm

需要导入的库

python 多线程爬取壁纸网站的示例

目标网页分析

python 多线程爬取壁纸网站的示例

网站是静态网站,没有加密,可以直接爬取

python 多线程爬取壁纸网站的示例

python 多线程爬取壁纸网站的示例

python 多线程爬取壁纸网站的示例

整体思路:

1、先在列表页面获取每张壁纸的详情页地址

2、在壁纸详情页面获取壁纸真实高清url地址

3、保存地址

代码实现

模拟浏览器请请求网页,获取网页数据

 python 多线程爬取壁纸网站的示例

这里只选择爬取前10页的数据

代码如下


import threading
import parsel
import requests

def get_html(html_url):
'''
获取网页源代码
:param html_url: 网页url
:return:
'''
response = requests.get(url=html_url, headers=headers)
return response

def get_par(html_data):
'''
把 response.text 转换成 selector 对象 解析提取数据
:param html_data: response.text
:return: selector 对象
'''
selector = parsel.Selector(html_data)
return selector

def download(img_url, title):
'''
保存数据
:param img_url: 图片地址
:param title: 图片标题
:return:
'''
content = get_html(img_url).content
path = '壁纸\\' + title + '.jpg'
with open(path, mode='wb') as f:
 f.write(content)
 print('正在保存', title)

def main(url):
'''
主函数
:param url: 列表页面 url
:return:
'''
html_data = get_html(url).text
selector = get_par(html_data)
lis = selector.css('.wb_listbox div dl dd a::attr(href)').getall()
for li in lis:
 img_data = get_html(li).text
 img_selector = get_par(img_data)
 img_url = img_selector.css('.wb_showpic_main img::attr(src)').get()
 title = img_selector.css('.wb_pictitle::text').get().strip()
 download(img_url, title)
end_time = time.time() - s_time
print(end_time)

if __name__ == '__main__':
for page in range(1, 11):
 url = 'http://www.deskbizhi.com/min/list-{}.html'.format(page)
 main_thread = threading.Thread(target=main, args=(url,))
 main_thread.start()

来源:https://www.cnblogs.com/Martinaoh/p/14321201.html

0
投稿

猜你喜欢

手机版 网络编程 asp之家 www.aspxhome.com