Python selenium爬取微博数据代码实例
作者:djl_djl 发布时间:2023-07-01 02:46:49
标签:Python,selenium,爬取
爬取某人的微博数据,把某人所有时间段的微博数据都爬下来。
具体思路:
创建driver-----get网页----找到并提取信息-----保存csv----翻页----get网页(开始循环)----...----没有“下一页”就结束,
用了while True,没用自我调用函数
嘟大海的微博:https://weibo.com/u/1623915527
办公室小野的微博:https://weibo.com/bgsxy
代码如下
from selenium import webdriver
from selenium.webdriver.common.keys import Keys
import csv
import os
import time
#只有这2个参数设置,想爬谁的微博数据就在这里改地址和目标csv名称就行
weibo_url = 'https://weibo.com/bgsxy?profile_ftype=1&is_all=1#_0'
csv_name = 'bgsxy_allweibo.csv'
def start_chrome():
print('开始创建浏览器')
driver = webdriver.Chrome(executable_path='C:/Users/lori/Desktop/python52project/chromedriver_win32/chromedriver.exe')
driver.start_client()
return driver
def get_web(url): #获取网页,并下拉到最底部
print('开始打开指定网页')
driver.get(url)
time.sleep(7)
scoll_down()
time.sleep(5)
def scoll_down(): # 滚轮下拉到最底部
html_page = driver.find_element_by_tag_name('html')
for i in range(7):
print(i)
html_page.send_keys(Keys.END)
time.sleep(1)
def get_data():
print('开始查找并提取数据')
card_sel = 'div.WB_cardwrap.WB_feed_type'
time_sel = 'a.S_txt2[node-type="feed_list_item_date"]'
source_sel = 'a.S_txt2[suda-uatrack="key=profile_feed&value=pubfrom_guest"]'
content_sel = 'div.WB_text.W_f14'
interact_sel = 'span.line.S_line1>span>em:nth-child(2)'
cards = driver.find_elements_by_css_selector(card_sel)
info_list = []
for card in cards:
time = card.find_elements_by_css_selector(time_sel)[0].text #虽然有可能在一个card中有2个time元素,我们取第一个就对
if card.find_elements_by_css_selector(source_sel):
source = card.find_elements_by_css_selector(source_sel)[0].text
else:
source = ''
content = card.find_elements_by_css_selector(content_sel)[0].text
link = card.find_elements_by_css_selector(time_sel)[0].get_attribute('href')
trans = card.find_elements_by_css_selector(interact_sel)[1].text
comment = card.find_elements_by_css_selector(interact_sel)[2].text
like = card.find_elements_by_css_selector(interact_sel)[3].text
info_list.append([time,source,content,link,trans,comment,like])
return info_list
def save_csv(info_list,csv_name):
csv_path = './' + csv_name
print('开始写入csv文件')
if os.path.exists(csv_path):
with open(csv_path,'a',newline='',encoding='utf-8-sig') as f: #newline=''避免空行;encoding='utf-8-sig'比utf8牛,保存中文没问题
writer = csv.writer(f)
writer.writerows(info_list)
else:
with open(csv_path,'w+',newline='',encoding='utf-8-sig') as f:
writer = csv.writer(f)
writer.writerow(['发布时间','来源','内容','链接','转发数','评论数','点赞数'])
writer.writerows(info_list)
time.sleep(5)
def next_page_url():
next_page_sel = 'a.page.next'
next_page_ele = driver.find_elements_by_css_selector(next_page_sel)
if next_page_ele:
return next_page_ele[0].get_attribute('href')
else:
return None
driver = start_chrome()
input('请在chrome中登录weibo.com') # 暂停程序,手动登录weibo.com
while True:
get_web(weibo_url)
info_list = get_data()
save_csv(info_list,csv_name)
if next_page_url():
weibo_url = next_page_url()
else:
print('爬取结束')
break
来源:https://www.cnblogs.com/djlbolgs/p/12513661.html
0
投稿
猜你喜欢
- Microsoft SQL Server 2008通过与Microsoft Office的深度集成,为所有人提供了可用的商业智能,以合适的价
- 函数重载的替代方法-伪重载,下面看一个具体的实例代码。<? php//函数重载的替代方法-伪重载////确实,在PHP中没有函数重载这
- 在写代码的时候,往往会漏掉日志这个关键因素,导致功能在使用的时候出错却无法溯源。其实,只需要写一个非常简单的日志装饰器,我们就能大大提升排查
- SMTP协议首先了解SMTP(简单邮件传输协议),邮件传送代理程序使用SMTP协议来发送电邮到接收者的邮件服务器。SMTP协议只能用来发送邮
- 作为一门脚本语言,写脚本时执行系统命令可以说很常见了,python提供了相关的模块和方法。os模块提供了访问操作系统服务的功能,由于涉及到操
- 随着技术的不断升级,微软的王牌数据库SQL Server 2000正在逐渐淡出人们的视线,而新版的SQL Server 2005正成为企业和
- 本文实例讲述了Python设计模式之建造者模式。分享给大家供大家参考,具体如下:建造者模式(Builder Pattern):将一个复杂对象
- 基于pygame的飞机大作战小游戏,适合新手,不能直接运行,只能在命令行进入当前游戏目录,输入python game.py才能够运行,尚不知
- 以下排序算法最终结果都默认为升序排列,实现简单,没有考虑特殊情况,实现仅表达了算法的基本思想。冒泡排序内层循环中相邻的元素被依次比较,内层循
- 1. python中创建新的csv文件(1). 使用csv.writer()创建:代码如下:import csvheaders = [
- 第一节:WAP的潜能 这些日子,我们常听到WAP技术,一种手机上网的技术。从技术上讲,移动电话不可能和PC来竞争,移动电话的屏幕只能容下很少
- firefox不支持text-overflow一直让人很折腾。。不过还好有大虾为我们提供解决方案。。text-overflow: ellip
- 本文实例讲述了php解析字符串里所有URL地址的方法。分享给大家供大家参考。具体如下:<?php// $html = the html
- 数据丢失(缺失)在现实生活中总是一个问题。 机器学习和数据挖掘等领域由于数据缺失导致的数据质量差,在模型预测的准确性上面临着严重的问题。 在
- 关于php的引用(就是在变量或者函数、对象等前面加上&符号)的作用,我们先看下面这个程序。<?php
- 对于大多数web应用来说,数据库都是一个十分基础性的部分。如果你在使用PHP,那么你很可能也在使用MySQL—LAMP系列中举足轻重的一份子
- 周六。据闻北服美女甚多,于是应邀去做了一个关于UED的讲座。人不多,讲的很乱,但大家听的很认真,欣慰。讲完之后回答了很多关于社区、搜索、设计
- 1. A List Apart CSS TopicsA List Apart是一个CSS优秀文章的收集网站,从1999年开始收集文章,关注最
- 有助于效率的类型选择1、使你的数据尽可能小最基本的优化之一是使你的数据(和索引)在磁盘上(并且在内存中)占据的空间尽可能小。这能给出巨大的改
- 由于工作对人的眼球和精神都会带来一定的疲劳,所以在界面设计中,希望用户能够准确的关注重要的信息,而不因为用户的长期使用而流失信息。最近在看《