Python selenium爬取微博数据代码实例
作者:djl_djl 发布时间:2023-07-01 02:46:49
标签:Python,selenium,爬取
爬取某人的微博数据,把某人所有时间段的微博数据都爬下来。
具体思路:
创建driver-----get网页----找到并提取信息-----保存csv----翻页----get网页(开始循环)----...----没有“下一页”就结束,
用了while True,没用自我调用函数
嘟大海的微博:https://weibo.com/u/1623915527
办公室小野的微博:https://weibo.com/bgsxy
代码如下
from selenium import webdriver
from selenium.webdriver.common.keys import Keys
import csv
import os
import time
#只有这2个参数设置,想爬谁的微博数据就在这里改地址和目标csv名称就行
weibo_url = 'https://weibo.com/bgsxy?profile_ftype=1&is_all=1#_0'
csv_name = 'bgsxy_allweibo.csv'
def start_chrome():
print('开始创建浏览器')
driver = webdriver.Chrome(executable_path='C:/Users/lori/Desktop/python52project/chromedriver_win32/chromedriver.exe')
driver.start_client()
return driver
def get_web(url): #获取网页,并下拉到最底部
print('开始打开指定网页')
driver.get(url)
time.sleep(7)
scoll_down()
time.sleep(5)
def scoll_down(): # 滚轮下拉到最底部
html_page = driver.find_element_by_tag_name('html')
for i in range(7):
print(i)
html_page.send_keys(Keys.END)
time.sleep(1)
def get_data():
print('开始查找并提取数据')
card_sel = 'div.WB_cardwrap.WB_feed_type'
time_sel = 'a.S_txt2[node-type="feed_list_item_date"]'
source_sel = 'a.S_txt2[suda-uatrack="key=profile_feed&value=pubfrom_guest"]'
content_sel = 'div.WB_text.W_f14'
interact_sel = 'span.line.S_line1>span>em:nth-child(2)'
cards = driver.find_elements_by_css_selector(card_sel)
info_list = []
for card in cards:
time = card.find_elements_by_css_selector(time_sel)[0].text #虽然有可能在一个card中有2个time元素,我们取第一个就对
if card.find_elements_by_css_selector(source_sel):
source = card.find_elements_by_css_selector(source_sel)[0].text
else:
source = ''
content = card.find_elements_by_css_selector(content_sel)[0].text
link = card.find_elements_by_css_selector(time_sel)[0].get_attribute('href')
trans = card.find_elements_by_css_selector(interact_sel)[1].text
comment = card.find_elements_by_css_selector(interact_sel)[2].text
like = card.find_elements_by_css_selector(interact_sel)[3].text
info_list.append([time,source,content,link,trans,comment,like])
return info_list
def save_csv(info_list,csv_name):
csv_path = './' + csv_name
print('开始写入csv文件')
if os.path.exists(csv_path):
with open(csv_path,'a',newline='',encoding='utf-8-sig') as f: #newline=''避免空行;encoding='utf-8-sig'比utf8牛,保存中文没问题
writer = csv.writer(f)
writer.writerows(info_list)
else:
with open(csv_path,'w+',newline='',encoding='utf-8-sig') as f:
writer = csv.writer(f)
writer.writerow(['发布时间','来源','内容','链接','转发数','评论数','点赞数'])
writer.writerows(info_list)
time.sleep(5)
def next_page_url():
next_page_sel = 'a.page.next'
next_page_ele = driver.find_elements_by_css_selector(next_page_sel)
if next_page_ele:
return next_page_ele[0].get_attribute('href')
else:
return None
driver = start_chrome()
input('请在chrome中登录weibo.com') # 暂停程序,手动登录weibo.com
while True:
get_web(weibo_url)
info_list = get_data()
save_csv(info_list,csv_name)
if next_page_url():
weibo_url = next_page_url()
else:
print('爬取结束')
break
来源:https://www.cnblogs.com/djlbolgs/p/12513661.html
0
投稿
猜你喜欢
- 如何制作一个股票滚屏显示面板?<html> <head> <script
- 接口压力测试500次,查看响应时间import jsonimport requestsimport logginglogging.basic
- @property作用:python的@property是python的一种装饰器,是用来修饰方法的。我们可以使用@property装饰器来
- vue-loader和webpack项目配置及npm错误学习vue的同学都知道,想要生成一个vue项目,使用vue-cli脚手架工具直接生成
- 一、任务实现一个4 层的全连接网络实现二分类任务,网络输入节点数为2,隐藏层的节点数设计为:25,50,25,输出层2 个节点,分别表示属于
- 在日常工作或生活中,总避免不了需要操作文件或文件夹,比如希望找出电脑中所有临时文件并清除,或者找到指定文件夹内所有图片文件并进行重新命名等等
- <?php function getIPLoc_sina($queryIP){ $url =
- 表一、运算符与特殊字符 运算符描述/选择子元素,返回左侧元素的直接子元素;如果"/"位于最左侧表示选择根结点的直接子元素
- 目的将一些小的字符串合并成一个大字符串,更多考虑的是性能方法 常见的方法有以下几种:1.使用+=操作符BigString=smal
- 1.官网下载Pycharm community版如pycharm-community-2017.3.1.tar.gz。2. #解压tar.g
- 如果你使用的正是mysql数据库,那么你把密码或者其他敏感重要信息保存在应用程序里的机会就很大。保护这些数据免受黑客或者窥探者的获取是一个令
- 如下代码会将npy的格式数据读出,并且输出来到控制台:import numpy as np##设置全部数据,不输出省略号 import sy
- 因一些特殊需求需要以参数的形式获取字典 * 定的值,网上搜了一下并没有特别好的实现(并没有太认真去找~),所以自己实现了一个,以供大家参考:)
- 利用Python OpenCV中的 cv.Resize(源,目标,变换方法)就可以实现变换为想要的尺寸了源文件:就不用说了目标:你可以对图像
- 本文实例为大家分享了python简单贪吃蛇的具体代码,供大家参考,具体内容如下import sysimport randomimport p
- 本文实例讲述了MSSql简单查询出数据表中所有重复数据的方法。分享给大家供大家参考,具体如下:这里直接给出下面的例子:SELECT * FR
- 在计算机科学中,精确的小数计算是一个常见的问题,因为在计算机中使用二进制表示小数时,有些小数可能无法用二进制表示精确的十进制数。这导致了在计
- 【需求背景】有时候我们要对比两份配置文件是不是一样,或者比较两个文本是否异样,可以使用linux命令行工具diff a_file b_fil
- 如何在一个广告旗帜里轮番显示时间长度不一的不同广告?好了,下面就是Ad Rotator组件完整的应用例子:adrot.asp<html
- 在之前文章给大家分享后不久,就有位小伙伴跟小编说在用scrapy搭建python爬虫中出现错误了。一开始的时候小编也没有看出哪里有问题,好在