Selenium 模拟浏览器动态加载页面的实现方法
作者:mmc2015 发布时间:2023-06-04 11:06:54
标签:Selenium,动态加载页面
相信爬取大公司的数据时,常常会遇到页面信息动态加载的问题,
如果仅仅使用content = urllib2.urlopen(URL).read(),估计信息是获取不全的,这时候就需要模拟浏览器加载页面的过程,
selenium提供了方便的方法,我也是菜鸟,试了很多种方式,下面提供觉得最靠谱的(已经证明对于爬取新浪微博的topic、twitter under topic完全没问题)。
至于下面的browser变量是什么,看前面的几篇文章。
首先是请求对应的URL:
right_URL = URL.split("from")[0] + "current_page="+str(current_page) + "&since_id="+str(since_id) + "&page="+str(page_index) + "#Pl_Third_App__"+str(Pl_Third_App)
print right_URL
try:
browser.get(right_URL)
print "loading more, sleep 3 seconds ... 0"
time.sleep(3) # NO need for this sleep, but we add ...
browser = selenuim_loading_more(browser, method_index=0)
except:
print "one exception happen ==> get_tweeter_under_topic 2 ..."
pass
然后模拟浏览器,加载更多(推荐使用method_index=0,已经证明比其他好用很多):
def selenuim_loading_more(browser, method_index=0):
if method_index==0:
browser.implicitly_wait(3) # 为了快速滑动,先设置超时时间为1秒
# while True:
for i in range(1, 4): # at most 3 times
print "loading more, window.scrollTo bettom for the", i,"time ..."
browser.execute_script("window.scrollTo(0,document.body.scrollHeight);")
try:
# 定位页面底部的换页tab
browser.find_element_by_css_selector("div[class='W_pages']")
break # 如果没抛出异常就说明找到了底部标志,跳出循环
except NoSuchElementException:
pass # 抛出异常说明没找到底部标志,继续向下滑动
browser.implicitly_wait(4) # 将超时时间改回10秒
elif method_index==1:
browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more
print "loading more, sleep 4 seconds ... 1"
time.sleep(4)
browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more
print "loading more, sleep 3 seconds ... 2"
time.sleep(2)
elif method_index==2:
load_more_1 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more
ActionChains(browser).click(load_more_1).perform()
print "loading more, sleep 4 seconds ... 1"
time.sleep(4)
load_more_2 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more
ActionChains(browser).click(load_more_2).perform()
print "loading more, sleep 3 seconds ... 2"
time.sleep(2)
elif method_index==3:
print "loading more, sleep 4 seconds ... 1"
element = WebDriverWait(browser, 4).until(
EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']"))
)
element.click()
print "loading more, sleep 2 seconds ... 2"
WebDriverWait(browser, 2).until(
EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']"))
).click()
return browser
来源:https://blog.csdn.net/mmc2015/article/details/53366452
0
投稿
猜你喜欢
- 前言:内容提要:本文比较了 Python 中用于列表排序的两种函数 sort() 和 sorted(),帮助您选择合适的排序函数。对列表排序
- function.js<!--function getObject(objectId) { &nbs
- 每当有新员工入职,人事小姐姐都要收集大量的工资卡信息,并且生成Excel文档,看到小姐姐这么辛苦,我就忍不住要去帮她了&hellip
- 使用一个遵循buffer protocol的对象就可以和numpy交互了.这个buffer_protocol要有哪些东西呢? 要有如下接口:
- 对于管理系统,常常需要展示列表数据,我们对于列表内的数据常常需要查找、过滤、排序等操作,其中查找等操作大部分是在后台进行的。django r
- 代码如下:CREATE TABLE #tmptb(tbname sysname,tbrows int ,tbREserved varchar
- 有时候在测试django中一些模块时,不想重新跑一整个django项目,只想跑单个文件,正好写在if __name__ == '__
- QSS介绍前言QSS即Qt样式表,是用来自定义控件外观的一种机制,QSS大量参考了Css的内容,但QSS的功能要比Css弱得多,体现在选择器
- 第三章 XML的术语提纲:导言 一.XML文档的有关术语 二.DTD的有关术语导言初学XML最令人头疼的就是有一大堆新的术语概念要理解。由于
- asp之家注:如果你学习过asp,并且在网络公司上过班,一定会接触到网购系统,网购系统可以说是一个典型的程序类型,而其中最重要,也是最关键的
- 经典神经网络的改进点名称改进点VGG161、使用非常多的3*3卷积串联,利用小卷积代替大卷积,该操作使得其拥有更少的参数量,同时会比单独一个
- 最近被“模块化”缠身,又是文章又是PPT的,被逼着想了很多相关的东西。整理下我这段时间对于“模块化”的思考,大多都是我自己从事页面重构这份工
- 修改HTMLTestRunner.py以支持python3+搜索到的结果整理修改一: 在python shell里输入 >>&g
- 本文实例讲述了PHP获取当前相对于域名目录的方法。分享给大家供大家参考。具体如下:http://127.0.0.1/dev/classd/i
- 思路:<img alt="" src="/img/图片真实地址" ></img&g
- 一、安装步骤 1.官网下载安装包2.安装一路next即可,安装位置可改到D盘3.添加环境变量将如上路径添加到系统path,不会的参
- 当然如果想了解更多编辑器的原理制作方法,只有你自己去下载一个在线编辑器,慢慢研究,相信会有更多的收获!HTML在线编辑器的基本概念1,什么是
- 编写Python SDK代码工程目录结构├──── easyhttp
- Python编写微信小游戏“跳一跳”的运行脚本,分享给大家。更新了微信后发现了一款小游戏跳一跳,但是玩了一下午最高才达到200,每次差点破纪
- 不用切图,只要设置基本的 图片及其属性即可!用鼠标右键控制图片翻转!<style>*{ FONT-SIZE: 12px; }se