教程集 > Python编程 > Python入门 > 正文 python怎么获取js动态加载的数据

python怎么获取js动态加载的数据

发布时间：2021-05-01 编辑：jiaochengji.com

教程集为您提供python怎么获取js动态加载的数据等资源，欢迎您收藏本站，我们将为您提供最新的python怎么获取js动态加载的数据资源

我们在做网页抓取的时候，一般来说使用urllib和urllib2就能满足大部分需求。

但是有时候我们遇见那种使用js动态加载的网页。就会发现urllib只能抓出一个部分内容空白的网页。就像下面百度图片的结果页：

相关推荐：《Python基础教程》

审查元素之后，发现百度图片中，显示图片的div为：pullimages

这个div里面的内容是动态加载的。而使用urllib&urllib2是抓取不到的。

要抓取动态加载的元素，首先考虑使用selenium来调用浏览器进行抓取。

而我们运行的环境是linux，最理想的方法是在无界面情况下进行抓取，所以使用selenium phantomjs来进行无界面抓取。

phantomjs是什么呢？它是一个基于webkit内核的无头浏览器，即没有UI界面，即它就是一个浏览器。

selenium和phantomjs的安装配置可以google，这里就略过不谈了。

代码如下：

from selenium import webdriver
driver = webdriver.PhantomJS(executable_path='/bin/phantomjs/bin/phantomjs')
#如果不方便配置环境变量。就使用phantomjs的绝对路径也可以
driver.get('http://image.baidu.com/i?ie=utf-8&word=周杰伦')
#抓取了百度图片，query：周杰伦
driver.page_source 
#这就是返回的页面内容了，与urllib2.urlopen().read()的效果是类似的，但比urllib2强在能抓取到动态渲染后的内容。
driver.quit()

到这里。就抓取动态页面成功了。

您可能感兴趣的文章：
python怎么获取js动态加载的数据
 scrapy和python有什么关系
 python怎么做反爬
 数据分析师为什么要学python
python和爬虫有什么关系
 python数据分析需要什么基础
 python怎么下载64位的
 爬虫入门的基本原理，如果你连这些都不知道那你可以放弃爬虫了！
python语言什么时候发明的
 Python是一门怎样的编程语言

上一篇：python正则表达式r表示什么意思下一篇：python如何截取数组前几个

[关闭]

python怎么获取js动态加载的数据

最近更新

浏览排行