动态网页加载数据,我们之前用JSON获取网页的原始数据,过程比较复杂。本课我们使用selenim自动抓取网页的数据,接下来我们会逐一讲解抓取的过程。
1元。网络数据抓取的问题解决思路

先来回忆一下抓取网页的主要步骤:首先获取网页完整的源数据,Kramp-karren Bauer Kramp-karren Bauer,然后用xpath数据分析Kramp-karren Bauer Kramp-karren Bauer得到想要的数据。
冠军联赛。获取网页的源代码数据
我们这次操作的网页是动态加载数据的http://scxk.nmpa.gov.cn:81/xk/,。在使用前面的requests模块获取数据时,我们无法通过get请求直接获取真正的源数据。我们使用Ajax请求来间接获取这个页面的数据。这一次,我们使用不同的selenim模块来获取数据。
首先,导入模块自动读取发起的数据请求。

我们使用苹果电脑自带的Safari浏览器发起请求,获取实例化的对象驱动,然后发起get请求。
第二步是获取源代码数据。
Selenim模块通过page_source方法获取网页的源代码,不同于通过text方法获取requests方法,这样我们就可以得到网页的源代码数据。

第三步,分析数据。
我们主要是通过源代码获取这个页面的企业名称,如下图所示。xpath将数据解析为请求。
第四步:关闭自动化。
侏罗纪世界3。获取网页的源代码数据
最终效果图


