手把手教你如何从上自动批量下载原始数据

核心提示iProx中国的一个综合蛋白质组资源中心,旨在加速蛋白质组学领域的全球数据共享。iProx网站上存储了各科研单位的开源蛋白质组原始数据,有需要的老师和同学可以在网站上直接下载。找到原始数据后,只需选中某一条数据,点击右上角的“http“即可

IProx中国是一个综合性的蛋白质组资源中心,旨在加速蛋白质组学领域的全球数据共享。IProx网站存储了科研院所开源蛋白质组的原始数据,有需要的师生可以直接从网站下载。

找到原始数据后,只需选中某一条数据,点击右上角的“http”即可开始下载。但是有时候数据量很大,多达几百条,是不是要一条一条查,一条一条点下载?当然,边肖今天会教你如何用python自动下载这些数据。

下载蟒蛇

Anaconda是python的一个发布版本,与python2.7和python3.6类似,只是包含了很多科学计算的库,使用起来很方便。

搜索Anaconda进入官网,点击个人版进入下载页面。然后按照电脑系统下载。

打开jupyter笔记本

Juter Notebook是python的一个编辑器,通俗点说就是写代码的地方。与pycharm相比,最大的优点是可以写一行代码运行一次,并保留运行结果。但是,pycharm只能通过单击run来同时运行所有代码。总的来说,Jupyter笔记本还是比较灵活的,适合快速开发。

首先,找到Anaconda的安装路径。一般jupyter笔记本的安装路径在AnacondaAnacondascripts下。双击jupyter-notebook.exe来运行它。

运行后会弹出一个命令框,然后弹出一个网页。点击右上角的python3新建一个页面,在这个页面下开始编辑代码。

下载并导入相应的库。

在cell中输入下面的代码,单击Run,selenium和lxml库将被自动下载。

!皮普装硒!pip安装lmxl

输入以下代码,然后单击Run导入将在库中使用的模块。

从selenium导入webdriverimport时间

用selenium simulation打开一个网页

输入下面的代码,selenium会自动打开你想要下载的原始数据的页面。

URL = ' http://www . iprox . org//page/subproject . html id = IPX 0001400012 ' driver = web driver。Chromedriver.get

注意:url的值可以替换为您要下载数据的页面的URL。在这一步,很多朋友可能会遇到一个错误:

消息:“chromedriver”可执行文件需要位于路径中。请看https://sites.google.com/a/chromium.org/chromedriver/home

这是因为chrom浏览器没有安装web驱动程序。只需安装chrom浏览器当前版本对应的Chrom驱动即可。详细操作步骤请查看本网站。

如果用selenium打开网页后出现如下界面,需要根据提示一步一步安装插件。安装完成后,您可以在iProx网站上下载数据。另外,你可以在顶部看到一行小字:Chrom正在被自动测试软件控制,也就是说我们在用selenium控制软件,接下来写的代码会直接影响这个网页。

点击并下载selenium模拟

直接运行下面一行代码,原始数据前面的小方框就被选中了。下图中的一串红队是用来定位原始数据前面的小方框的。点击就是点击的意思。

driver . find _ element _ by _ XPath . click

向右滑动查看更多内容

如何使用这串代码进行定位?也很简单。打开下载页面,按F12,打开控制台,点击右上角的鼠标箭头。

然后点击原始数据前面的小方框,右边会给出这个小方框的网页代码。

把鼠标放在这行代码上,右键-复制-复制XPath,就可以复制上面红队的字符串了。

点击查看是第一步,点击下载是第二步。

同理,我们可以定位“http”,复制它的xpath语法,运行下面的代码,然后点击下载。这里注意:先设置chrom浏览器的默认保存路径,然后设置下载不用问,直接点击下载即可。

driver . find _ element _ by _ XPath . click

怎么样?是自动下载吗?这里下载的数据只有一个,当然是不够的。我们要下载100个数据!

下载批量数据

具体想法是这样的:

1.选择要下载的原始数据;

2.点击下载;

3.取消以前的选择;

4.等待10秒钟;

然后重复这4个步骤。至于为什么要等10秒,我怕下载太快会卡。

这里还需要注意的是,在selenium打开的页面中,我们手动将每页显示的数据数量从5更改为“全部”

然后我们用一个for循环实现批量下载。范围是指从第1个下载到第100个。如果想从20号到50号下载,可以改成range。点击运行,就可以休息了。selenium会自动点击页面下载。

怎么样?方便吗_

大家快行动起来,举一反三,解决工作中复杂耗时的重复性工作!!

估计你还想看吧?

◆盛鑫课程:这个分析不是太难系列——方差分析

◆盛鑫课程:一行代码,轻松绘制动态关系网络图。

◆盛鑫课程:这个R包不太冷系列三:一个“简单代码+简单调整=马上画图”的包

◆盛鑫课程:我该怎么救你!我的论文!我的实验数据!

◆信息分析——文档管理神器:经常被文档整理破坏?试试这个文档管理神器,让你的效率最大化。

◆盛鑫分析-数据库获取:如何从主流数据库中快速获取人/鼠数据?

◆信息分析-可视化处理工具:你可以更美:SnapGene Viewer软件的序列可视化操作

◆云平台:奥利可以做~ ~代谢途径的富集分析?

◆云平台:震惊!他花了3分钟完成了我三周的工作!

◆云平台:欧亿/陆明云|你不试试免费的聚类热图吗?

◆盛鑫分析:这个R包不太冷系列——go plot

◆盛鑫分析:10行代码让你的关联图变漂亮。

◆盛鑫解析:对话一幅百年名画——文章画稿配色高级简约!

◆盛鑫分析:只需3分钟即可获得“代谢途径分析神器”

◆盛鑫分析:玩盛鑫——《火山图》中的“一亿细节”。你会建造它吗?

◆盛鑫分析:【导读】详细讲解细胞图景的stringAPP蛋白相互作用分析

◆置信度分析:【教程】组学研究,用python快速实现PCA分析和绘图。

◆信息生成分析:组学研究,R语言实用技巧——热图,用pheatmap包简单易懂的快速作图法~

◆生辰信解析:【情人节】R语的浪漫邂逅——小提琴图片

结束

文章来自明路生物。

点击“阅读原文”了解更多。

 
友情链接
鄂ICP备19019357号-22