IProx中国是一个综合性的蛋白质组资源中心,旨在加速蛋白质组学领域的全球数据共享。IProx网站存储了科研院所开源蛋白质组的原始数据,有需要的师生可以直接从网站下载。
找到原始数据后,只需选中某一条数据,点击右上角的“http”即可开始下载。但是有时候数据量很大,多达几百条,是不是要一条一条查,一条一条点下载?当然,边肖今天会教你如何用python自动下载这些数据。

下载蟒蛇
Anaconda是python的一个发布版本,与python2.7和python3.6类似,只是包含了很多科学计算的库,使用起来很方便。
搜索Anaconda进入官网,点击个人版进入下载页面。然后按照电脑系统下载。
打开jupyter笔记本
Juter Notebook是python的一个编辑器,通俗点说就是写代码的地方。与pycharm相比,最大的优点是可以写一行代码运行一次,并保留运行结果。但是,pycharm只能通过单击run来同时运行所有代码。总的来说,Jupyter笔记本还是比较灵活的,适合快速开发。
首先,找到Anaconda的安装路径。一般jupyter笔记本的安装路径在AnacondaAnacondascripts下。双击jupyter-notebook.exe来运行它。
运行后会弹出一个命令框,然后弹出一个网页。点击右上角的python3新建一个页面,在这个页面下开始编辑代码。
下载并导入相应的库。
在cell中输入下面的代码,单击Run,selenium和lxml库将被自动下载。
!皮普装硒!pip安装lmxl
输入以下代码,然后单击Run导入将在库中使用的模块。
从selenium导入webdriverimport时间
用selenium simulation打开一个网页
输入下面的代码,selenium会自动打开你想要下载的原始数据的页面。
URL = ' http://www . iprox . org//page/subproject . html id = IPX 0001400012 ' driver = web driver。Chromedriver.get
注意:url的值可以替换为您要下载数据的页面的URL。在这一步,很多朋友可能会遇到一个错误:
消息:“chromedriver”可执行文件需要位于路径中。请看https://sites.google.com/a/chromium.org/chromedriver/home
这是因为chrom浏览器没有安装web驱动程序。只需安装chrom浏览器当前版本对应的Chrom驱动即可。详细操作步骤请查看本网站。
如果用selenium打开网页后出现如下界面,需要根据提示一步一步安装插件。安装完成后,您可以在iProx网站上下载数据。另外,你可以在顶部看到一行小字:Chrom正在被自动测试软件控制,也就是说我们在用selenium控制软件,接下来写的代码会直接影响这个网页。
点击并下载selenium模拟
直接运行下面一行代码,原始数据前面的小方框就被选中了。下图中的一串红队是用来定位原始数据前面的小方框的。点击就是点击的意思。
driver . find _ element _ by _ XPath . click
向右滑动查看更多内容
如何使用这串代码进行定位?也很简单。打开下载页面,按F12,打开控制台,点击右上角的鼠标箭头。
然后点击原始数据前面的小方框,右边会给出这个小方框的网页代码。
把鼠标放在这行代码上,右键-复制-复制XPath,就可以复制上面红队的字符串了。
点击查看是第一步,点击下载是第二步。
同理,我们可以定位“http”,复制它的xpath语法,运行下面的代码,然后点击下载。这里注意:先设置chrom浏览器的默认保存路径,然后设置下载不用问,直接点击下载即可。
driver . find _ element _ by _ XPath . click
怎么样?是自动下载吗?这里下载的数据只有一个,当然是不够的。我们要下载100个数据!

下载批量数据
具体想法是这样的:
1.选择要下载的原始数据;
2.点击下载;
3.取消以前的选择;
4.等待10秒钟;
然后重复这4个步骤。至于为什么要等10秒,我怕下载太快会卡。
这里还需要注意的是,在selenium打开的页面中,我们手动将每页显示的数据数量从5更改为“全部”
然后我们用一个for循环实现批量下载。范围是指从第1个下载到第100个。如果想从20号到50号下载,可以改成range。点击运行,就可以休息了。selenium会自动点击页面下载。
怎么样?方便吗_
大家快行动起来,举一反三,解决工作中复杂耗时的重复性工作!!
估计你还想看吧?
◆盛鑫课程:这个分析不是太难系列——方差分析
◆盛鑫课程:一行代码,轻松绘制动态关系网络图。
◆盛鑫课程:这个R包不太冷系列三:一个“简单代码+简单调整=马上画图”的包
◆盛鑫课程:我该怎么救你!我的论文!我的实验数据!
◆信息分析——文档管理神器:经常被文档整理破坏?试试这个文档管理神器,让你的效率最大化。
◆盛鑫分析-数据库获取:如何从主流数据库中快速获取人/鼠数据?
◆信息分析-可视化处理工具:你可以更美:SnapGene Viewer软件的序列可视化操作
◆云平台:奥利可以做~ ~代谢途径的富集分析?
◆云平台:震惊!他花了3分钟完成了我三周的工作!
◆云平台:欧亿/陆明云|你不试试免费的聚类热图吗?
◆盛鑫分析:这个R包不太冷系列——go plot
◆盛鑫分析:10行代码让你的关联图变漂亮。
◆盛鑫解析:对话一幅百年名画——文章画稿配色高级简约!
◆盛鑫分析:只需3分钟即可获得“代谢途径分析神器”
◆盛鑫分析:玩盛鑫——《火山图》中的“一亿细节”。你会建造它吗?
◆盛鑫分析:【导读】详细讲解细胞图景的stringAPP蛋白相互作用分析
◆置信度分析:【教程】组学研究,用python快速实现PCA分析和绘图。

◆信息生成分析:组学研究,R语言实用技巧——热图,用pheatmap包简单易懂的快速作图法~
◆生辰信解析:【情人节】R语的浪漫邂逅——小提琴图片
结束
文章来自明路生物。
点击“阅读原文”了解更多。


