本文纯干货分享。对python感兴趣的可以认真看看!
一、爬行动物的基本概述

1.基本概念
爬虫;它是一个按照一定的规则自动捕获网络信息的程序或脚本。如果把互联网比作一张大蜘蛛网,电脑上的数据就是蜘蛛网上的猎物,而爬虫就是一只小蜘蛛,它们沿着蜘蛛网抓取自己想要的猎物/数据。
2.基本过程
3.爬行动物的核心技能
3.1请求库
请求库有:requests、selenium、urllib、aiohttp。个人建议新手小白掌握urllib和requests库。
3.2数据包捕获工具分析网络请求
抓取工具主要有chrome firefox fidder appium,其中fidder基本可以说是目前最全面最强大的工具。
3.3解析数据库
解析库有很多选项,比如CSS、pyqery、re、xpath等。建议掌握美汤和Xpath。
3.4保存数据

小规模数据可以用txt文件、json文件、csv文件等保存。
大规模数据需要使用mysql、mongodb、redis等数据库。,更便于查询管理。
第二,代码分解
首先,导入所需的库:
然后,定义每个国家的请求地址:
定义请求标题请求标题:
解析每个字段信息:
最后,保存Excel数据:
第三,同步视频演示
运行代码:
执行结果:

第四,数据可视化
可以将爬网数据导入到spsspro中,以进行进一步的数据可视化:
SPSSPRO会根据拖入的数据类型推荐合适的分析方法!
5.获取python源代码
各位朋友,本案完整python源代码已上传至社区动态第一篇。


