从零开始写Python爬虫,四大工具你值得拥有!

如果你正在学习编程,从零虫那么“爬虫”绝对是开始你不可忽视的。那么,工具学习python爬虫之前需要哪些准备?从零虫

一颗热爱学习,不屈不挠的开始心

一台有键盘的电脑(什么系统都行。我用的工具os x,所以例子会以这个为准)

html相关的从零虫一些知识。不需要精通,开始能懂一点就行

Python的工具基础语法知识 。

当这些你都具备了,从零虫这个时候你需要学习:

0.基本的开始爬虫工作原理

1.基本的http抓取工具:scrapy

2.Bloom Filter: Bloom Filters by Example

3.如果需要大规模网页抓取,你需要学习分布式爬虫的工具概念。简单来说,从零虫你只要学会怎样维护一个所有集群机器能够有效分享的高防服务器开始分布式队列就好。最简单的工具实现是python-rq: https://github.com/nvie/rq

4.rq和Scrapy的结合:darkrho/scrapy-redis · GitHub

5.后续处理:网页析取(grangier/python-goose · GitHub),存储(Mongodb)

python的火,很大原因就是各种好用的模块,这些模块是居家旅行爬网站常备的——

*** F12 开发者工具

看源代码:快速定位元素

分析xpath:1、此处建议谷歌系浏览器,可以在源码界面直接右键看

NO.2 抓包工具

推荐httpfox,火狐浏览器下的插件,比谷歌火狐系自带的F12工具都要好,可以方便查看网站收包发包的信息

NO.3 XPATH CHECKER (火狐插件)

非常不错的xpath测试工具,不过也有几个小缺点,:

xpath checker生成的是源码下载绝对路径,遇到一些动态生成的图标(常见的有列表翻页按钮等),飘忽不定的绝对路径很有可能造成错误,所以这里建议在真正分析的时候,只是作为参考

记得把如下图xpath框里的“x:”去掉,貌似这个是早期版本xpath的语法,目前已经和一些模块不兼容(比如scrapy),还是删去避免报错。

NO.4 正则表达测试工具

在线正则表达式测试 ,拿来多练练手,也辅助分析!里面有很多现成的正则表达式可以用,也可以进行参考!亿华云计算 

系统运维
上一篇:4、企业无形资产:通用网站已成为企业网络知识产权的重要组成部分,属于企业的无形资产,也有助于提升企业的品牌形象和技术领先形象。它是企业品牌资产不可或缺的一部分。
下一篇:域名资源有限,好域名更是有限,但机会随时都有,这取决于我们能否抓住机会。一般观点认为,国内域名注册太深,建议优先考虑外国注册人。外国注册人相对诚实,但价格差别很大,从几美元到几十美元不等。域名投资者应抓住机遇,尽早注册国外域名。