今天看了一本书的介绍《python网络爬虫实战》,里面介绍了四种框架(or模块),我做了小结如下:
对selenium,主要适用里面的selenium.Webdriver模块,它支持多种浏览器,比如chrome,i.e.,firefox,opera等,但是如果不用界面,则使用plantomjs,plantomjs是没有界面的,速度比chrome快,根据介绍,它用于页面自动化、网络监测、网页截屏、以及×××面测试等,所以在服务器模式下,没有界面,用plantomjs是最好的选择。现在plantomjs有mac版本的,可以去网站下载。记得用迅雷下载。下载好了,直接解压,将里面bin目录下的文件 : cp phantomjs /usr/local/bin/ 。 就可以在python使用了,只要import selenium就可以使用。使用selenium非常简单,基本上就是将你如何操作浏览器浏览网页的步骤代码化。