前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >【学习】通过简单的Excel分析网站日志数据

【学习】通过简单的Excel分析网站日志数据

作者头像
小莹莹
发布2018-04-18 16:28:30
2K0
发布2018-04-18 16:28:30
举报

昨天在一个QQ交流群里看到有一个新手发问,如何去简单的分析网站日志,清楚知道网站的一个数据抓取情况,哪些目录抓取较好,有哪些IP段蜘蛛抓取等。

一个网站要发展的更快,走的更远,它离不开日常的一个数据分析,就如携程旅行网页搜索营销部孙波在《首届百度站长交流会》上所言,其利用数据模型对频道改版后,网页索引量从原来的十几万,上升到今年的500多万的索引量。由此可见,数据分析的重要性。

说到每日的网站日志分析,在这里强调下,我需要用到两个工具:Excel和光年日志分析工具。可能也有朋友在对网站的日志分析时,需要另外用到一个工具Web Log Explorer。

其实在网站日志分析中,最需要用到的工具就是Excel(07版Excel或10版Excel),在这里,简单跟大家交流一下我的一点经验。

网站体抓取情况统计:

借助光年日志分析工具,获取各个搜索引擎的蜘蛛总抓取量、蜘蛛总停留时间、蜘蛛来访次数(本人由于只做百度优化,就说说百度蜘蛛抓取情况),如下图1:

把这上面的数据做成Excel即可,如下图2:

平均停留时间=总停留时间/访问次数, 计算公式:=C2/B2 enter键

平均抓取量=总抓取量/访问次数, 计算公式:=D2/B2 enter键

单页面抓取时间==停留时间*3600/总抓取量 计算公式:=D2/C2 enter键

蜘蛛状态码统计:

借助Excel表格,打开日志(最直接的办法,就是它日志拖到Excel表格里),然后再统计蜘蛛状态码,如下图3:

通过Excel表格下的“数据”功能下的筛选,下面就可以对蜘蛛状态码进行统计了,具体的统计操作如下图4:

点击IP段下拉框,找到文本筛选,选择自定义筛选。

通过图3,可以看出,蜘蛛抓取的状态码200特征是HTTP/1.1" 200,以此类推:状态码500是HTTP/1.1" 500、状态码404是HTTP/1.1" 404、状态码302是HTTP/1.1" 302…..下面就可以筛选出各个蜘蛛状态码,如下图:

如上图5,选择包含关系,即可以统计出百度蜘蛛200状态码的抓取量,其他以此类推。

蜘蛛IP段统计:

如上图,把状态码换成IP段就可以,如:HTTP/1.1" 200换成202.108.251.33

目录抓取统计:

如上图,把状态码换成相应目录名就可以,如:HTTP/1.1" 200换成/tagssearchList/

总结一下:

如何通过简单的Excel分析网站日志数据,就介绍到这里。不知道身为seo的你平常有没有分析网站日志呢。反正我平常都分析这个东东的。自认对网站的日志进行分析是很有必要的。至于分析的这些数据,有什么作用,如何通过这些数据查到网站的不足之处,然后列出调整方案,有步骤的去调整网站的结构,相信有很多人已经写过了,我在这里,就不再多说了。

本文参与 腾讯云自媒体分享计划,分享自微信公众号。
原始发表:2014-04-15,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 PPV课数据科学社区 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体分享计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 网站体抓取情况统计:
  • 蜘蛛状态码统计:
  • 蜘蛛IP段统计:
  • 目录抓取统计:
  • 总结一下:
相关产品与服务
Elasticsearch Service
腾讯云 Elasticsearch Service(ES)是云端全托管海量数据检索分析服务,拥有高性能自研内核,集成X-Pack。ES 支持通过自治索引、存算分离、集群巡检等特性轻松管理集群,也支持免运维、自动弹性、按需使用的 Serverless 模式。使用 ES 您可以高效构建信息检索、日志分析、运维监控等服务,它独特的向量检索还可助您构建基于语义、图像的AI深度应用。
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档