前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >Python学习十大公开免费数据集介绍

Python学习十大公开免费数据集介绍

作者头像
行哥玩Python
发布2020-07-14 17:05:45
1.5K0
发布2020-07-14 17:05:45
举报
文章被收录于专栏:一行数据一行数据

很多行友说,想做项目学习和练手没有数据怎么办。又想给行哥投稿赚钱,没有数据拿头分析啊。先别急,这里行哥给大家推荐一些数据来源,足够你去好好分析数据,这些数据用来学习和找工作都不是问题

  • 1.公司学校
  • 2.爬虫
  • 3.白嫖

1.公司学校

对于公司和学校内部的数据,一般都是比较机密,但是你想主动去帮助他们处理,问老师或老大要些数据来练习,他们还是很愿意的(毕竟多了一个人肉数据清洗机)。

即帮助了老师们的工作,又学到了技术,一举两得的事情我是最喜欢的

2.爬虫

任何数据,只要你在网上能用肉眼看到,理论上都是可以爬取下来的,小到使用爬取个百度图片,大到把一个网站数据库连锅端了完全了没有问题。所以自己做项目分析来练手的数据(除非是得自己生产),都可以用爬虫的方式进行爬取

但是理论归理论,理想很丰满,实际上只能动手复制粘贴

3.白嫖

爬虫不如白嫖,网上的数据源特别多,但是也特别分散或者还收费(例如某觉中国),所以行哥这里给大家精选十大数据网站,让你白嫖到装满电脑为止

  • 3.1 Kaggle数据集:https://www.kesci.com/home/dataset 这是一个集竞赛、数据和学习为一体的网站,之前烂大街的泰坦尼克号数据分析就是这个网站提供的数据源头。当然也有各种算法竞赛,拿钱学习两不误
  • 3.2 阿里云天池数据集 https://tianchi.aliyun.com/ 如果英语不好的话,可以使用国内的阿里云天池数据集。这里不仅提供公共数据集,还有免费系统的AI课程可以学,还用你再找那些七零八落的课程资料吗
  • 3.3 股票数据:http://tushare.waditu.com/ 想学量化交易的同学肯定不能错过这个网站,之前行哥交流群里的同学@Jason在问有没有那种运行代码就能赚钱的技术,你看这个量化领域就是(不过技术不精可能最后裤衩都了)
  • 3.4 谷歌开源数据集:https://datasetsearch.research.google.com/ 想找官方数据的话得一个个去统计局找,也可以来这个谷歌开源数据集来。比如中国历年平均工资的分布,平均年工资为90501 元,快看看你有没有拖后腿
  • 3.5 微软数据集:https://msropendata.com/datasets?domain=PHYSICS 微软数据集提供了生物,计算机科学,地球科学,健康护理,数学,物理,社会科学等,想找一些偏僻的数据可以来这里找找
  • 3.6 Github网站:

https://github.com/awesomedata/awesome-public-datasets 整个Github有很多项目大家可以学习,但是上面这个网址整理很多awesome的数据集,一共有32个类别。看完足够你awesome

  • 3.7 计算机视觉数据集:https://www.visualdata.io/discovery 昨天还有小老弟跟行哥唠,说那么多图像怎么一个个标注啊,那不得标成傻子了。这不,今天它来了,直接提供标注好的图像数据,图像识别还不赶紧学起
  • 3.8 卫星数据集:google earth 卫星数据动辄几个G,上百个G。总不能一台电脑全保存上卫星数据,就算保存上了,随便调用运算,家用电脑估计就够呛了。所以这个谷歌地球引擎直接提供平台,可以在这个平台里随意调用上百G卫星数据,并在谷歌提供的服务器里运算,这样上手不就更快了
  • 3.9 数据世界 https://data.world/ 这个网站号称数据界的github,GitHub分享的是代码项目,这里分享的便是纯数据了,想进入数据社区可以来这个网站看看哦
本文参与 腾讯云自媒体分享计划,分享自微信公众号。
原始发表:2020-06-08,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 一行数据 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体分享计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 1.公司学校
  • 2.爬虫
  • 3.白嫖
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档