pandas是用于数据分析的开源Python库,可以实现数据加载,清洗,转换,统计处理,可视化等功能。
pandas最基本的两种数据结构:
1)DataFrame
2)Series
csv 和 tsv 文件都是存储一个二维表数据的文件类型。
注意:其中csv文件每一列的列元素之间以逗号进行分割,tsv文件每一行的列元素之间以\t进行分割。
1)首先打开jupyter notebook,进入自己准备编写代码目录下方,创建01-pandas快速入门.ipynb
文件:
注意:提前将提供的 data 数据集目录放置到 01-pandas快速入门.ipynb 同级目录下,后续课程会加载 data 目录下的数据集。
2)导入 pandas 包
注意:pandas 并不是 Python 标准库,所以先导入pandas
# 在 ipynb 文件中导入 pandas
import pandas as pd
3)加载 csv 文件数据集
tips = pd.read_csv('./data/tips.csv')
tips
4)加载 tsv 文件数据集
# sep参数指定tsv文件的列元素分隔符为\t,默认sep参数是,
china = pd.read_csv('./data/china.tsv', sep='\t')
china