记得上期我提到了获取数据的几种方法吗,这期我们就以导入Csv Files开头。
在Colab新开一个Code Cell
import pandas as pd
file = pd.read_csv('/content/files/test') #这里绿色单引号中间填文件的directory这样,我们就成功的导入了一个csv文件。Pandas导入的Csv文件在Colab的terminal中大概长这样:
注意这里有个小tips,在Colab里面,大部分文件,variables,array都是可以不需要print()的,像这样:
file左边按钮运行这个cell,就会有如下图一般打印出来的结果:
(注意这张图只截取了部分)
这里再教大家一个不需要外挂Drive也能导入文件的办法:
这里就不解释了,抄答案即可:
from pathlib import path
import pandas as pd
path = Path("folder") / "subfolder" / "file.txt"
file = pd.read_csv('path')
这样可以通过Pandas读取一个csv文件,而且不需要依赖Google Drive和Colab的联动。
上期讲解了Numpy的Array,那么Pandas作为他的上位替代,也拥有一个类似的数据存储,就是Pandas DataFrame,简称df。在Numpy Array的基础上,增快了运算速度,而且更加好用。
import pandas as pd
files = pd.read_csv('/content/ml-ds/test')
df = pd.DataFrame(files)
这样,一个简单的DF就已经被建立了。
接下来,我们来看一些基础的Pandas DF的基础用
import pandas as pd
files = pd.read_csv('/content/ml-ds/test')
df = pd.DataFrame(files)
查看前五行:
df.head()
查看最后五行:
df.tail()
查看某一行的某个特定的column:
df.loc[0,"sepal_length"]
格式:dataframe name.loc[row number, "column name"]
查看所有row里面的某一个column:
df.loc[: , "sepal_length"]
查看某一个范围的row/column内的内容:
df.loc[1:3, "sepal_length":"petal_length"]
iloc和loc在功能上并没有显著区别,只是iloc对于从于column的检索不依赖column index name,而是column index number,例如:
df.iloc[0:2, 6:8]
这些是一些较为不常用的用法,现在来介绍一些常用的:
import pandas as pd
files = pd.read_csv('/content/ml-ds/test')
df = pd.DataFrame(files)
查看某一个index name的所有row:
df["proximity"]
筛选某一条件:
df["proximity"] == "island"
双/多条件筛选:
df[df["ocean_proximity"] == "island"].sort_values("median_income", ascending=False).head(10)