RWRui Wang / Ideas
← All notes

Learn

Advanced NumPy and Basic Pandas

Advanced NumPy and Basic Pandas cover
上一期,我们学习了基础的NumPy使用和Array的创建,这期我们来学习更加深入的NumPy技巧和给Pandas开个头


记得上期我提到了获取数据的几种方法吗,这期我们就以导入Csv Files开头。


在Colab新开一个Code Cell


import pandas as pd

file = pd.read_csv('/content/files/test')   #这里绿色单引号中间填文件的directory


这样,我们就成功的导入了一个csv文件。Pandas导入的Csv文件在Colab的terminal中大概长这样:

注意这里有个小tips,在Colab里面,大部分文件,variables,array都是可以不需要print()的,像这样:


file

左边按钮运行这个cell,就会有如下图一般打印出来的结果:

Screenshot 2026-08-04 at 14.00.24

(注意这张图只截取了部分)


这里再教大家一个不需要外挂Drive也能导入文件的办法:


这里就不解释了,抄答案即可:

from pathlib import path
import pandas as pd

path = Path("folder") / "subfolder" / "file.txt"

file = pd.read_csv('path')

这样可以通过Pandas读取一个csv文件,而且不需要依赖Google Drive和Colab的联动。


上期讲解了Numpy的Array,那么Pandas作为他的上位替代,也拥有一个类似的数据存储,就是Pandas DataFrame,简称df。在Numpy Array的基础上,增快了运算速度,而且更加好用。


import pandas as pd

files = pd.read_csv('/content/ml-ds/test')

df = pd.DataFrame(files)


这样,一个简单的DF就已经被建立了。


接下来,我们来看一些基础的Pandas DF的基础用


import pandas as pd

files = pd.read_csv('/content/ml-ds/test')

df = pd.DataFrame(files)

查看前五行:
df.head()

查看最后五行:
df.tail()

查看某一行的某个特定的column:
df.loc[0,"sepal_length"]
格式:dataframe name.loc[row number, "column name"]

查看所有row里面的某一个column:
df.loc[: , "sepal_length"]

查看某一个范围的row/column内的内容:
df.loc[1:3, "sepal_length":"petal_length"]

iloc和loc在功能上并没有显著区别,只是iloc对于从于column的检索不依赖column index name,而是column index number,例如:

df.iloc[0:2, 6:8]


这些是一些较为不常用的用法,现在来介绍一些常用的:


import pandas as pd

files = pd.read_csv('/content/ml-ds/test')

df = pd.DataFrame(files)

查看某一个index name的所有row:
df["proximity"]

筛选某一条件:
df["proximity"] == "island"

双/多条件筛选:

df[df["ocean_proximity"] == "island"].sort_values("median_income", ascending=False).head(10)