Python Pandas 核心用法实战指南
Pandas 是基于 Python 构建的开源数据分析库,提供了强大的数据结构和运算功能。在数据处理领域,它几乎是事实上的标准工具。
Pandas 的核心数据结构主要有两个:
- Series:一维数组,类似 Numpy 的一维 array,但带有索引标签,可存储字符串、布尔值、数字等多种类型。
- DataFrame:二维表格型结构,类似 SQL 表或 Excel 工作表。每列可以是不同的数据类型,拥有列名和行索引。这是 Pandas 最核心的数据结构,支持丰富的操作方法。
环境准备
使用前需导入 Pandas 库,通常约定简写为 pd:
import pandas as pd
Series 数据结构详解
创建与基础属性
Series 从索引 0 开始存储数据。我们可以通过 index 查看下标(标签),通过 values 获取具体的数值。
s = pd.Series([1, 2, 3])
print(s.index) # 输出类似 range(0, 3)
print(s.values) # 直接查看下标的值
注意区分下标和标签。默认情况下,下标是整数索引,而标签是我们自定义的键。如果修改了标签,直接使用下标访问可能会报错,这时需要用到 iloc 和 loc。
loc 与 iloc 的区别
- iloc:基于位置(整数下标),计算机默认的内存记忆。
- loc:基于标签(我们自定义的键),由用户自主指定。
例如,若将索引标签设为 5,则下标 0 对应的值可能不再是 0,而是对应标签 5 的值。理解这一点对于后续的数据筛选至关重要。
数据操作
修改数据:使用 loc 可以通过标签定位并修改值。
s.loc['小张'] = 95
筛选数据:结合逻辑运算符进行条件判断。
# & 代表 and,用于组合多个条件
result = s[(s > 80) & (s < 100)]
算术运算:支持加、减、乘、除等操作。当两个 Series 相加时,若索引不匹配,结果会出现 NaN。可以使用 add 方法配合 fill_value 参数处理缺失值。
# 对齐索引后相加,缺失处填 0
res = s1.add(s2, fill_value=)


