replace(np.inf)常不生效是因为整数列禁止存储np.nan,需先转float64或用mask;fillna对inf无效,正确顺序是先replace再fillna,mask最快且自动适配类型。
replace(
) 为什么经常不生效?
直接写
很可能没反应——特别是当列是整数类型时。Pandas 对整数列禁止存
(因为
是浮点概念),所以替换会静默失败,或抛出
。这不是 bug,是类型系统在拦你。
实操建议:
先检查数据类型:
,重点关注含
的列是否为
或
若需保留数值语义且后续要计算,优先把整数列转成
:
再执行替换:
(注意同时处理负无穷)
用
临时放宽类型限制?
不行。Pandas 没有“临时允许 int 列存 nan”的上下文选项。
这个配置只影响
读取阶段
(比如
),对已有 DataFrame 的
无作用。
真正有效的替代方案:
立即学习
“
Python免费学习笔记(深入)
”;
改用
:它自动适配列类型,对整数列会隐式转为
(nullable integer dtype),保留
或显式指定 nullable 类型:
如果只是临时清洗、后续立刻转 float,用
更安全
为什么
和
不能混用处理 inf?
只识别
和
,完全忽略
。写
对
值零影响。这是常见误解点。
Python 3.14.3
微软官方的 Python 扩展,是 VS Code 安装量最高的扩展(209M+)。集成 IntelliSense(通过 Pylance)、调试(通过 Python Debugger)、代码检查、格式化、重构和单元测试等功能。支持 Jupyter Notebook、虚拟环境管理和多 Python 版本切换。
下载
正确组合方式(按顺序):
先清理无穷:
再填缺失:
或
注意:
默认不修改原 DataFrame,记得加
或重新赋值
性能差异:mask vs replace vs apply
三者都能实现,但速度差一到两个数量级:
最快,向量化,底层用 C 实现
次之,也向量化,但匹配逻辑稍重
(已弃用)或
+
最慢,纯 Python 循环,大数据量卡顿明显
实际项目里,只要列不是极宽(>1000 列),优先选
;需要兼容老 Pandas 版本(replace。
最易被忽略的点:替换后务必检查
,别只信“没报错”就以为清干净了——某些混合类型列里,
可能藏在 object 列的字符串里(比如
),那得用
单独捞。
np.infdf.replace(np.inf, np.nan)np.nannanValueError: Cannot convert non-finite values (NA or inf) to integerdf.dtypesinfint64uint*float64df[col] = df[col].astype(float)df.replace([np.inf, -np.inf], np.nan, inplace=True)pd.option_contextpd.options.mode.use_inf_as_na = Truepd.read_csvreplacedf = df.mask(np.isinf(df))Int64pd.NAdf[col] = df[col].astype("Int64").replace([np.inf, -np.inf], pd.NA)df.select_dtypes(include='number').replace([np.inf, -np.inf], np.nan)fillnareplacefillnaNaNNonenp.infdf.fillna(np.nan)infdf.replace([np.inf, -np.inf], np.nan)df.fillna(0)df.fillna(df.mean(numeric_only=True))fillnainplace=Truedf.mask(np.isinf(df))df.replace([np.inf, -np.inf], np.nan)df.applymap(lambda x: np.nan if np.isinf(x) else x)applynp.wheremaskdf.isin([np.inf, -np.inf]).any().any()inf"inf"str.replace