一张销售表一秒就能算完,不代表工作没有成本。分析师还得记住:列名何时写成字符串,新增列为何要配合 assign 和 lambda,分组键会不会变成索引。Neal Hughes 指出,这些与分析问题无关、却持续占用注意力的细节,构成了 pandas 的“认知负担”。机器闲着,人却没有。
文章用“筛选正销售额、计算利润、按地区汇总并排序”这个普通任务说明问题:同一段链式操作里,列可能有三种写法;命名聚合要记住元组顺序;降序则写成 ascending=False。每条规则都不难,但叠在一起,就会挤占分析数据本身所需的注意力。
这也是性能基准容易漏掉的迁移成本。即使数据不大、运行不慢,从 pandas 转向 Polars 或 DuckDB,仍要重建 DataFrame API——筛选、连接、分组等操作规则——以及对结果的心智模型。AI 可以代写代码,却不能免去阅读、核对和理解;对不断“看结果、改问题”的探索式分析尤其如此。