ESC
AI 1 分钟阅读

Excel AI 辅助工作流横评:数据分析高手还是照葫芦画瓢?

少数派作者对Excel AI辅助工作流进行横评,用统一测试数据集对比Claude、ChatGPT、Gemini、DeepSeek、Kimi等主流AI产品在数据清洗、公式编写、成品交付三类场景的表现,并考察硬编码情况、无损原则与实际交互次数。结果显示,能零干预完成数据清洗的模型很少,多数AI在遇到重名、缺失等数据歧义时擅作主张,Workbuddy甚至凭空编造匹配值。作者建议在提示词中明确要求有歧义需

来源:少数派

与嵌入 Excel 内部的插件不同,独立工作台(如 Codex 等)采用「文件+提示词一同提交」的端到端交互形式,在独立应用内完成分析并生成最终文件。

我根据我之前的文章《常用 Excel「奇技淫巧」,助你在新的一年处理数据事半功倍,「马到成功」》中所提到的大部分场景,编制了全新的测试用数据集,具体如下表所示。

所有的测试用例及题目所用到的提示词,可以在我的 Notion 页面找到。如果你有自己偏好的模型和载体,也非常欢迎下载本文提供的测试用例和提示词自行测试,看在你的实际工作流中,不同模型和载体的组合能不能复现这篇文章的结果。

其中,在相同的环境下,用所有软件最新的正式版测试。每轮测试均在全新的独立 Excel 文件中执行,文件统一按「题号-三位随机编号」命名。

硬编码情况用于评估 AI 输出的是 Excel 原生动态公式,还是通过 Python 在后台计算完成后直接向单元格写入静态数据(也就是硬编码)。这里会影响表格后续的维护成本。

无损原则则考察 AI 在提示词未明确要求的前提下,是否擅自改动、覆盖或破坏了原始表格中的数据与版式结构。

在这次测试中,我们还会记录任务从发起到交付所需的实际交互次数,当然理想状态是一次就交付。如果执行中出现中断卡死、格式错漏需要人工纠错或催促,则需要额外的交互,我也会记录具体的原因。

我平时用 AI 帮我处理 Excel 表格的场景,不外乎用来:数据清洗、高频重复公式编写以及成品交付。针对这三类场景,我分别设计了难度递进的测试,并在实测中发现了一些非常有意思的现象。

在我的工作中,最耗费精力的就是数据清洗。因为不管是分类汇总、还是分析统计,都需要有可靠、统一的数据。那面对这些繁琐琐碎的脏活累活,AI 的实际表现又如何呢?

大模型从原理来看很擅长处理这类任务,能识别「表述不同但含义相同」的模糊数据;且在正则表达式或 Python 的帮助下,也能批量地处理文本。但不同的 AI 实际表现也不同。例如,在「按姓名匹配员工信息」(测试 A09)这个题目中,姓名存在重名,同时还有两个姓名是找不到的,AI 处理的方式各不相同。

表现最好的是 Claude Cowork,它会主动停下来问我重名员工应该如何处理,并提供了几个选项:备注、只匹配第一个,或者是两个都写上。

ChatGPT for Excel、Claude for Excel、DeepSeek(Pi for Excel) 虽然都在对话里提到了重名,却已经擅自替我做了决定,使用了 XLOOKUP 默认匹配第一个值的情况;Kimi-K3(Pi for Excel) 更进一步,直接在单元格里加了注释。

而 Claude(Pi for Excel)和 Gemini(Pi for Excel)则没有提到重名的情况,直接 XLOOKUP 默认匹配第一个值。

最离谱的是 Workbuddy,对于两个找不到的名字,直接凭空硬凑了两个最像的名字填进去。

面对数据冲突、重复项或匹配缺失等异常情况,在提示词未明确指定清洗与补全规则的前提下,绝大多数产品都选择了「擅作主张」2,出乎了我的意料。

在我看来,任务场景越复杂,「主动向用户提问确认」 就越关键。测试里,AI 翻车也大多数是因为要求模糊,或者数据存在歧义。目前,解决这个问题最好的办法就是,告诉 AI:有歧义要提问。

后续,「图书销售数据分析任务」(测试 A11)复杂程度更高3,在数据清理的基础上,还要分析。我也在提示词中规定了有歧义要提问:

这是某小型连锁书店2025年销售订单记录。现在需要完成以下任务,需要保证可读性。如有任何模糊不清的地方,停下来问我:

不过,即使明确告诉 AI 要「停下来问我」,也并非所有 AI 都会严格执行这一指令。数据错误的类型一多,即使是火眼金睛的 AI 也很难一次就扫到全部的数据问题。

从最终实测结果来看,能够零干预、一次性彻底完成数据清洗的模型很少。不是没能统一同义词、异构字段,就是不能准确理解文本型数字。

我认为,不能准确理解文本型数字,很多时候因为习惯将其转化为 CSV 格式并直接通过 pandas 读取,pandas 的自动类型推断机制把文本型数字悄悄「洗白」了。

一旦 AI 后续尝试用 Excel 内置函数或数据透视表生成结果,Excel 引擎却依然会将这些原始单元格视为文本并排除在计算之外,最终导致 Python 算出的结果与 Excel 原生汇总对不上。

不难发现在清洗数据任务上,我们一定要小心 AI 擅作主张的黑盒决策。而且这些黑盒决策,也容易让我们找不到真正的问题。所以,我们一定要在编写提示词时,更加周密严谨。

测试用例中,「图书销售透视汇总」(测试 A10)和「图书销售数据分析交付」(测试 A11)两个任务在提示词中明确需要创建「数据透视表」,并对透视表字段操作。要做数据透视表的前提就是数据足够规整。

所以,这个测试除了能检测 AI 能不能清洗数据,也能测试 AI 分析数据和操作数据透视表的能力。

最终结果如下,在这两个任务的 22 个输出文件中,16 个(73%)都创建了数据透视表,且 14 个引用了正确的数据源区域,但只有 **6 个(27%)**的计算结果是正确的。

另外,对数据透视表的排序也是难倒一大片 AI。Kimi K3(Pi for Excel)为了给数据透视表排序,硬生生思考到了载体最大限制好几次。最终没有在数据透视表中实现「按照销售额从高到低排序」。

深度思考能显著提升推理能力、减少幻觉。因此在测试中,我给予了模型充分的思考空间,统一将思考强度设定为「高」档。但思考深度并非越高越好,当思考链路过深、耗时过长时,我发现模型更容易陷入自我怀疑与反复推演的过程里。

如上图所示,随着任务难度层级的攀升,模型的运行耗时明显变长。特别是,在长流程复杂任务(A08、A10、A11 及 Q11)的 45 次实测中,需要人工介入干预的比例高达 51%;而相比之下,A01 到 A07 等短流程基础题目的人工干预率仅有 12%。

我也简单分析了下模型为什么运行时间会变长。最主要的就是模型会因为小问题过度思考。比如:Kimi K3(搭载 Pi for Excel)在执行 A10(图书销售透视汇总)任务时,反复纠结于如何使用 Office.js API,在超过 25 分钟后选择放弃使用数据透视表对数据排序。类似的,在人工提示分类计算有误后,DeepSeek v4 Flash 在思考 10 分钟后,才意识到「数据类型不匹配」。

其次,模型卡住了。比如:Claude Cowork 在执行「考核成绩信息表及分析交付」(测试 A08)任务时,因为之前的 LibreOffice 文件残留,卡住了 10 分钟。Workbuddy(使用 Hy3 模型)执行 A10 任务时跑了 40 分钟还没有解决问题,且没有任何后续输出。

最后则是载体本身的限制。Pi for Excel 对单次推理设置了 4096 个词元的思考长度上限,所以一旦模型单次思考过长,就会被 Pi for Excel 截断,只能依靠我的提示继续。