One self-hosted console to run your entire business — commerce, ERP, HRM, CRM & manufacturing

ERP 里的 AI 智能体:2026 年哪些事可以放心交给它,哪些不行

智能体不再只是回答问题,而是直接在业务系统里执行操作。用四级风险阶梯、五个稳妥的起步场景、厂商检查清单和 90 天试点计划,判断该把什么交给它。

Author

Anichur Rahaman

2 个月前12 min read3 views
ERP 里的 AI 智能体:2026 年哪些事可以放心交给它,哪些不行

设想一家十店零售企业的采购负责人,周一早上 8:40 走进办公室。周末,一个按厂商默认设置运行的 AI 智能体读到一份库存报告:同一种商品的一箱,在一张表里算 1 件,在另一张表里算 12 件。它因此生成了 14 张采购订单,每张的数量都是实际所需的 12 倍,第一张早上 6:15 就已经邮件发给了供应商。(这是虚构的示例场景,并非真实客户。)

同一个智能体如果换一种配置,这 14 张订单只会作为草稿排在队列里。什么都不会发出去,采购员一分钟就能看出数量不对,周一照常过。差别不在 AI 有多聪明,而在于智能体可以在没有人把关的情况下做多少事。

两年前,“ERP 里的 AI”指的是一个聊天框,能回答你关于数据的问题。到了 2026 年,软件厂商开始推销智能体(agent)。它不只是对话,还会查资料、做判断,并直接在你的业务系统里执行操作:生成采购订单、发送付款提醒,甚至修改价格。

这很有用,但也正是出错的代价从“尴尬”变成“花钱”的地方。聊天机器人答错了,你顶多浪费一分钟;智能体给供应商下错了单,浪费的是一托盘货。

本文给你一套实用的判断方法:在你的 ERP 里,AI 智能体今天可以自己做什么,只应该起草什么,又有哪些事暂时不要让它碰。文末附有评估厂商的检查清单,以及一份 30-60-90 天试点计划,下周就能启动。

本文是“运营中的 AI”三篇系列的第 1 篇。第 2 篇讲 MCP 如何让 AI 安全地连接业务数据:MCP explained。第 3 篇讲审批、审计留痕与人工把关的设计:AI guardrails。

从副驾驶到智能体:究竟变了什么

副驾驶(copilot)是你问它才答。它读取数据,用文字回复。就算答错了,你也能在事情发生前发现,因为总有人先看过答案。

智能体则会拿到一个目标、一组工具,以及使用这些工具的权限。用哪个工具、什么时候用,由它自己决定;用完看结果,再继续,直到目标达成。关键就在这些工具上:“创建订单草稿”“更新库存”“发送邮件”“办理退款”。

风险因此换了位置。副驾驶的风险是答错了;智能体的风险是做错了——而且可能飞快地、成规模地重复,往往没有人盯着每一步。

早期预测也印证了这一点。2025 年 6 月,Gartner 预测,到 2027 年底,超过 40% 的智能体 AI 项目会被取消,原因是成本攀升、业务价值不清晰以及风险控制不足(Gartner 新闻稿)。同一份新闻稿还提醒要警惕“agent washing”:厂商把普通聊天机器人和自动化重新包装成“智能体”。据 Gartner 估计,在号称具备智能体功能的数千家厂商中,真正名副其实的只有 130 家左右。

风险阶梯:智能体操作的四个层级

想保持安全,最简单的办法是别再问“AI 能不能做这件事”,而是问“万一它做错了会怎样”。按这个问法,智能体的操作可以排成四级阶梯,从无害一路到难以挽回。

AI 智能体操作的四级风险阶梯:回答问题、起草文档、可撤销的操作、动用资金或不可逆的变更,并标明每一级所需的人工控制程度
阶梯越往上,越需要由人牢牢掌握控制权。
层级智能体做什么ERP 中的例子2026 年适合放在哪里
1. 回答读取数据、解释、汇总“未来 10 天哪些 SKU 会断货?”可放心运行,只给只读权限
2. 起草准备好文档,由人审核采购订单草稿、商品描述、催款邮件安全,前提是人批准之前不发送、不入账
3. 可撤销的操作修改可以干净撤回的数据给订单打标签、预留库存、调整任务时间仅限范围窄、测试充分的场景,并有日志和撤销功能
4. 涉及资金或不可逆付款、退款、删除、对外发送向供应商付款、办理退款、删除记录目前每一次都由人来决定

这个阶梯有两点关键。第一,层级由操作决定,而不是由 AI 决定。“发送邮件”如果由人点击发送,是第 2 级;如果智能体自己发给你的客户,就是第 4 级。第二,智能体要先在下一级证明自己,并拿出数据说话,才应该允许它上一级。

按顺序回答三个问题,阶梯就变成一条分流规则:先命中的那个答案,决定任务的去向。

流程图:任务先问能否撤销(不能:留给人),再问是否动用资金或让外部人看到(是:起草,由人批准),再问数据是否干净且错误率已实测(否:先整理数据,停留在草稿;是:带日志和撤销功能自动化)
依次回答三个问题,任何任务都会被分流给人、草稿队列或自动化。

成长型企业的五个靠谱起步场景

最好的起点在第 1、2 级:真能省时间,人仍在流程之中,出错的代价也小。下面五个场景对中小企业尤其适用。

1. 库存和订单问答

“这款商品在所有门店合计还剩多少?”“昨天的订单哪些还没收到款?”这类问题,员工每周要花好几个小时在各个页面和导出表格里翻找。一个只读的智能体直接查询实时数据,就省掉了这番折腾。风险很低,因为它什么都改不了。

2. 采购订单草稿

智能体结合销售速度、当前库存和供应商交期,为每家供应商生成一份采购订单草稿。采购员核对数量、修改并批准。算数和录入交给智能体;判断和钱袋子仍在人手里。

3. 发票与采购订单对账

供应商发票到达后,智能体把它与采购订单和收货记录比对,标出差异:单价偏高、数量未收齐、发票重复。它负责提示,会计负责拍板。这就是经典的三单匹配,枯燥繁琐,正适合交给机器。

4. 逾期账款跟进

智能体列出客户的逾期发票,用客户的语言起草一封措辞得体的提醒,并根据逾期时长和你们合作的年头调整语气。由人阅读后发送。等草稿连续几周都原样通过,就可以放手让它自己发第一封温和的提醒。

5. 商品文案和翻译

几百个商品的标题、描述和 SEO 文案,手写又慢又累。智能体根据商品属性起草,编辑快速浏览后发布。凡是带法律效力的内容,比如成分表、尺码说明或质保条款,都要留给人来把关。

哪些事暂时不要自动化

有些操作因为重复性高而显得诱人。现阶段请交给人,或者只让智能体负责起草:

  • 向供应商付款或发放工资。钱一旦转出,很难追回。
  • 超过小额上限的退款和贷项通知单。这是最容易被精心编造的客户留言操纵的环节。
  • 全品类批量改价。一条错误的规则,一夜之间就能吃掉所有毛利。
  • 删除或合并记录:客户、商品、科目。
  • 向总账过账。出于审计要求,每一笔会计分录背后都应该有明确的责任人。
  • 任何对客户具有约束力的承诺,例如交付时间、合同条款或赔偿。

原因有据可查。OWASP 在其大语言模型应用 Top 10 中,把过度代理(excessive agency,即 AI 系统拥有超出任务所需的功能、权限或自主权)列为一项独立风险;2025 年 12 月,它又单独发布了智能体应用 Top 10,涵盖目标劫持、工具滥用和失控的智能体。客户的留言、供应商的邮件、上传的 PDF 里,都可能夹带针对智能体的指令。一旦智能体能动用资金,这些指令就会变得很危险。

先把数据质量和权限理顺

智能体的可靠程度,取决于它读到的数据和手握的权限。这两样,在启用之前改起来最容易。

干净的数据

库存数字不准,采购订单草稿也会不准,而且给得自信又客气。试点之前,先检查这些基础项:

  • 账面库存与货架实物相符,误差在你实测过的容忍范围内。
  • 每个商品都有唯一的 SKU、供应商、成本和交期。
  • 重复的客户和供应商已经合并。
  • 计量单位统一(一箱不能有时是一件,有时是十二件)。

收紧的权限

给智能体单独的账号,绝不要共用管理员登录。权限只给最小必要的:需要用到的模块给只读,只在它起草的地方给创建草稿的权限,其余一概不给。如果 ERP 无法把智能体与调用它的用户分开限权,就应视为严重缺陷。理想情况下,智能体应以提问者本人的权限行事,这样它能看到、能做的事永远不会比提问的人更多。

本系列第 3 篇会深入讲审批和审计留痕。眼下先记住这条原则:人没有权限做的事,他的智能体也不能做。

如何判断厂商所说的“AI 智能体”

在 agent washing 盛行的当下,一场惊艳的演示几乎说明不了什么。请问下面这些问题,并要求对方给出具体回答,而不是一页页幻灯片。

  1. 权限。能否按角色、模块和操作限制智能体?默认是否只读?
  2. 审计留痕。每个操作是否都有记录:谁提的要求、智能体看了什么、做了什么、何时做的?日志能导出吗?
  3. 可解释性。对任何一个操作,我能否用通俗的语言看到它的推理过程和所用数据?
  4. 撤销。哪些操作可以撤回,怎么撤?无法撤回的操作又怎么处理?
  5. 审批环节。能否对指定操作或金额强制要求人工审批,并且是由系统强制执行,而不只是写在提示词里的一句话?
  6. 数据处理。我的数据去了哪里?会不会被用来训练模型?模型能否运行在我指定的地方?
  7. 成本控制。能否按用户查看用量并设置上限,避免陷入死循环的智能体把账单刷爆?
  8. 出错时的表现。拿不准的时候,它是停下来询问,还是凭猜测硬做?

如果你的客户会直接与 AI 对话,还要查一下销售地的相关规定。在欧盟,《AI 法案》的透明度义务自 2026 年 8 月 2 日起适用,要求告知用户他们正在与 AI 系统而非真人交流。

想看看前两个层级在真实产品里是什么样子,可以看这段对内置于 ERP 的 AI 助手的简短演示:它基于实时业务数据回答问题、准备草稿。

AI 助手处理实时 ERP 数据:提问、起草、审核。

30-60-90 天试点计划

不要一上来就在全公司推开智能体。先跑一个小而可衡量的循环,让数据来决定每一步。

90 天试点循环:第 1 至 30 天只读问答,第 31 至 60 天草稿加人工审批,第 61 至 90 天一项可撤销操作,每个阶段都包含衡量与复盘环节
每个阶段都重复同一个循环:运行、衡量、复盘,再决定是否升一级。

第 1 至 30 天:只读

选一个团队、一个流程,比如采购。先解决前面列出的数据问题。只开启第 1 级:问答和汇总。衡量节省了多少时间,更重要的是,答案错了多少次。让员工给每个答案标注“对”或“错”。

第 31 至 60 天:草稿加审批

为一个场景加上第 2 级,比如采购订单草稿。每份草稿都要经人过目。记录三个数字:原样采纳的草稿占比、修改后采纳的占比、被驳回的占比。把驳回的原因写下来,这些原因就是你日后的规则。

第 61 至 90 天:一项可撤销的操作

如果采纳率高、错误少,就在一个狭窄的场景里放开一项第 3 级操作,比如对低于某一金额的订单自动预留库存。保持审计日志可随时查看,测试撤销功能,并为任何异常情况设置告警。到第 90 天,坦诚地复盘。数据不理想,就停在原地。这同样是一个结果,而不是失败。

一张简单的记分卡能让复盘更实在:

  • 每周节省的工时,实测而非估算。
  • 草稿采纳率及主要驳回原因。
  • 流到客户或供应商手上的错误数(目标是零)。
  • AI 的使用成本,与节省下来的工时对比。

接下来会怎样

回到那个周一。按阶梯来管理,周末那一轮跑出来的不是 14 张已发给供应商的订单,而是采购员队列里的 14 份草稿。采购员发现每个数量都是销售历史的 12 倍,几分钟内整批驳回,并在商品主数据里改好计量单位。驳回的原因成了一条新规则,下个周末的那一轮就不会再出错。

智能体会越来越好,阶梯也会移动:等日志、撤销和审批环节赢得信任,今天还需要人做的事,两年后会变成日常。受益最多的,会是那些数据干净、权限收紧、习惯用数字说话的企业。这些基础同样决定了智能体接入你的数据时有多安全,而这正是第 2 篇的主题:Model Context Protocol。

核心要点

  • 智能体会执行操作,所以要看它出错时会发生什么,而不是听起来有多聪明。
  • 用四级阶梯加三个分流问题来衡量:能否撤销,是否动用资金或让外部人看到,数据是否干净。从第 1、2 级起步。
  • 适合先做的场景:库存问答、采购订单草稿、发票对账、逾期提醒和商品文案。
  • 付款、大额退款、全品类改价、删除和总账过账,暂时不要自动化。
  • 先把数据质量理顺,并给智能体单独且收紧的权限,永远不超过提问者本人。
  • 从权限、审计、可解释性、撤销和审批几方面检验厂商的说法,再用 90 天试点拿出可衡量的结果。

Anichur Rahaman 是一名软件架构师,也是 StoreConsole 的创建者。他为成长型企业设计电商与 ERP 系统,专注于事件驱动架构、数据完整性和自托管部署。

About the Author

Anichur Rahaman

Continue Reading