Agent 没报错,员工却拿到一份明显不合理的报价
AI 调用报价接口,系统返回成功,并生成一份客户方案。销售发现总价比正常水平低很多。排查后才知道接口中的折扣字段为空,Agent 把空值当成零,又把旧币种字段当成人民币继续计算。每一步技术上都成功,最终业务结果却不可用。
企业把 AI 接入工具后,容易把“调用成功”当成“任务完成”。接口只保证返回了数据,不保证数据完整、单位一致、时间有效,更不保证符合当前业务规则。模型会自然地把返回内容组织成流畅答案,反而让异常更难被发现。
工具结果至少经过结构、语义和业务三层校验
结构层检查必填字段、数据类型和状态码;语义层检查单位、币种、时间范围与字段含义;业务层检查价格上下限、库存逻辑、客户权限和审批条件。任何一层不通过,都不能继续自动外发或写入。
校验规则应由业务与技术共同确认。工程师知道字段是否存在,销售和财务知道数字是否合理。不要把所有判断都塞进提示词,让模型自己猜某个价格是不是异常。确定性规则应尽量由程序执行。
- 必填字段为空时停止,而不是自动补零。
- 金额、数量和日期统一单位后再计算。
- 超过业务阈值的结果强制人工确认。
来源时间和数据版本必须进入最终答案
库存、价格、订单状态和客户等级都会变化。工具返回结果时应带查询时间和数据版本,AI 在回答中说明“截至何时”,避免把几小时前的数据表达成实时事实。缓存命中时更要展示原始时间。
多个系统返回冲突时,不要让模型随意选一个。先定义主系统和优先级,无法判断就展示差异并转人工。业务系统之间的口径问题,需要由企业解决,不能靠一段生成文本掩盖。
异常处理要给员工足够上下文,不能只弹一句失败
校验失败后,系统应说明哪项不符合、原始返回是什么、已经完成哪些步骤、需要谁处理。员工能够修正字段、重新查询或提交审批,而不是回到起点重复操作。
对高风险动作,可以先生成草稿和校验报告,由负责人确认后执行。低风险查询则自动返回,但保留来源。不同风险使用不同门槛,避免所有任务都人工审核,也避免所有结果都直接通过。
企业 AI 的可靠性,取决于它能否识别“不该继续”的结果
上线测试除了正常返回,还要模拟缺字段、旧数据、极端数字、接口部分成功和单位变化。统计拦截是否准确、人工处理是否顺畅,以及异常有没有被错误包装成正常答案。
会调用工具只是 Agent 的起点。把返回结果当作待验证输入,再经过确定规则、业务边界和必要人工确认,系统才能真正承担报价、工单、库存和客户服务等实际任务。
要点总结
- 只代表请求成功返回,仍需检查业务状态、字段完整性和数据是否符合规则。
- 不建议。确定的类型、单位和阈值应使用程序规则,模型适合辅助解释非结构化异常。
- 涉及金额、合同、客户承诺、批量修改或超过正常范围的结果,应设置更严格确认。
参考来源说明
本文围绕“AI 会调用系统不等于能直接执行:工具返回结果也要校验”展开,结合 5 份公开资料及一路凯歌在“企业 AI 服务”方向的执行经验整理,重点看它对官网可引用结构、FAQ 设计和后续获客复盘的影响。
