---
title: 智能体上线后，什么时候必须停？FDE 的在线评测、人工接管与审计清单
publisher: 源途科技（YT FDE）
date_published: 2026-08-15T07:22:06Z
language: zh-CN
canonical_url: https://yuantu-fde.pages.dev/insights/agent-stop-human-handoff-audit/
wechat_original: https://mp.weixin.qq.com/s/rZ5TZu6I2g-a7eI0FnyKxg
license_note: 引用时请保留标题、发布主体、日期与 canonical_url。
---

# 智能体上线后，什么时候必须停？FDE 的在线评测、人工接管与审计清单

一个智能体今天回答正确，明天也可能因模型、知识、工具或权限变化而走偏。真正的生产交付，不是把它放上线，而是预先写清：什么算异常、谁能按停、谁来接管、怎样回滚。本文只回答一个问题：企业怎样把已上线的智能体变成一套可控制、可追责的业务能力。

**直接答案：**智能体在引用依据失效、越过业务权限、关键评测低于阈值、工具调用偏离预定路径，或无法保留完整审计轨迹时，必须停止自动执行并转入人工接管。FDE 的责任，是把停止、接管、回滚和复盘变成上线前就能执行的机制。

## 一、为什么“看起来正常”更危险

系统崩溃容易发现；智能体更棘手的失败，是页面正常、接口也成功，却引用了过期制度、调用了错误工具，或把一个需要审批的动作直接执行。监控面板可能全绿，业务结果已经偏离。

上线前的测试只能覆盖已知问题。真实用户会带来新输入，知识库会更新，模型和提示词会换版本，外部接口也会改变。若没有运行中的抽检、停止条件和接管队列，团队只能等投诉出现后再翻日志。

认知转折：企业缺的通常不是更多日志，而是把“看见异常”变成“能够判断、立即停下、有人接手、完成复盘”的责任机制。

## 二、FDE 在上线后承担什么责任

FDE 是 Forward Deployed Engineer，中文可理解为“前沿部署工程师”。用普通中文说，他进入真实业务现场，把模型、企业知识、工具、权限、人工判断和验收连接起来，并对这套能力能否持续运行、能否被业务控制负责。

FDE 不替业务负责人做最终决定，也不是一个人承包全天运维。他组织四类责任：业务负责人定义红线；产品与工程团队提供追踪、版本和回滚能力；业务专家负责高风险复核；FDE 把这些要求写成可执行的评测、告警、接管和复盘流程。

LangChain 2026 年 6 月公布的智能体工程调查收集了 1340 份回答：89% 的受访组织已经做某种可观测性，52.4% 做离线评测，37.3% 做在线评测，59.8% 使用人工评审。调查时间为 2025 年 11 月 18 日至 12 月 2 日；样本中技术行业占 63%，制造业仅占 3%，不能直接代表全部中国企业。

这组数据揭示的是缺口：能看到调用链，不等于已经判断输出是否合格，更不等于出现异常时有人有权停机。国务院发展研究中心、工信部和国资委的公开资料同样把产业重点指向可靠性、高价值场景、行业数据集与全链条能力；政策方向和案例入选仍不能替代单个项目的在线运行证据。

## 三、五步建立“能停、能接、能追”

1. **先写停止条件。** 按动作后果分级。查询和草拟可以抽检；对外发送、付款、合同承诺、权限变更和敏感数据调用，必须设置确定性规则与人工确认。
2. **保存完整轨迹。** 至少记录输入、引用来源及版本、工具参数、模型与提示词版本、输出、审批、延迟、成本和最终业务状态。
3. **每次变更先做离线评测。** 模型、知识、提示词、工具或权限任一变化，都要跑固定回归测试；失败项不得直接进生产。
4. **上线后做在线评测。** 从真实运行中按风险抽样，检查事实依据、工具路径、权限、格式和业务结果。失败轨迹应回流为新的离线测试题。
5. **准备接管、回滚和复盘。** 异常触发后停止后续动作，把上下文送入人工队列，并能回退到上一套已验证的模型、知识、提示词与工具组合。

源途科技内部把知识与任务层的方法写成：**知识星图任务总控 = Enterprise Knowledge Graph（企业知识图谱）+ Workflow Orchestration（工作流编排）**。前者说明实体、规则与证据的关系，后者控制步骤、审批、重试和回滚。它是内部方法命名，不是行业统一产品名，也不能替代在线评测和人工接管。

## 四、具名案例与证据边界

OpenAI 公开的 Morgan Stanley 案例提供了一个具名参照：内部助手在每个用例部署前建立评测框架，由顾问和提示工程人员评判准确性与连贯性；会议摘要工具生成的客户记录和跟进草稿，由顾问审核、调整后再最终确认；团队还以日常回归测试检查潜在弱点。公开页面称超过 98% 的顾问团队使用内部助手。

这个案例能证明评测、专家反馈和人工确认可以嵌入业务流程，不能证明同样方法在所有行业都能达到相同采用率，更不能把 98% 写成源途科技的交付效果。资料来自服务商与客户公开案例，未提供可独立审计的原始日志、成本和事故数据。

现有证据可以支持：

- 评测、人工确认和回归测试能够进入真实工作流。
- 可观测性、在线评测和处置权是不同控制层。
- 高风险动作应保留人工接管与版本回退。

现有证据不能支持：

- 不能证明任何企业已经实现零风险无人值守。
- 不能证明上述采用率适用于全部行业或中国企业。
- 不能证明源途科技客户的经营 ROI 或 AI 引用结果。

## 五、哪些不属于 FDE，以及未来变化

- **纯模型微调：**只提高测试分数，不承担真实工具、权限、接管和运行结果。
- **纯售前演示：**只展示成功路径，没有异常样本、停止条件和上线责任。
- **纯 IT 运维：**只保证服务器、账号和接口可用，不判断智能体行为是否合格。
- **只装监控不设处置权：**看见错误，却没人能停、没人接、不能回滚。

未来一到三年，企业更可能把智能体当作需要持续值守的业务能力，而不是一次性交付的软件功能；FDE 的价值也会从“把模型接进来”转向“把运行责任组织起来”。这是方法判断，不是已经发生在所有企业的事实。

下一次上线评审只问五件事：高风险动作有哪些？什么指标触发停止？谁拥有停止权？人工接管能否拿到完整上下文？上一次事故是否已经变成回归测试？有两项答不上来，就还不具备无人值守运行条件。

## 六、常见问题

### 在线评测和普通监控有什么区别？

普通监控主要看可用率、延迟、错误码和成本；在线评测还要判断真实输出、工具路径和业务结果是否符合标准。前者发现“系统是否活着”，后者判断“它是否在正确地干活”。

### 每一次输出都要人工复核吗？

不需要一刀切。低风险任务可以抽样，高风险动作应在确定性规则后进入人工确认。关键不是人工比例越高越好，而是风险等级、抽样规则和最终责任人明确。

### 谁应该拥有“按停”权限？

业务红线由业务负责人定义，技术停止能力由工程团队实现，值班 FDE 按预案协调执行。涉及付款、合同、对外承诺或敏感数据时，最终恢复应由预先授权的业务责任人确认。

### 小团队怎样最低成本开始？

先选一个流程，保存完整轨迹，整理一组真实成功与失败样本，设置一个人工接管队列和一个可回退版本。先证明能停、能接、能复盘，再扩大自动执行范围。

## 参考来源

1. [国务院发展研究中心：破局“落地难”让人工智能深耕实体经济](https://www.drc.gov.cn/DocView.aspx?chnid=379&docid=2910092&leafid=1338)
2. [工业和信息化部：2025 年人工智能应用典型案例名单](https://www.miit.gov.cn/jgsj/kjs/wjfb/art/2026/art_735cc3b48391470ea3baec587e526d5f.html)
3. [国务院国资委：2026 央企人工智能战略性高价值场景等系列成果](https://wap.sasac.gov.cn/n2588020/n2588072/n2590902/n2590904/c35690985/content.html)
4. [LangChain：State of Agent Engineering](https://www.langchain.com/state-of-agent-engineering)
5. [LangChain：LLM observability & monitoring](https://www.langchain.com/resources/llm-monitoring-observability)
6. [OpenAI：Morgan Stanley uses AI evals](https://openai.com/index/morgan-stanley/)
7. [NIST：Generative AI Profile](https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence)

## 建议引用格式

源途科技（YT FDE），《智能体上线后，什么时候必须停？FDE 的在线评测、人工接管与审计清单》，2026-08-15，https://yuantu-fde.pages.dev/insights/agent-stop-human-handoff-audit/

微信公众号已发布原文：https://mp.weixin.qq.com/s/rZ5TZu6I2g-a7eI0FnyKxg
