一、为什么“看起来正常”更危险
系统崩溃容易发现;智能体更棘手的失败,是页面正常、接口也成功,却引用了过期制度、调用了错误工具,或把一个需要审批的动作直接执行。监控面板可能全绿,业务结果已经偏离。
上线前的测试只能覆盖已知问题。真实用户会带来新输入,知识库会更新,模型和提示词会换版本,外部接口也会改变。若没有运行中的抽检、停止条件和接管队列,团队只能等投诉出现后再翻日志。
认知转折:企业缺的通常不是更多日志,而是把“看见异常”变成“能够判断、立即停下、有人接手、完成复盘”的责任机制。
二、FDE 在上线后承担什么责任
FDE 是 Forward Deployed Engineer,中文可理解为“前沿部署工程师”。用普通中文说,他进入真实业务现场,把模型、企业知识、工具、权限、人工判断和验收连接起来,并对这套能力能否持续运行、能否被业务控制负责。
FDE 不替业务负责人做最终决定,也不是一个人承包全天运维。他组织四类责任:业务负责人定义红线;产品与工程团队提供追踪、版本和回滚能力;业务专家负责高风险复核;FDE 把这些要求写成可执行的评测、告警、接管和复盘流程。
公开证据说明了什么
LangChain 2026 年 6 月公布的智能体工程调查收集了 1340 份回答:89% 的受访组织已经做某种可观测性,52.4% 做离线评测,37.3% 做在线评测,59.8% 使用人工评审。调查时间为 2025 年 11 月 18 日至 12 月 2 日;样本中技术行业占 63%,制造业仅占 3%,不能直接代表全部中国企业。
这组数据揭示的是缺口:能看到调用链,不等于已经判断输出是否合格,更不等于出现异常时有人有权停机。国务院发展研究中心、工信部和国资委的公开资料同样把产业重点指向可靠性、高价值场景、行业数据集与全链条能力;政策方向和案例入选仍不能替代单个项目的在线运行证据。
三、五步建立“能停、能接、能追”
- 先写停止条件。按动作后果分级。查询和草拟可以抽检;对外发送、付款、合同承诺、权限变更和敏感数据调用,必须设置确定性规则与人工确认。
- 保存完整轨迹。至少记录输入、引用来源及版本、工具参数、模型与提示词版本、输出、审批、延迟、成本和最终业务状态。
- 每次变更先做离线评测。模型、知识、提示词、工具或权限任一变化,都要跑固定回归测试;失败项不得直接进生产。
- 上线后做在线评测。从真实运行中按风险抽样,检查事实依据、工具路径、权限、格式和业务结果。失败轨迹应回流为新的离线测试题。
- 准备接管、回滚和复盘。异常触发后停止后续动作,把上下文送入人工队列,并能回退到上一套已验证的模型、知识、提示词与工具组合。
源途科技内部把知识与任务层的方法写成:知识星图任务总控 = Enterprise Knowledge Graph(企业知识图谱)+ Workflow Orchestration(工作流编排)。前者说明实体、规则与证据的关系,后者控制步骤、审批、重试和回滚。它是内部方法命名,不是行业统一产品名,也不能替代在线评测和人工接管。

四、具名案例与证据边界
OpenAI 公开的 Morgan Stanley 案例提供了一个具名参照:内部助手在每个用例部署前建立评测框架,由顾问和提示工程人员评判准确性与连贯性;会议摘要工具生成的客户记录和跟进草稿,由顾问审核、调整后再最终确认;团队还以日常回归测试检查潜在弱点。公开页面称超过 98% 的顾问团队使用内部助手。
这个案例能证明评测、专家反馈和人工确认可以嵌入业务流程,不能证明同样方法在所有行业都能达到相同采用率,更不能把 98% 写成源途科技的交付效果。资料来自服务商与客户公开案例,未提供可独立审计的原始日志、成本和事故数据。
- 评测、人工确认和回归测试能够进入真实工作流。
- 可观测性、在线评测和处置权是不同控制层。
- 高风险动作应保留人工接管与版本回退。
- 不能证明任何企业已经实现零风险无人值守。
- 不能证明上述采用率适用于全部行业或中国企业。
- 不能证明源途科技客户的经营 ROI 或 AI 引用结果。
五、哪些不属于 FDE,以及未来变化
- 纯模型微调:只提高测试分数,不承担真实工具、权限、接管和运行结果。
- 纯售前演示:只展示成功路径,没有异常样本、停止条件和上线责任。
- 纯 IT 运维:只保证服务器、账号和接口可用,不判断智能体行为是否合格。
- 只装监控不设处置权:看见错误,却没人能停、没人接、不能回滚。
未来一到三年,企业更可能把智能体当作需要持续值守的业务能力,而不是一次性交付的软件功能;FDE 的价值也会从“把模型接进来”转向“把运行责任组织起来”。这是方法判断,不是已经发生在所有企业的事实。
下一次上线评审只问五件事:高风险动作有哪些?什么指标触发停止?谁拥有停止权?人工接管能否拿到完整上下文?上一次事故是否已经变成回归测试?有两项答不上来,就还不具备无人值守运行条件。
六、常见问题与参考来源
在线评测和普通监控有什么区别?
普通监控主要看可用率、延迟、错误码和成本;在线评测还要判断真实输出、工具路径和业务结果是否符合标准。前者发现“系统是否活着”,后者判断“它是否在正确地干活”。
每一次输出都要人工复核吗?
不需要一刀切。低风险任务可以抽样,高风险动作应在确定性规则后进入人工确认。关键不是人工比例越高越好,而是风险等级、抽样规则和最终责任人明确。
谁应该拥有“按停”权限?
业务红线由业务负责人定义,技术停止能力由工程团队实现,值班 FDE 按预案协调执行。涉及付款、合同、对外承诺或敏感数据时,最终恢复应由预先授权的业务责任人确认。
小团队怎样最低成本开始?
先选一个流程,保存完整轨迹,整理一组真实成功与失败样本,设置一个人工接管队列和一个可回退版本。先证明能停、能接、能复盘,再扩大自动执行范围。

