LangSmith 02:观测、调试与反馈闭环

2026-09-01
13345 分钟
...

1、本篇任务:把“用户说答错了”变成可重复诊断

Trace 是原始运行记录,Observability 是用 trace 回答运营问题:哪类请求在失败;从哪个版本开始;影响谁;应由哪个团队处理。

2、一次投诉的固定排查顺序

收到 request ID 后:

  1. 确认 environment、release、模型/prompt/index 版本。
  2. 检查路由是否选择正确流程。
  3. 检查 retriever 的 filter、chunk ID、得分和是否无命中。
  4. 检查工具是否按正确用户执行,错误是权限还是依赖故障。
  5. 检查模型实际获得的上下文,是否被预算裁掉。
  6. 检查输出 schema、业务校验和前端适配。
  7. 将最小复现输入加入数据集,再修改系统。

不要先改 prompt。很多“模型答错”实际是索引版本、ACL filter、工具数据或 UI 丢字段。

3、把指标按系统层次组织

指标说明
APIQPS、排队、HTTP 错误、首事件延迟入口与容量
Graph/Agent节点路径、循环次数、恢复率编排质量
Modeltoken、延迟、限流、成本模型与上下文
Tool/RAG超时、命中、ACL 拒绝、引用有效率数据与依赖
Business正确解决率、转人工率、退款成功/失败产品结果

每个图表写 owner、正常基线、告警阈值和 runbook。只展示“调用次数”但没有行动规则,不算可观测性。

4、用症状反查根因

P95 上升且工具耗时上升,先检查依赖/并发;拒答率突然升高且索引版本刚变,检查索引;工具次数暴涨且 prompt 刚变,检查路由与循环;成本上升但请求数不变,检查上下文长度和重试;引用有效率下降但检索命中稳定,检查生成和后处理。

按 release、tenant、intent、tool、model 分组比看总体平均更有用。平均值可能掩盖某个租户完全不可用。

5、反馈必须能驱动修复

反馈键使用具体维度:correctness、citation_validity、tool_safety、helpfulness、ux_latency。同时记录 reviewer 类型和失败层:用户差评只是信号,运营/专家审核后才能成为可靠标签。

type Feedback = {
  runId: string;
  key: "correctness" | "citation_validity" | "tool_safety" | "ux_latency";
  score?: number;
  comment?: string;
  reviewer: "end_user" | "operator" | "auditor";
  failureLayer?: "routing" | "retrieval" | "tool" | "generation" | "ui";
};

低分 trace 去敏后进入审核队列;确认有代表性的案例再进入离线 dataset。不要自动用所有用户差评修改 prompt 或长期记忆。

6、在线 evaluator 的限制

在线规则可检查 schema、引用 ID、工具安全和异常模式;LLM judge 可规模化评估语义质量,但必须用人工金标校准,观察假阳性与假阴性。安全问题不能只靠 judge,仍要确定性规则和人工复核。

在线评测会增加成本,应独立设置过滤器与采样率。发布新版本时提高采样,稳定后恢复。

7、本篇验收

从一条“订单答错”反馈出发,15 分钟内定位到具体层和版本;仪表盘能区分检索空、工具 500、schema 失败;告警能链接到 runbook;修复后同一案例进入离线回归,而不是只写一份复盘。

下一课建立正式 Dataset、Evaluator 和实验比较,让修复结果可以量化。

官方阅读:ObservabilityEvaluation Concepts

如果您觉得这篇文章有帮助,请点个赞吧~

分享文章

相关文章

更多文章 →
AI2026-09-01
Deep Agents 01:何为 Agent Harness,以及如何开始
1、本篇任务:完成一份多步骤、带证据的技术调研 普通客服 Agent 的问题短、工具少、输出即时。技术调研或编码任务会持续很久,产生计划、搜索结果、文件和中间结论。Deep Agents 在 LangChain/LangGraph 之上预装规划、虚拟文件系统、上下文压缩和子 Agent,适合这类开放任务。 本课让 Agent 比较两种向量数据库,并交付一份可验证报告。 2、什么时候需要 Deep Agent 满足以下两项以上再考虑:任务...
学习
AI2026-09-01
Deep Agents 02:子 Agent、虚拟文件系统与长期记忆
1、本篇任务:让主管只看结论,让子 Agent 处理细节 技术调研会产生几十次搜索和大量文件。如果全部进入主管上下文,真正的目标会被噪音淹没。本课用两个子 Agent: 收集证据, 检查结论;主管负责计划与最终合成。 2、什么时候委派,什么时候直接调用工具 适合委派:子任务有多步;需要专门提示或工具;会产生大量中间结果;只需返回有限结论。不适合:一步查询;主管需要全部中间上下文;协调成本超过任务本身。 3、配置专门子 Agent Pyt...
学习
AI2026-09-01
Deep Agents 03:生产化、Sandbox、权限与上线验收
1、本篇任务:让 Deep Agent 在隔离环境中分析代码 只读研究 Agent 风险有限;编码 Agent 需要读写文件、安装依赖和执行测试。本课不讲如何让模型写更漂亮的代码,只讲执行环境、权限、恢复和上线验收。 2、先做威胁模型 资产包括源代码、用户文件、云凭证、生产网络和发布权限;攻击入口包括用户消息、仓库内容、网页、依赖包、MCP 返回和命令输出。 Prompt injection 不是靠一句 system prompt 解决...
学习
AI2026-09-01
LangChain 01:全景、原理与学习路线
1、本篇学完要得到什么 这一篇只解决三个问题:LangChain 到底负责什么;它与 LangGraph、Deep Agents、LangSmith 是什么关系;后面应按什么顺序学习。 贯穿整套课程的项目是“退款政策与订单助手”。它最终能够:回答知识库中的退款规则;查询当前用户的订单;生成结构化答复;对真正的退款操作进行人工审批;断线后恢复;通过评测后发布。 先记住一句话: 模型负责理解与生成,应用负责数据、权限、状态和副作用。 如果把...
学习
AI2026-09-01
LangChain 02:模型、消息与结构化输出
1、本篇任务:让模型输出成为程序可以依赖的合同 上一课只证明 Agent 能运行。本课暂时不接业务工具,只完成一个“客服分诊器”:输入用户问题,输出意图、紧急程度、是否需要人工和给用户的答复。 本课的核心不是学更多模型参数,而是理解三层合同:消息决定模型看到了什么;schema 决定程序期待什么;业务校验决定结果是否真的可用。 2、消息不是一段字符串,而是一条执行记录 一次工具型对话通常包含四种消息: | 类型 | 由谁产生 | 作用...
学习
AI2026-09-01
LangChain 03:工具与 Agent——从函数到可控行动
1、本篇任务:让 Agent 安全地读取订单 上一课得到结构化分诊结果,但模型不知道真实订单。本课增加一个只读工具 ,走通完整 Agent 循环,并把模型、工具包装和领域服务的责任分开。 完成后,用户问“我的 A100 发货了吗”,Agent 会选择工具;工具只按当前登录用户查询;模型基于工具结果回答。它仍然不能退款,因为我们没有提供写工具。 2、工具的本质是受 schema 约束的应用函数 一个好工具需要:稳定名称、清楚描述、窄输入...
学习

评论

请登录后发表评论

去登录
加载评论中...

目录