LangSmith 03:离线与在线评测

2026-09-01
12475 分钟
...

1、本篇任务:证明新版本比旧版本更好

LLM 输出非确定,不能靠“手工聊几句”发布。LangSmith Evaluation 的基本循环是:创建 Dataset;定义 Evaluator;运行 Experiment;比较结果;把线上失败回灌 Dataset。

离线评测在发布前使用参考答案;在线评测在生产 trace 上监控格式、安全与质量模式。两者作用不同,不能互相替代。

2、先拆分“好”的维度

退款助手至少有:意图分类、检索命中、答案事实、引用有效、正确拒答、工具选择、权限安全、延迟和成本。不要合成一个模糊总分。

优先使用确定性 evaluator:schema 校验、引用是否来自本次检索、订单权限、退款期限计算、是否调用禁用工具。开放回答再使用人工或经校准的 LLM judge。

3、Dataset 应怎样构成

每类关键能力先准备 5~10 个高质量案例:

Slice必须包含
政策问答常见条款、不同表达、版本冲突
拒答无资料、未来问题、过期政策
订单工具正常、空结果、超时、错误格式
权限两租户相同订单号、普通用户写操作
注入用户、文档、工具输出中的恶意指令
审批approve/reject/edit、重复 action、过期

参考输出写期望行为,不必要求逐字相同。例如可以要求“必须拒答且无 citation”,而不是固定一句中文。

4、编写可复现 Evaluator

Python:

def citation_coverage(inputs, outputs, reference_outputs):
    expected = set(reference_outputs["required_chunk_ids"])
    actual = {item["chunk_id"] for item in outputs.get("citations", [])}
    return {
        "key": "citation_coverage",
        "score": float(expected <= actual),
        "comment": f"missing={sorted(expected - actual)}",
    }

def no_side_effect_without_approval(inputs, outputs, reference_outputs):
    forbidden = outputs.get("submitted_actions", []) if not inputs.get("approved") else []
    return {"key": "approval_safety", "score": float(len(forbidden) == 0)}

TypeScript evaluator 使用同样稳定输入/输出并返回具名 key、score 和 comment。Evaluator 不应访问变化中的线上数据或实时搜索,否则实验无法重现。

5、运行并比较实验

Python/TypeScript SDK 都通过 evaluate(target, { data, evaluators, experimentPrefix, metadata }) 运行目标应用。metadata 记录模型、prompt、索引和代码版本。

比较候选与基线时设置硬门禁:安全和权限不得下降;引用有效率不得下降;关键 slice 全部通过;正确率达到目标;P95 和 token 不超过预算。查看每条失败样本,而不是只看平均分。

模型输出有随机性时对同一案例重复运行,比较分布与最坏值;缓存只能用于不会掩盖目标变更的步骤。

6、LLM Judge 怎样校准

准备人工金标,覆盖正确、事实错但文笔好、引用存在但不支持结论、无证据正确拒答、越权等边界案例。比较 judge 与人工一致率、假阳性和假阴性。若安全错误漏判,judge 只能辅助排序,不能当发布门禁。

judge 的模型、prompt 和阈值也必须版本化并回归。

7、接入 CI 与线上闭环

PR20 smokeschema/安全硬失败即阻止合并
Release全量 Dataset与基线比较并人工审核失败样本
Production采样在线 evaluator 和人工反馈
Failure去敏最小化加参考行为回到离线 Dataset

故意提交一个移除 ACL filter 或引用校验的版本;CI 必须指出具体案例和 evaluator 并阻止发布。能挡住坏改动,评测才有价值。

下一课把 graph、trace 和 eval 放进可运营部署流程。

官方阅读:LangSmith EvaluationEvaluation Types

如果您觉得这篇文章有帮助,请点个赞吧~

分享文章

相关文章

更多文章 →
AI2026-09-01
Deep Agents 01:何为 Agent Harness,以及如何开始
1、本篇任务:完成一份多步骤、带证据的技术调研 普通客服 Agent 的问题短、工具少、输出即时。技术调研或编码任务会持续很久,产生计划、搜索结果、文件和中间结论。Deep Agents 在 LangChain/LangGraph 之上预装规划、虚拟文件系统、上下文压缩和子 Agent,适合这类开放任务。 本课让 Agent 比较两种向量数据库,并交付一份可验证报告。 2、什么时候需要 Deep Agent 满足以下两项以上再考虑:任务...
学习
AI2026-09-01
Deep Agents 02:子 Agent、虚拟文件系统与长期记忆
1、本篇任务:让主管只看结论,让子 Agent 处理细节 技术调研会产生几十次搜索和大量文件。如果全部进入主管上下文,真正的目标会被噪音淹没。本课用两个子 Agent: 收集证据, 检查结论;主管负责计划与最终合成。 2、什么时候委派,什么时候直接调用工具 适合委派:子任务有多步;需要专门提示或工具;会产生大量中间结果;只需返回有限结论。不适合:一步查询;主管需要全部中间上下文;协调成本超过任务本身。 3、配置专门子 Agent Pyt...
学习
AI2026-09-01
Deep Agents 03:生产化、Sandbox、权限与上线验收
1、本篇任务:让 Deep Agent 在隔离环境中分析代码 只读研究 Agent 风险有限;编码 Agent 需要读写文件、安装依赖和执行测试。本课不讲如何让模型写更漂亮的代码,只讲执行环境、权限、恢复和上线验收。 2、先做威胁模型 资产包括源代码、用户文件、云凭证、生产网络和发布权限;攻击入口包括用户消息、仓库内容、网页、依赖包、MCP 返回和命令输出。 Prompt injection 不是靠一句 system prompt 解决...
学习
AI2026-09-01
LangChain 01:全景、原理与学习路线
1、本篇学完要得到什么 这一篇只解决三个问题:LangChain 到底负责什么;它与 LangGraph、Deep Agents、LangSmith 是什么关系;后面应按什么顺序学习。 贯穿整套课程的项目是“退款政策与订单助手”。它最终能够:回答知识库中的退款规则;查询当前用户的订单;生成结构化答复;对真正的退款操作进行人工审批;断线后恢复;通过评测后发布。 先记住一句话: 模型负责理解与生成,应用负责数据、权限、状态和副作用。 如果把...
学习
AI2026-09-01
LangChain 02:模型、消息与结构化输出
1、本篇任务:让模型输出成为程序可以依赖的合同 上一课只证明 Agent 能运行。本课暂时不接业务工具,只完成一个“客服分诊器”:输入用户问题,输出意图、紧急程度、是否需要人工和给用户的答复。 本课的核心不是学更多模型参数,而是理解三层合同:消息决定模型看到了什么;schema 决定程序期待什么;业务校验决定结果是否真的可用。 2、消息不是一段字符串,而是一条执行记录 一次工具型对话通常包含四种消息: | 类型 | 由谁产生 | 作用...
学习
AI2026-09-01
LangChain 03:工具与 Agent——从函数到可控行动
1、本篇任务:让 Agent 安全地读取订单 上一课得到结构化分诊结果,但模型不知道真实订单。本课增加一个只读工具 ,走通完整 Agent 循环,并把模型、工具包装和领域服务的责任分开。 完成后,用户问“我的 A100 发货了吗”,Agent 会选择工具;工具只按当前登录用户查询;模型基于工具结果回答。它仍然不能退款,因为我们没有提供写工具。 2、工具的本质是受 schema 约束的应用函数 一个好工具需要:稳定名称、清楚描述、窄输入...
学习

评论

请登录后发表评论

去登录
加载评论中...

目录