LangGraph 04:流式、调试与生产运行

2026-09-01
14205 分钟
...

1、本篇任务:让图在用户和开发者眼中都可见

用户关心“正在检索、等待审批、答案到哪了”;开发者关心“哪个节点慢、state 如何变化、为何走了这条边”。两者需要不同流。不要把完整 state 或内部 trace 直接发给用户。

2、理解常用 stream mode

模式看到什么适用场景
values每步后的完整 state本地调试,小 state
updates节点产生的局部更新调试状态变化、构建事件适配
messages模型消息/token 与 metadata打字机输出
custom节点主动上报进度“已处理 4/10 个文档”
debug更完整运行信息开发排障,不对外

Python:

for chunk in graph.stream(input_state, config=config, stream_mode=["updates", "messages"]):
    public_event = event_adapter.to_public(chunk)
    if public_event:
        yield sse_encode(public_event)

TypeScript 同样从 graph.stream() 异步迭代事件。事件适配器负责脱敏、增加 run ID/sequence、把节点名转换为稳定产品阶段。

3、不要把 private state 当作自动保密

input/output schema 可以限制 invoke 的输入输出,但某些 stream mode 可能看到内部 channel。真正的机密不要写 state;流式输出显式选择 output keys,并在适配器做 allowlist。工具堆栈、原始检索文本、用户 PII 和密钥不能发给前端。

4、调试一条错误回答的固定顺序

  1. 看输入和 graph/release 版本。
  2. 看实际经过的节点与条件路由。
  3. 看订单工具和 retriever 的结构化输出。
  4. 看 reducer 后的 state 是否丢失或重复证据。
  5. 看模型节点最终获得的上下文清单。
  6. 看输出校验和 UI 适配是否改变结果。

这样能区分路由、数据、state、模型和展示问题,而不是一看到差答案就改 prompt。

5、生产预算和 SLO

每个 run 设置 deadline、recursion limit、最大模型调用、最大工具调用、token 预算和并发上限。按节点观测 P50/P95、错误率和成本:

指标暴露的问题
首事件/首 token 延迟队列、模型连接、上下文过大
检索节点 P95向量库、rerank、ACL filter
每 run 工具次数路由或循环失控
恢复成功率checkpoint、schema、幂等问题
拒答率与引用有效率索引或生成回归

6、部署时的基本拓扑

APIrun queuestateless graph workers
              ├→ shared checkpointer/store
              ├→ domain services/outbox
              └→ trace/logs/metrics

水平扩容时不能使用每进程内存保存 thread。worker 可重启,state 必须在共享持久层。取消 run 要阻止新节点派发,等待不可中断工具结束,并记录最终取消状态。

7、故障演练

向量库故障应拒答而非编造;一个并发分支超时应降级;流式连接断开不应重做副作用;模型连续 tool call 应被预算终止;旧 checkpoint 不兼容时转旧 worker 或人工处理;trace SDK 故障不应影响主请求。

每次事故都转成节点测试、完整图测试或评测案例。LangGraph 阶段的完成标准不是“图能画出来”,而是控制流可解释、状态可恢复、故障可验证。

下一阶段进入 Deep Agents:在 LangGraph 之上使用规划、文件系统和子 Agent 处理开放式长任务。

官方阅读:Python StreamingTypeScript Streaming

如果您觉得这篇文章有帮助,请点个赞吧~

分享文章

相关文章

更多文章 →
AI2026-09-01
Deep Agents 01:何为 Agent Harness,以及如何开始
1、本篇任务:完成一份多步骤、带证据的技术调研 普通客服 Agent 的问题短、工具少、输出即时。技术调研或编码任务会持续很久,产生计划、搜索结果、文件和中间结论。Deep Agents 在 LangChain/LangGraph 之上预装规划、虚拟文件系统、上下文压缩和子 Agent,适合这类开放任务。 本课让 Agent 比较两种向量数据库,并交付一份可验证报告。 2、什么时候需要 Deep Agent 满足以下两项以上再考虑:任务...
学习
AI2026-09-01
Deep Agents 02:子 Agent、虚拟文件系统与长期记忆
1、本篇任务:让主管只看结论,让子 Agent 处理细节 技术调研会产生几十次搜索和大量文件。如果全部进入主管上下文,真正的目标会被噪音淹没。本课用两个子 Agent: 收集证据, 检查结论;主管负责计划与最终合成。 2、什么时候委派,什么时候直接调用工具 适合委派:子任务有多步;需要专门提示或工具;会产生大量中间结果;只需返回有限结论。不适合:一步查询;主管需要全部中间上下文;协调成本超过任务本身。 3、配置专门子 Agent Pyt...
学习
AI2026-09-01
Deep Agents 03:生产化、Sandbox、权限与上线验收
1、本篇任务:让 Deep Agent 在隔离环境中分析代码 只读研究 Agent 风险有限;编码 Agent 需要读写文件、安装依赖和执行测试。本课不讲如何让模型写更漂亮的代码,只讲执行环境、权限、恢复和上线验收。 2、先做威胁模型 资产包括源代码、用户文件、云凭证、生产网络和发布权限;攻击入口包括用户消息、仓库内容、网页、依赖包、MCP 返回和命令输出。 Prompt injection 不是靠一句 system prompt 解决...
学习
AI2026-09-01
LangChain 01:全景、原理与学习路线
1、本篇学完要得到什么 这一篇只解决三个问题:LangChain 到底负责什么;它与 LangGraph、Deep Agents、LangSmith 是什么关系;后面应按什么顺序学习。 贯穿整套课程的项目是“退款政策与订单助手”。它最终能够:回答知识库中的退款规则;查询当前用户的订单;生成结构化答复;对真正的退款操作进行人工审批;断线后恢复;通过评测后发布。 先记住一句话: 模型负责理解与生成,应用负责数据、权限、状态和副作用。 如果把...
学习
AI2026-09-01
LangChain 02:模型、消息与结构化输出
1、本篇任务:让模型输出成为程序可以依赖的合同 上一课只证明 Agent 能运行。本课暂时不接业务工具,只完成一个“客服分诊器”:输入用户问题,输出意图、紧急程度、是否需要人工和给用户的答复。 本课的核心不是学更多模型参数,而是理解三层合同:消息决定模型看到了什么;schema 决定程序期待什么;业务校验决定结果是否真的可用。 2、消息不是一段字符串,而是一条执行记录 一次工具型对话通常包含四种消息: | 类型 | 由谁产生 | 作用...
学习
AI2026-09-01
LangChain 03:工具与 Agent——从函数到可控行动
1、本篇任务:让 Agent 安全地读取订单 上一课得到结构化分诊结果,但模型不知道真实订单。本课增加一个只读工具 ,走通完整 Agent 循环,并把模型、工具包装和领域服务的责任分开。 完成后,用户问“我的 A100 发货了吗”,Agent 会选择工具;工具只按当前登录用户查询;模型基于工具结果回答。它仍然不能退款,因为我们没有提供写工具。 2、工具的本质是受 schema 约束的应用函数 一个好工具需要:稳定名称、清楚描述、窄输入...
学习

评论

请登录后发表评论

去登录
加载评论中...

目录