产品介绍
LangSmith 是什么?
LangSmith 是面向 LLM 应用和 AI Agent 团队的可观测与评估平台。它记录 Agent 运行中的每一步,让开发者检查 Prompt、模型调用、工具使用、检索、延迟、成本、输出和会话 Thread,而不是只根据最终回答排查问题。
该平台不绑定特定框架,可接入 LangChain、LangGraph、OpenAI 或 Anthropic SDK、Vercel AI SDK、LlamaIndex、自定义技术栈和 OpenTelemetry。生产监控把 Trace 与在线评估器、Dashboard、Alert、主题聚类、错误分析和面向 Agent 查询的 Trace 数据库结合起来。
如何使用 LangSmith
- 创建 Project,并根据数据政策选择 Cloud、BYOC 或 Self-hosted 部署。
- 为应用加入对应 SDK 或 OpenTelemetry Instrumentation。
- 将相关运行归入 Thread,并附加环境、版本、用户分群或实验等 Metadata。
- 检查 Trace 中的工具调用失败、检索质量、延迟、Token 成本和异常执行路径。
- 添加 Code Evaluator 或 LLM-as-a-judge,对生产流量持续评估。
- 为回归配置 Dashboard 和 Alert,再把典型失败样本转成 Dataset 与可重复测试。
- 接入生产数据前先脱敏或排除敏感输入,并确认 Retention、Access 和区域托管控制。
核心功能
- 端到端 Trace: 展示模型、检索、工具和 Agent 的嵌套步骤,以及输入、输出、延迟和成本。
- 框架无关接入: 支持主流 Agent Framework、模型 SDK、自定义应用和 OpenTelemetry。
- 生产监控: 实时跟踪 Agent 质量和运行指标。
- 在线评估: 用代码规则或 LLM Judge 评估实时流量与会话轨迹。
- Trace 搜索: 通过 SmithDB 按全文、JSON Path、Metadata 和 Agent Path 过滤。
- 自动洞察: 聚类会话主题并暴露重复错误。
- 告警集成: 通过 Webhook 和事故管理工具通知工程团队。
- 部署控制: 提供 Managed Cloud、BYOC 和 Self-hosted 方案。
使用场景
- 调试调用错误工具或执行路径低效的多步骤 Agent。
- 在发布前比较 Prompt、Model、Retrieval 或 Agent 版本。
- 监控生产中的回答质量、延迟、Token 使用量和成本。
- 从大量用户会话中发现重复出现的失败主题。
- 从真实 Trace 构建评估 Dataset,并在 CI 中防止回归。
- 为工程与产品团队提供统一的 Agent 行为记录。
价格
LangSmith 提供适合开发和较小生产负载的免费层。付费方案会随 Trace 用量和团队需求扩展,企业部署与支持方案需单独询价。生产接入前应核对最新方案限制。
常见问题
必须使用 LangChain 或 LangGraph 吗?
不必。LangSmith 也能接入其他框架、模型 Provider SDK、OpenTelemetry 和自定义应用。
有了可观测性就能证明 Agent 正确吗?
不能。Trace 只能暴露行为,团队仍需定义有效评估器、审核代表性案例并测试真实业务结果。
哪些数据不应写入 Trace?
避免发送非必要个人数据、Credential、Secret、受监管记录和专有内容。应使用脱敏、最小权限、适当 Retention 和获批部署模式。


