首页/LangSmith
LangSmith AI Agent 可观测与评估平台标志

LangSmith

LangSmith 是与框架无关的 LLM 应用与 AI Agent 可观测、监控、评估和调试平台,覆盖开发测试与生产运行。

访问网站
LangSmith AI Agent Trace、监控、评估与调试工作台

产品介绍

LangSmith 是什么?

LangSmith 是面向 LLM 应用和 AI Agent 团队的可观测与评估平台。它记录 Agent 运行中的每一步,让开发者检查 Prompt、模型调用、工具使用、检索、延迟、成本、输出和会话 Thread,而不是只根据最终回答排查问题。

该平台不绑定特定框架,可接入 LangChain、LangGraph、OpenAI 或 Anthropic SDK、Vercel AI SDK、LlamaIndex、自定义技术栈和 OpenTelemetry。生产监控把 Trace 与在线评估器、Dashboard、Alert、主题聚类、错误分析和面向 Agent 查询的 Trace 数据库结合起来。

如何使用 LangSmith

  1. 创建 Project,并根据数据政策选择 Cloud、BYOC 或 Self-hosted 部署。
  2. 为应用加入对应 SDK 或 OpenTelemetry Instrumentation。
  3. 将相关运行归入 Thread,并附加环境、版本、用户分群或实验等 Metadata。
  4. 检查 Trace 中的工具调用失败、检索质量、延迟、Token 成本和异常执行路径。
  5. 添加 Code Evaluator 或 LLM-as-a-judge,对生产流量持续评估。
  6. 为回归配置 Dashboard 和 Alert,再把典型失败样本转成 Dataset 与可重复测试。
  7. 接入生产数据前先脱敏或排除敏感输入,并确认 Retention、Access 和区域托管控制。

核心功能

  • 端到端 Trace: 展示模型、检索、工具和 Agent 的嵌套步骤,以及输入、输出、延迟和成本。
  • 框架无关接入: 支持主流 Agent Framework、模型 SDK、自定义应用和 OpenTelemetry。
  • 生产监控: 实时跟踪 Agent 质量和运行指标。
  • 在线评估: 用代码规则或 LLM Judge 评估实时流量与会话轨迹。
  • Trace 搜索: 通过 SmithDB 按全文、JSON Path、Metadata 和 Agent Path 过滤。
  • 自动洞察: 聚类会话主题并暴露重复错误。
  • 告警集成: 通过 Webhook 和事故管理工具通知工程团队。
  • 部署控制: 提供 Managed Cloud、BYOC 和 Self-hosted 方案。

使用场景

  • 调试调用错误工具或执行路径低效的多步骤 Agent。
  • 在发布前比较 Prompt、Model、Retrieval 或 Agent 版本。
  • 监控生产中的回答质量、延迟、Token 使用量和成本。
  • 从大量用户会话中发现重复出现的失败主题。
  • 从真实 Trace 构建评估 Dataset,并在 CI 中防止回归。
  • 为工程与产品团队提供统一的 Agent 行为记录。

价格

LangSmith 提供适合开发和较小生产负载的免费层。付费方案会随 Trace 用量和团队需求扩展,企业部署与支持方案需单独询价。生产接入前应核对最新方案限制。

常见问题

必须使用 LangChain 或 LangGraph 吗?

不必。LangSmith 也能接入其他框架、模型 Provider SDK、OpenTelemetry 和自定义应用。

有了可观测性就能证明 Agent 正确吗?

不能。Trace 只能暴露行为,团队仍需定义有效评估器、审核代表性案例并测试真实业务结果。

哪些数据不应写入 Trace?

避免发送非必要个人数据、Credential、Secret、受监管记录和专有内容。应使用脱敏、最小权限、适当 Retention 和获批部署模式。

返回产品导航

相关产品

OpenAI Codex 是面向软件开发的 AI 编程产品,适合委派边界清晰的仓库任务并审阅其代码变更。

Claude Code 是 Anthropic 的 AI 编程产品,适合通过支持的开发界面在代码库中持续迭代。

Gemini CLI 是 Google 的开源 AI 终端产品,适合本地开发与命令行工作流。

邮件订阅

持续发现实用 AI 产品

定期接收精选产品、真实使用场景和开发者动态。