首页/LangWatch
LangWatch 开源 AI Agent 测试与 LLMOps 平台标志

LangWatch

LangWatch 是开源 LLMOps 平台,提供 Agent Simulation、评估、可观测、Prompt 管理、Red Teaming 和 AI Governance。

访问网站
LangWatch Agent Simulation、评估、Trace、Prompt 与治理 Dashboard

产品介绍

LangWatch 是什么?

LangWatch 是用于测试、评估、观察和治理 AI Agent 的开源 LLMOps 平台。它帮助团队把生产失败转成可重复测试,检查完整执行 Trace,比较 Prompt 与 Model,并监控质量、成本、延迟和策略风险。

其 Scenario 框架可根据文字规格模拟多轮文本或语音用户。Judge 能评估包含工具与 MCP 调用的完整轨迹,开发者可在本地或 CI 中运行 Scenario。完整平台还提供离线与在线评估、OpenTelemetry 原生 Trace、Prompt 版本管理、Dataset、Red Teaming、Dashboard,以及 Cloud、Self-managed 和 Dedicated 部署。

如何使用 LangWatch

  1. 使用 LangWatch Cloud,或在获批环境中部署开源 Stack。
  2. 通过支持的 Framework Adapter、SDK、API、Proxy 或 OpenTelemetry 接入 Agent。
  3. 采集 Trace,并附加 Thread、User、Version 和 Environment Metadata。
  4. 定义 Scenario、模拟用户行为、成功标准和预期工具调用。
  5. 在本地与 CI 中运行测试,再检查失败回合和 Judge Reasoning。
  6. 从 Trace 构建 Dataset,为关键质量信号添加离线实验或线上 Monitor。
  7. 在采集敏感生产流量前配置 Retention、Masking、Access Control 和 Alert。

核心功能

  • Agent Simulation: 以可配置用户和成功标准测试多轮文本与语音会话。
  • 轨迹评估: 判断完整对话,并验证长会话中的工具使用。
  • Red Teaming: 测试 Jailbreak、不安全行为、拒答和策略失效场景。
  • 离线与在线评估: 支持 Batch Experiment、Production Monitor、Code Check 和 LLM Judge。
  • Agent 可观测: 记录嵌套 Trace、Session、Token、成本、延迟和执行图。
  • Prompt 管理: 对 Prompt 版本化,并比较 Model、质量、成本和延迟变化。
  • 开放接入: 支持主流框架、Python 与 TypeScript SDK、API 和 OpenTelemetry。
  • 灵活部署: 可使用 Managed Cloud、Self-managed 软件或 Enterprise Infrastructure。

使用场景

  • 发布前以长时间真实对话测试客服 Agent。
  • 验证 Agent 是否选择正确工具并遵守业务政策。
  • 在语音 Agent 模拟中注入噪声和打断。
  • 当评估分数低于约定阈值时阻止 Pull Request。
  • 监控生产主题、成本、延迟、幻觉、毒性或 PII 风险。
  • 将真实生产失败复现为 Scenario,防止问题再次出现。

价格

Developer 方案永久免费且无需信用卡,目前包含每月 50,000 个 Event、2 个 User、有限数量的 Scenario、Simulation 与自定义评估,以及 14 天数据访问。Growth 当前为每个 Core Seat 每月 29 欧元,并包含一定 Event 额度与用量计费。Enterprise 为定制价格。限制与费率可能变化,应以价格页为准。

常见问题

LangWatch 可以自托管吗?

可以。完整平台可运行在客户管理的基础设施上以增强数据控制,但组织仍需负责该环境的安全、更新和运维。

平台是否开源?

是。LangWatch 表示其平台采用 Apache 2.0 License,包括测试、Trace、评估、Prompt、Dataset 等核心能力。

LLM Judge 足以决定发布吗?

不足。应使用人工审核样本校准 Judge,结合确定性检查,并对高风险失败进行人工复核。

返回产品导航

相关产品

OpenAI Codex 是面向软件开发的 AI 编程产品,适合委派边界清晰的仓库任务并审阅其代码变更。

Claude Code 是 Anthropic 的 AI 编程产品,适合通过支持的开发界面在代码库中持续迭代。

Gemini CLI 是 Google 的开源 AI 终端产品,适合本地开发与命令行工作流。

邮件订阅

持续发现实用 AI 产品

定期接收精选产品、真实使用场景和开发者动态。