产品介绍
LangWatch 是什么?
LangWatch 是用于测试、评估、观察和治理 AI Agent 的开源 LLMOps 平台。它帮助团队把生产失败转成可重复测试,检查完整执行 Trace,比较 Prompt 与 Model,并监控质量、成本、延迟和策略风险。
其 Scenario 框架可根据文字规格模拟多轮文本或语音用户。Judge 能评估包含工具与 MCP 调用的完整轨迹,开发者可在本地或 CI 中运行 Scenario。完整平台还提供离线与在线评估、OpenTelemetry 原生 Trace、Prompt 版本管理、Dataset、Red Teaming、Dashboard,以及 Cloud、Self-managed 和 Dedicated 部署。
如何使用 LangWatch
- 使用 LangWatch Cloud,或在获批环境中部署开源 Stack。
- 通过支持的 Framework Adapter、SDK、API、Proxy 或 OpenTelemetry 接入 Agent。
- 采集 Trace,并附加 Thread、User、Version 和 Environment Metadata。
- 定义 Scenario、模拟用户行为、成功标准和预期工具调用。
- 在本地与 CI 中运行测试,再检查失败回合和 Judge Reasoning。
- 从 Trace 构建 Dataset,为关键质量信号添加离线实验或线上 Monitor。
- 在采集敏感生产流量前配置 Retention、Masking、Access Control 和 Alert。
核心功能
- Agent Simulation: 以可配置用户和成功标准测试多轮文本与语音会话。
- 轨迹评估: 判断完整对话,并验证长会话中的工具使用。
- Red Teaming: 测试 Jailbreak、不安全行为、拒答和策略失效场景。
- 离线与在线评估: 支持 Batch Experiment、Production Monitor、Code Check 和 LLM Judge。
- Agent 可观测: 记录嵌套 Trace、Session、Token、成本、延迟和执行图。
- Prompt 管理: 对 Prompt 版本化,并比较 Model、质量、成本和延迟变化。
- 开放接入: 支持主流框架、Python 与 TypeScript SDK、API 和 OpenTelemetry。
- 灵活部署: 可使用 Managed Cloud、Self-managed 软件或 Enterprise Infrastructure。
使用场景
- 发布前以长时间真实对话测试客服 Agent。
- 验证 Agent 是否选择正确工具并遵守业务政策。
- 在语音 Agent 模拟中注入噪声和打断。
- 当评估分数低于约定阈值时阻止 Pull Request。
- 监控生产主题、成本、延迟、幻觉、毒性或 PII 风险。
- 将真实生产失败复现为 Scenario,防止问题再次出现。
价格
Developer 方案永久免费且无需信用卡,目前包含每月 50,000 个 Event、2 个 User、有限数量的 Scenario、Simulation 与自定义评估,以及 14 天数据访问。Growth 当前为每个 Core Seat 每月 29 欧元,并包含一定 Event 额度与用量计费。Enterprise 为定制价格。限制与费率可能变化,应以价格页为准。
常见问题
LangWatch 可以自托管吗?
可以。完整平台可运行在客户管理的基础设施上以增强数据控制,但组织仍需负责该环境的安全、更新和运维。
平台是否开源?
是。LangWatch 表示其平台采用 Apache 2.0 License,包括测试、Trace、评估、Prompt、Dataset 等核心能力。
LLM Judge 足以决定发布吗?
不足。应使用人工审核样本校准 Judge,结合确定性检查,并对高风险失败进行人工复核。


