首页/Langfuse
Langfuse 开源 AI 工程平台图标

Langfuse

Langfuse 是开源 AI 工程平台,用于追踪 LLM 与智能体执行、管理提示词、运行评估和实验、收集反馈,并监控质量、延迟、用量和成本。

访问网站
Langfuse 追踪视图显示智能体步骤、评估、延迟和成本

产品介绍

Langfuse 是什么?

Langfuse 是用于改进语言模型应用和 AI 智能体的开源工程平台。它捕获模型调用、检索、工具和应用步骤的分层追踪,并允许团队按用户、会话、模型、延迟、成本和元数据筛选行为,从而更容易复现故障并理解智能体为何走上异常路径。

平台还可将提示词与应用代码分开管理,支持版本与回滚,运行数据集和实验,并附加来自规则、LLM judge、用户信号或人工审核的评估分数。用户可选择 Langfuse Cloud,也可根据官方部署指南自托管。

如何使用 Langfuse

  1. 使用 SDK、OpenTelemetry、框架集成或 API 增加监测。
  2. 发送包含模型、检索、工具、会话、用户和成本上下文的追踪。
  3. 检查失败或高成本追踪,并归纳重复模式。
  4. 对提示词进行版本管理,在 Playground 或实验中比较候选版本。
  5. 从有代表性的生产案例构建数据集。
  6. 添加自动和人工评估,持续监控分数与回归。

核心功能

  • LLM 与智能体追踪: 记录嵌套调用、工具、检索、Token、延迟和成本。
  • 提示词管理: 支持提示词版本、发布、获取、缓存和回滚。
  • 评估: 支持自定义评分、LLM judge、用户反馈和人工审核。
  • 数据集与实验: 重放样本并系统比较变更。
  • 指标与监控: 跟踪质量、用量、成本和运行趋势。
  • 广泛集成: 支持常见模型 SDK、框架和 OpenTelemetry。
  • 自托管: 提供 Docker、Kubernetes 和主要云平台部署路径。

使用场景

  • 调试 AI 智能体中错误的工具调用或检索。
  • 在固定数据集上比较提示词或模型变更。
  • 按客户或功能监控生产质量、延迟和支出。
  • 收集用户和审核者反馈用于后续评估。
  • 在应用发布周期之外管理生产提示词版本。

价格

Langfuse Cloud Hobby 免费,包含每月 50,000 units、30 天数据访问、2 名用户和有限的平台功能。Core 每月 29 美元起,Pro 每月 199 美元起,Enterprise 每月 2,499 美元起,各方案包含不同用量、数据保留和安全能力。支持自托管,但基础设施和运维成本由用户承担。

常见问题

Langfuse 会运行智能体本身吗?

它的主要作用是围绕应用提供工程、可观测性、提示词管理和评估;应用与模型可以运行在其他位置。

可以评估生产追踪吗?

可以。评估可使用自动评分、LLM judge、用户反馈和人工标注。

支持自托管吗?

支持。官方文档列出 Docker、Kubernetes 和云平台部署指南。

返回产品导航

相关产品

OpenAI Codex 是面向软件开发的 AI 编程产品,适合委派边界清晰的仓库任务并审阅其代码变更。

Claude Code 是 Anthropic 的 AI 编程产品,适合通过支持的开发界面在代码库中持续迭代。

Gemini CLI 是 Google 的开源 AI 终端产品,适合本地开发与命令行工作流。

邮件订阅

持续发现实用 AI 产品

定期接收精选产品、真实使用场景和开发者动态。