产品介绍
Agenta 是什么?
Agenta 是面向 LLM 应用和智能体开发团队的开源 LLMOps 平台,把提示词管理、评估、可观测性、调试和反馈整合到一个工作流,让产品经理、开发者和领域专家可以基于同一信息来源协作。
平台旨在用带版本的实验和可测量评估替代散落的提示词与非正式测试。团队可以比较提示词和模型、保留版本历史、执行自动或人工评估、追踪应用请求、把生产链路转成测试,并通过在线评估监控回归。
如何使用 Agenta
- 添加提示词变体,并在统一 Playground 中并排比较提示词或模型。
- 保存提示词版本,让团队追踪修改并可回到之前配置。
- 构建测试集,使用内置评估器、LLM-as-a-judge、自定义代码或领域专家反馈验证变更。
- 追踪生产请求,与团队标注失败或收集用户反馈。
- 把有价值的链路记录转换为测试,并使用实时评估监控生产表现。
核心功能
- 提示词 Playground: 在共享环境中并排比较提示词和模型。
- 完整版本历史: 记录提示词变化,便于追踪实验和配置。
- 模型无关工作流: 支持不同提供商的模型,不把流程绑定到单一厂商。
- 系统化评估: 使用内置、LLM、自定义代码和人工评估器执行可重复实验。
- 完整链路评估: 检查智能体或 LLM 应用执行中的中间步骤,而不仅是最终回答。
- 可观测性与反馈: 追踪请求、标注失败、收集反馈并监控回归。
使用场景
- 提示词协作: 产品经理、开发者和专家共同迭代提示词版本。
- 发布验证: 团队在上线前用测试集比较更新后的提示词或模型。
- 智能体调试: 工程师检查链路中间步骤,定位错误结果的来源。
- 回归监控: 运维团队通过在线评估发现应用表现下降。
- 反馈驱动测试: 团队把用户反馈或生产中的问题链路转换为可复现测试。
常见问题
Agenta 是开源的吗?
是。Agenta 将自己描述为开源 LLMOps 平台,并提供公共 GitHub 项目。
Agenta 可以评估智能体链路吗?
可以。官网说明团队可评估智能体推理的中间步骤,而不仅是最终输出。
Agenta 支持不同模型提供商吗?
支持。Agenta 将其提示词工作流设计为模型无关。


