产品介绍
Athina AI 是什么?
Athina AI 是面向语言模型生产功能团队的协作式 AI 开发平台。它把提示词管理、数据集、评估、原型和监测放在同一环境中,让技术与非技术成员共同查看实验和结果。团队可在托管或自定义模型上运行提示词,并比较不同变更对输出质量的影响。
平台提供 50 多种预设评估,同时支持自定义评估器。用户可在更换模型、提示词或检索器后重新生成数据集,标注样本,比较数据集和 SQL 结果,并在程序调用前搭建多步骤链原型。这些能力让 AI 行为在整个开发过程中可测试、可审查。
核心功能
- 提示词管理: 存储、运行并比较不同 AI 功能使用的提示词。
- 模型灵活性: 在支持的托管模型或团队自定义模型连接上测试提示词。
- 预设与自定义评估: 提供 50 多种现成检查,并可定义项目专用评估器。
- 数据集重新生成: 在模型、提示词或检索设置改变后重新运行样本。
- 标注与比较: 协作者可标记样本,并比较数据集、输出和 SQL 结果。
- 链式原型: 在应用代码调用前构建并测试多步骤 AI 工作流。
使用场景
- 提示词回归测试: 检查提示词变更是否改善目标样本且未破坏其他行为。
- 模型比较: 在多个模型上运行相同任务并比较评估结果。
- 检索实验: 更改检索组件后重新生成数据集并检查影响。
- 跨职能评审: 产品、领域和工程成员共同标注输出并判断质量。
- AI 功能监测: 观察已部署行为,并把生产问题带回开发过程。
常见问题
Athina AI 能评估自定义标准吗?
可以。官网介绍了 50 多种预设评估和自定义评估器。
能比较不同模型和提示词吗?
可以。平台支持跨模型运行提示词,并通过数据集与评估比较结果。

