产品介绍
Foundry 是什么?
Foundry 是面向网站操作型 AI 智能体开发团队的 Simulation 与 Data Platform。Browser Agent 在 Live Site 上评测时会遇到页面变化、无法重置 Session、反自动化干扰,以及只能看到最终成功或失败等问题。Foundry 通过可复现 Browser Environment 和结构化行为记录解决这些问题。
平台整合 Simulation、Evaluation、Custom Long-horizon Dataset 和 Reinforcement Learning Infrastructure。其 Agent Web Engine 能提供 Task、重置 Environment、暴露 Browser Connection、记录 Event 与 State Mutation,并将最终状态与 Ground Truth 对比。
如何使用 Foundry
- 申请 Private Beta,明确目标 Browser Agent Task。
- 选择或创建能代表企业工作流的可复现 Environment。
- 通过 Foundry Python SDK 和 Browser Connection 接入现有 Agent。
- 重置环境、运行任务,记录 Event、State Change、Failure 和 Final Result。
- 根据 Ground Truth 评分,并分类 Bad Click、Layout Shift 和 Misfire 等问题。
- 将评测数据用于 Regression Test、Supervised Fine-tuning 或 Reinforcement Learning。
核心功能
- 可复现 Simulation: 提供可重置 Browser Environment,降低不受控 Web Drift。
- Action 级评测: 跟踪和分类每个 Agent Action,而非只看最终结果。
- State 检查: 记录 Event、Final State 和 Mutation,用于 Debug 与 Scoring。
- Custom Dataset: 由专家标注员创建长链路企业浏览任务。
- 强化学习: 在受控环境中重复采样 Trajectory,避免 Live Site 反自动化限制。
- Python SDK: 将 Foundry Environment 接入现有 Browser Agent Workflow。
- Ground-truth Scoring: 将 Agent 最终状态与预期结果比较。
- 公开 Benchmark: 提供用于比较 Browser Agent 表现的评测结果。
使用场景
- 在稳定、可重复的企业任务上 Benchmark Browser Agent。
- 诊断点击、导航、表单、布局与状态管理错误。
- 为长链路 Web Workflow 生成 Supervised Fine-tuning Data。
- 在大量受控 Trajectory 上进行 Reinforcement Learning。
- 在发布新 Model、Prompt、Policy 或 Toolchain 前执行 Regression Test。
价格
Foundry 当前处于 Private Beta,官网未公开标准价格。团队需要申请 Access,并直接沟通 Dataset、Simulation、Evaluation 和 Training 需求。
常见问题
Foundry 是通用网站自动化智能体吗?
不是。它是用于生成数据、模拟环境、评测行为和训练 Browser Agent 的基础设施。
为什么不只在 Live Website 上评测?
Live Site 可能变化、限流、拦截自动化或产生不一致状态。可复现 Simulation 能提高比较和 Regression Test 的可靠性。
Simulation 能证明智能体在生产环境中一定安全吗?
不能。生产网站、Permission、User Data 和 Failure Mode 可能不同,团队仍需 Controlled Rollout、Security Review、Live Monitoring 和 Human Fallback。

