首页/Foundry
Foundry 浏览器智能体模拟与评测平台标志

Foundry

Foundry 为企业 Web Agent 的训练与测试提供可复现 Browser Simulation、细粒度 Evaluation、专家数据集和强化学习环境。

访问网站

产品介绍

Foundry 是什么?

Foundry 是面向网站操作型 AI 智能体开发团队的 Simulation 与 Data Platform。Browser Agent 在 Live Site 上评测时会遇到页面变化、无法重置 Session、反自动化干扰,以及只能看到最终成功或失败等问题。Foundry 通过可复现 Browser Environment 和结构化行为记录解决这些问题。

平台整合 Simulation、Evaluation、Custom Long-horizon Dataset 和 Reinforcement Learning Infrastructure。其 Agent Web Engine 能提供 Task、重置 Environment、暴露 Browser Connection、记录 Event 与 State Mutation,并将最终状态与 Ground Truth 对比。

如何使用 Foundry

  1. 申请 Private Beta,明确目标 Browser Agent Task。
  2. 选择或创建能代表企业工作流的可复现 Environment。
  3. 通过 Foundry Python SDK 和 Browser Connection 接入现有 Agent。
  4. 重置环境、运行任务,记录 Event、State Change、Failure 和 Final Result。
  5. 根据 Ground Truth 评分,并分类 Bad Click、Layout Shift 和 Misfire 等问题。
  6. 将评测数据用于 Regression Test、Supervised Fine-tuning 或 Reinforcement Learning。

核心功能

  • 可复现 Simulation: 提供可重置 Browser Environment,降低不受控 Web Drift。
  • Action 级评测: 跟踪和分类每个 Agent Action,而非只看最终结果。
  • State 检查: 记录 Event、Final State 和 Mutation,用于 Debug 与 Scoring。
  • Custom Dataset: 由专家标注员创建长链路企业浏览任务。
  • 强化学习: 在受控环境中重复采样 Trajectory,避免 Live Site 反自动化限制。
  • Python SDK: 将 Foundry Environment 接入现有 Browser Agent Workflow。
  • Ground-truth Scoring: 将 Agent 最终状态与预期结果比较。
  • 公开 Benchmark: 提供用于比较 Browser Agent 表现的评测结果。

使用场景

  • 在稳定、可重复的企业任务上 Benchmark Browser Agent。
  • 诊断点击、导航、表单、布局与状态管理错误。
  • 为长链路 Web Workflow 生成 Supervised Fine-tuning Data。
  • 在大量受控 Trajectory 上进行 Reinforcement Learning。
  • 在发布新 Model、Prompt、Policy 或 Toolchain 前执行 Regression Test。

价格

Foundry 当前处于 Private Beta,官网未公开标准价格。团队需要申请 Access,并直接沟通 Dataset、Simulation、Evaluation 和 Training 需求。

常见问题

Foundry 是通用网站自动化智能体吗?

不是。它是用于生成数据、模拟环境、评测行为和训练 Browser Agent 的基础设施。

为什么不只在 Live Website 上评测?

Live Site 可能变化、限流、拦截自动化或产生不一致状态。可复现 Simulation 能提高比较和 Regression Test 的可靠性。

Simulation 能证明智能体在生产环境中一定安全吗?

不能。生产网站、Permission、User Data 和 Failure Mode 可能不同,团队仍需 Controlled Rollout、Security Review、Live Monitoring 和 Human Fallback。

返回产品导航

相关产品

OpenAI Codex 是面向软件开发的 AI 编程产品,适合委派边界清晰的仓库任务并审阅其代码变更。

Claude Code 是 Anthropic 的 AI 编程产品,适合通过支持的开发界面在代码库中持续迭代。

Gemini CLI 是 Google 的开源 AI 终端产品,适合本地开发与命令行工作流。

邮件订阅

持续发现实用 AI 产品

定期接收精选产品、真实使用场景和开发者动态。