产品介绍
Self-Operating Computer 是什么?
Self-Operating Computer 是开源框架,让多模态模型像人一样通过视觉输入以及鼠标、键盘输出操作桌面。模型查看屏幕截图、决定一系列动作,并重复执行直至完成目标。仓库将 2023 年 11 月的版本描述为较早的完整计算机使用案例之一。
如何使用 Self-Operating Computer
- 安装 Python 包或克隆仓库。
- 配置所选多模态模型的 API 凭据。
- 在 macOS 上授予终端录屏和辅助功能权限。
- 运行
operate并提供任务目标。 - 按需选择其他模型、语音输入、OCR 或 Set-of-Mark 模式。
核心功能
- 屏幕理解: 将当前屏幕交给多模态模型。
- 鼠标键盘动作: 执行模型选择的桌面交互。
- 多模型: 列出 GPT-4o、GPT-4.1、o1、Gemini Pro Vision、Claude 3、Qwen-VL 和 LLaVA。
- 语音目标: 通过可选音频依赖接收口述任务。
- OCR 模式: 将可见文本映射为可点击坐标。
- Set-of-Mark: 添加检测到的视觉标记以改善定位。
使用场景
- 计算机使用研究: 比较视觉模型规划和执行桌面任务的方式。
- 桌面自动化: 为现有图形应用原型化自动流程。
- 模型评估: 使用相同操作循环测试不同多模态模型。
- 本地实验: 通过 Ollama 运行 LLaVA;仓库提醒其错误率较高。
价格
框架开源,用户自行承担模型 API 额度。
常见问题
支持哪些操作系统?
仓库列出 macOS、Windows 和带 X server 的 Linux。
支持本地模型吗?
支持。仓库将通过 Ollama 运行 LLaVA 作为实验选项。


