产品介绍
Scrape.do 是什么?
Scrape.do 是用于大规模收集公共网站数据的 API 优先网页抓取服务。其 AI 和 LLM 场景覆盖论坛、文章、评论、研究来源、知识图谱和网站元数据。调用方发送 URL,即可获得渲染内容,用于本地脚本或生产数据管道。
服务代为管理住宅、移动和数据中心代理、浏览器请求头、TLS 指纹、验证码、地理定位和反爬系统。默认输出原始 HTML,也可通过参数返回适合模型和数据流程的 Markdown 或 JSON。
如何使用 Scrape.do
- 创建账户并获取 API 凭据。
- 通过抓取 API 发送目标公共 URL。
- 配置渲染、地区、代理和反爬要求。
- 选择 HTML、Markdown 或 JSON 输出。
- 需要去重时加入 URL 标准化、内容哈希或选择器。
- 将结果送入分析、训练或检索管道。
核心功能
- 网页抓取 API: 通过语言无关 API 获取公共网页。
- 渲染内容: 使用浏览器基础设施处理 JavaScript 页面。
- 代理网络: 使用多个国家的住宅、移动和数据中心 IP。
- 反爬处理: 支持 WAF 绕过、验证码、请求头和 TLS 指纹。
- 地理定位: 从选定地区请求内容。
- 模型格式: 除 HTML 外还可返回 Markdown 或 JSON。
使用场景
- LLM 数据集: 收集公开的领域文本用于训练或微调。
- RAG 导入: 抓取网站内容供检索系统使用。
- 市场数据: 获取电商、旅游、房地产、金融和营销数据。
- 公共网页监控: 无需维护代理基础设施即可定期获取内容。
价格
新账户无需信用卡即可获得 1,000 个免费额度。
常见问题
Scrape.do 能返回 Markdown 吗?
可以。输出参数可选择 Markdown 或 JSON,而非原始 HTML。
能接入训练管道吗?
可以。API 与语言无关,可连接本地脚本或生产导入流程。


