8 min

如何将 AdsCrawl 与 Bright Data 配合使用:设置与工作流程

了解如何将 AdsCrawl 的真实浏览器 API 与 Bright Data 的代理网络和 Web Unlocker 结合,实现大规模抓取、截图和自动化。

AAnonymous

如何将 AdsCrawl 与 Bright Data 配合使用:设置与工作流程

AdsCrawl 通过一个 API 为你提供真实的云端浏览器:截图、HTML、Markdown 以及完整的 Chrome DevTools 协议(CDP)会话。Bright Data 提供网络层,让这些浏览器会话看起来像是来自几乎任何地方的真实用户。两者结合,解决了单独使用任一工具都无法解决的问题:可靠、大规模地采集那些依赖 JavaScript 渲染、能抵抗封锁并返回干净数据的公共网页。

本指南将介绍这两个产品如何配合、如何连接它们,以及这种组合在哪些场景下能带来收益。

为什么要结合 AdsCrawl 和 Bright Data?

Bright Data product interface

Bright Data product interface.

Bright Data 产品界面。

AdsCrawl 是浏览器基础设施。它在云端运行 Chrome 会话,管理指纹配置文件,并通过统一的 API 暴露一切,支持 cURL、Node.js 或 Python 调用。Bright Data 是一个网络数据平台:覆盖 195 个国家、超过 4 亿 IP 的代理网络,即时抓取器 API,用于处理 CAPTCHA 和轮换的 Web Unlocker,以及针对 Google、Bing 和 DuckDuckGo 的 SERP API。

职责划分很清晰:

  • AdsCrawl 负责浏览器。 渲染、JavaScript 执行、页面状态、截图、DOM 提取和 CDP 控制。
  • Bright Data 负责网络。 IP 轮换、地理定位、CAPTCHA 解决和解除封锁逻辑。

如果只使用 AdsCrawl,你能获得准确的渲染,但流量仍然来自有限的 IP 集合。如果只使用 Bright Data,你能获得解除封锁能力,但可能无法获得复杂页面所需的完整交互式浏览器控制。将它们叠加使用,意味着每一层都发挥其最擅长的作用。

集成如何工作

Bright Data product interface

Bright Data product interface.

Bright Data 产品界面。

AdsCrawl 允许你通过上游代理路由浏览器流量。Bright Data 将其代理网络暴露为标准 HTTP 或 HTTPS 端点,使用用户名/密码认证。你将 AdsCrawl 指向 Bright Data 端点,AdsCrawl 启动的每个浏览器会话都会通过 Bright Data 的网络出口。

流程如下:

  1. 你的应用程序调用 AdsCrawl API,传入目标 URL 和代理配置。
  2. AdsCrawl 启动一个带有指纹配置文件的云浏览器会话。
  3. 该会话通过 Bright Data 的代理端点路由出站流量。
  4. Bright Data 选择一个出口 IP(可选地理定位)并处理解除封锁。
  5. AdsCrawl 渲染页面,等待你指定的状态,并返回 HTML、Markdown、截图或实时 CDP 会话。

由于 AdsCrawl 支持并发浏览器执行,你可以并行运行许多这样的会话,每个会话都有自己的代理配置。

设置步骤

第 1 步:获取 AdsCrawl API 密钥

登录 AdsCrawl,打开仪表板,生成 API 密钥。仪表板还显示使用跟踪和调试工具,这在调整代理设置时非常有用。

第 2 步:获取 Bright Data 代理凭据

在 Bright Data 控制面板中,创建一个代理区域。你将获得主机、端口、用户名和密码。记下区域名称——Bright Data 将其作为用户名的一部分,用于将流量路由到正确的池。

第 3 步:将代理传递给 AdsCrawl

创建浏览器会话时,在请求中包含代理详细信息。以下是一个简化的 Node.js 示例:

const response = await fetch("https://api.adscrawl.com/v1/sessions", {
  method: "POST",
  headers: {
    "Authorization": "Bearer YOUR_ADSCRAWL_KEY",
    "Content-Type": "application/json"
  },
  body: JSON.stringify({
    url: "https://example.com/product/123",
    proxy: {
      server: "http://brd.superproxy.io:22225",
      username: "brd-customer-XXXX-zone-residential",
      password: "YOUR_BRIGHTDATA_PASSWORD"
    },
    waitUntil: "networkidle",
    format: "markdown"
  })
});

const data = await response.json();
console.log(data.markdown);

确切的端点和字段名称取决于你的 AdsCrawl 计划和 API 版本——请查看仪表板文档以获取当前架构。跨语言的原则相同:将 Bright Data 端点作为代理服务器传递,并将区域凭据作为认证信息。

第 4 步:在需要时添加地理定位

Bright Data 通过用户名字符串支持国家和城市级别的定位。如果你要检查页面在德国与美国用户眼中的渲染效果,请在代理用户名中设置国家代码,让 AdsCrawl 捕获结果。这样你无需离开自己的机器就能验证本地化定价、货币或内容。

第 5 步:捕获你需要的内容

AdsCrawl 可以返回:

  • HTML,用于使用现有工具进行解析。
  • Markdown,用于输入 LLM 或文档管道。
  • 截图,用于视觉回归检查或证据捕获。
  • CDP 会话,当你需要点击、滚动、填写表单或等待特定事件时。

选择与你的下游消费者匹配的输出。如果你正在构建需要干净文本的 AI 代理,Markdown 通常是正确选择。如果你正在监控页面的视觉变化,截图则是。

实际示例

如何将 AdsCrawl 与 Bright Data 配合使用:设置与工作流程 - 实际示例

如何将 AdsCrawl 与 Bright Data 配合使用:设置与工作流程 - 实际示例.

示例 1:跨区域价格监控

一个跨境电商团队想要跟踪竞争对手在五个国家的定价。他们为每个国家创建一个 AdsCrawl 会话,每个会话通过具有不同国家代码的 Bright Data 代理区域路由。AdsCrawl 返回渲染后的 HTML,解析器提取价格。由于 Bright Data 轮换 IP 并处理封锁,团队无需维护自己的代理池。

示例 2:AI 代理研究管道

一个 AI 代理需要阅读通过 JavaScript 加载内容的公共文档和产品页面。代理调用 AdsCrawl 并传入 URL,获得 Markdown,然后传递给语言模型。Bright Data 在底层运行,防止请求被限速或封锁。这与 MCP Server 解释:AI 代理如何连接真实工具 中描述的模式相同,其中代理需要可靠地访问真实网络数据,而不是缓存的快照。

示例 3:SEO 和 SERP 跟踪

一个增长团队使用 Bright Data 的 SERP API 拉取目标关键词的搜索结果,然后使用 AdsCrawl 渲染排名靠前的页面并捕获其结构。SERP API 提供列表;AdsCrawl 提供页面状态。如果你正在将这种技术栈与替代方案进行比较,AdsCrawl vs Browserless vs ScrapingBee:哪个 API 胜出? 分解了其中的权衡。

示例 4:视觉回归测试

一个前端团队每晚通过 AdsCrawl 对关键页面进行截图,每个会话通过不同的 Bright Data IP 路由。他们对截图进行差异比较以捕捉布局问题。Bright Data 的轮换防止测试套件被标记为机器人流量。

这种组合解决了哪些问题?

  • 封锁和 CAPTCHA。 Bright Data 的 Web Unlocker 自动处理这些,因此 AdsCrawl 会话不会在挑战页面上失败。
  • 地理限制内容。 你可以看到页面在几乎任何国家的样子,而无需维护自己的基础设施。
  • JavaScript 密集型页面。 AdsCrawl 在提取前完全渲染页面,因此你获得的是最终 DOM,而不是初始 HTML。
  • 规模。 AdsCrawl 的并发会话加上 Bright Data 的 IP 池让你可以并行运行许多请求,而不会触及速率限制。
  • 为 AI 提供干净输出。 Markdown 提取意味着你不必编写自己的 HTML 转文本管道。

何时使用此技术栈(以及何时不使用)

在以下情况下使用 AdsCrawl + Bright Data:

  • 页面需要 JavaScript 渲染。
  • 你需要地理定位结果。
  • 你遇到封锁或 CAPTCHA。
  • 你想要干净的 Markdown 或截图,而不仅仅是原始 HTML。
  • 你正在将数据输入 AI 代理或监控管道。

在以下情况下考虑更简单的设置:

  • 目标网站是静态 HTML,不会阻止请求。
  • 你只需要一次性抓取。
  • 你已经拥有信任的代理池,只需要浏览器渲染。

如果你正在更广泛地评估浏览器自动化平台,AdsCrawl vs Scrapfly vs Playwright:哪个适合你的技术栈? 涵盖了托管 API 在哪些方面优于自托管框架。

相关阅读

来源与进一步阅读

常见问题

如果我已经使用 AdsCrawl,还需要 Bright Data 吗?

不一定。AdsCrawl 对许多页面可以独立工作。当你遇到封锁、需要地理定位或希望在不管理自己的代理基础设施的情况下扩展时,Bright Data 就变得有价值。

我可以将其他代理提供商与 AdsCrawl 一起使用吗?

AdsCrawl 接受标准 HTTP/HTTPS 代理端点,因此任何提供此类端点的提供商都可以使用。Bright Data 因其 IP 池规模和解封功能而成为常见选择。

Bright Data 会取代 AdsCrawl 的浏览器渲染吗?

不会。Bright Data 在某些产品中具有自己的渲染能力,但 AdsCrawl 的优势在于通过 CDP 实现完整的浏览器控制、指纹配置文件以及 Markdown 和截图等结构化输出。两者是互补的。

如何调试失败的会话?

使用 AdsCrawl 仪表板的调试工具检查会话。检查失败是在网络层(代理认证、IP 被封锁)还是渲染层(页面未加载、选择器缺失)。Bright Data 的控制面板显示代理级别的日志。

这种设置适合 AI 代理吗?

是的。这种组合非常适合需要实时、渲染后的网络数据的代理。AdsCrawl 返回易于模型消费的 Markdown,而 Bright Data 保持请求的可靠性。

结论

AdsCrawl 和 Bright Data 解决了同一个问题的不同部分。AdsCrawl 为你提供具有结构化输出和完整 CDP 控制的真实浏览器。Bright Data 为你提供网络、解封和地理定位,使大规模采集成为可能。将它们连接起来只需几个配置步骤:获取 AdsCrawl 密钥,创建 Bright Data 代理区域,将代理凭据传入你的 AdsCrawl 会话请求,并选择输出格式。

从那里开始,这种组合可以从单张截图扩展到并发会话集群,为 AI 代理、监控仪表板和 SEO 管道提供数据。从一个目标页面开始,确认代理路由正确,然后扩展。

有关此技术栈与替代方案比较的更多背景信息,请参阅 AdsCrawl vs ParseHub:API 浏览器自动化还是可视化抓取器?