Puppeteer-Cluster 的隐秘性是否足以通过机器人测试？

2023-12-02

我想知道使用 Puppeteer-Cluster 的人是否可以详细说明 Cluster.Launch({settings}) 如何防止在不同上下文的页面之间共享 cookie 和 Web 数据。

执行浏览器上下文here，实际上阻止cookie并且用户数据不被共享或跟踪？无浏览器现在臭名昭著的页面似乎认为不，here并且 .launch({}) 应该在任务上调用，而不是在队列之前调用。

所以我的问题是，我们如何知道 puppeteer-cluster 是否在排队任务之间共享 cookie/数据？库中有哪些选项可以降低被标记为机器人的机会？

设置：我将 page.authenticate 与代理服务、随机用户代理一起使用，但我执行测试的站点偶尔仍然会被阻止（403）。

async function run() {
// Create a cluster with 2 workers
  const cluster = await Cluster.launch({
    concurrency: Cluster.CONCURRENCY_BROWSER, //Cluster.CONCURRENCY_PAGE,
    maxConcurrency: 2, //5, //25, //the number of chromes open
    monitor: false, //true,
    puppeteerOptions: {
      executablePath,
      args: [
        "--proxy-server=pro.proxy.net:2222",
        "--incognito",
        "--disable-gpu",
        "--disable-dev-shm-usage",
        "--disable-setuid-sandbox",
        "--no-first-run",
        "--no-sandbox",
        "--no-zygote"
      ],
      headless: false,
      sameDomainDelay: 1000,
      retryDelay: 3000,
      workerCreationDelay: 3000
    }
  });

   // Define a task 
      await cluster.task(async ({ page, data: url }) => {
         extract(url, page); //call the extract
      });

   //task
      const extract = async ({ page, data: dataJson }) => {
         page.setExtraHTTPHeaders({headers})

         await page.authenticate({
           username: proxy_user, 
           password: proxy_pass
         });

       //Randomized Delay
         await delay(2000 + (Math.floor(Math.random() * 998) + 1));

         const response = await page.goto(dataJson.Url);
 }

//loop over inputs, and queue them into cluster
  var dataJson = {
      url: url
      };

  cluster.queue(dataJson, extract);

 }

 // Shutdown after everything is done
 await cluster.idle();
 await cluster.close();

}

直接回答

作者puppeteer-cluster这里。该库不会主动阻止 cookie，而是利用browser.createIncognitoBrowserContext():

创建新的隐身浏览器上下文。这不会与其他浏览器上下文共享 cookie/缓存。

此外，文档指出“隐身浏览器上下文不会将任何浏览数据写入磁盘”（source），以便重新启动浏览器cannot重用磁盘上的所有 cookie，因为没有写入任何数据。

对于库，这意味着当执行作业时，会创建一个新的隐身上下文，该上下文不与其他上下文共享任何数据（cookie 等）。因此，只要 Chromium 正确实现隐身浏览器上下文，作业之间就不会共享数据。

您链接的页面仅讨论browser.newPage()（在页面之间共享 cookie）而不是关于隐身上下文。

为什么网站可能会将您识别为机器人

有些网站仍然会阻止您，因为它们使用不同的措施来检测机器人。有无头浏览器检测测试以及指纹库，如果用户代理与浏览器指纹不匹配，它们可能会将您报告为机器人。您可能感兴趣这个答案我提供了一些更详细的解释这些指纹如何工作。

您可以尝试使用类似的库puppeteer-extra带有一个stealth插件来帮助您解决问题。然而，这基本上是一场猫捉老鼠的游戏。指纹识别测试可能会发生变化，或者其他站点可能会使用不同的“检测”机制。总而言之，没有办法保证网站不会检测到您。

如果你想使用puppeteer-extra，请注意，您可以将它与puppeteer-cluster (示例代码).

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系:hwhale#tublm.com(使用前将#替换为@)