
现代爬虫技术中,模拟人类行为已成为绕过反爬虫系统的关键策略之一。无论是模拟用户点击、滚动,还是鼠标的轨迹移动,都可以为爬虫脚本带来更高的“伪装性”。在众多的自动化工具中,Puppeteer作为一个无头浏览器控制库,以其强大的功能和灵活的 API 赢得了开发者的青睐。
本文将深入探讨 Puppeteer 如何通过X 和 Y 坐标精准实现鼠标移动,并结合实际案例展示如何采集小红书网站的内容。在此过程中,我们还将运用代理 IP 技术、设置 cookie 和 user-agent,模拟一个更加“真实”的用户环境。
在爬取小红书等具备强大反爬能力的网站时,仅简单发送 HTTP 请求已不足以满足需求。网站可能会通过以下方式检测爬虫:
这就要求我们在代码中实现:
Puppeteer 提供了 page.mouse.move(x, y, options) 方法来实现鼠标移动。结合一定的随机性,我们可以模拟真实用户的鼠标行为,避免直线轨迹暴露爬虫的本质。
使用代理 IP 技术能够有效地绕过 IP 限制。本文将参考爬虫代理的服务,通过配置代理服务器的地址、端口、用户名和密码,让 Puppeteer 的请求看起来更真实。
以下是完整的代码实现,包含代理 IP、Cookie、User-Agent 的设置,以及鼠标移动的模拟。
const puppeteer = require('puppeteer');
// 配置代理IP信息 16yun爬虫代理
const proxy = {
host: '代理服务器域名', // 替换为16yun爬虫代理提供的域名
port: '代理服务器端口', // 替换为16yun爬虫代理提供的端口
username: '用户名', // 替换为16yun爬虫代理提供的用户名
password: '密码', // 替换为16yun爬虫代理提供的密码
};
// 自定义 Cookie 和 User-Agent
const cookies = [
{
name: 'test_cookie',
value: 'test_value',
domain: 'xiaohongshu.com',
path: '/',
},
];
const userAgent = 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/113.0.0.0 Safari/537.36';
(async () => {
// 启动 Puppeteer,并设置代理
const browser = await puppeteer.launch({
headless: false, // 可设置为 true 来启用无头模式
args: [
`--proxy-server=http://${proxy.host}:${proxy.port}`, // 配置代理
],
});
const page = await browser.newPage();
// 设置认证代理
await page.authenticate({
username: proxy.username,
password: proxy.password,
});
// 设置 User-Agent
await page.setUserAgent(userAgent);
// 设置 Cookie
await page.setCookie(...cookies);
// 打开小红书主页
await page.goto('https://www.xiaohongshu.com', {
waitUntil: 'networkidle2',
});
// 模拟鼠标移动
console.log('模拟鼠标移动...');
await page.mouse.move(100, 100); // 从点 (100, 100) 开始
await page.waitForTimeout(500); // 等待 500 毫秒
await page.mouse.move(200, 200, { steps: 20 }); // 平滑移动到点 (200, 200)
// 获取页面内容
const content = await page.evaluate(() => document.body.innerText);
console.log('页面内容:', content);
// 关闭浏览器
await browser.close();
})();--proxy-server 参数以及 page.authenticate 方法,完成代理 IP 的配置。mouse.move 方法,通过动态坐标和步数实现平滑移动,模仿人类操作。通过结合 Puppeteer 的强大功能,我们不仅实现了对 X 和 Y 坐标的鼠标轨迹模拟,还在代码中整合了代理 IP 技术、Cookie 和 User-Agent 的设置。这些手段有效提升了爬虫的伪装性,使其能够成功应对小红书等具有强大反爬机制的网站。
下一步是什么? 你可以尝试进一步优化鼠标轨迹,使其更加随机,或结合键盘输入模拟,实现更加全面的行为伪装。技术无止境,挑战才刚刚开始!
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。