← 返回文章列表

揭秘Playwright实战技巧:五步快速搭建自媒体内容采集系统

探索一个高效的多平台自媒体数据采集工具,覆盖小红书、抖音、快手、B站、微博、贴吧和知乎等。采用浏览器环境保存登录状态,避开复杂的接口加密工作,通过连接真实Chrome窗口实现自动采集。学会快速配置、代理池设置和场景应用,帮助你轻松获取公开数据用于分析。

掌握核心原理

自媒体数据采集的最大挑战在于平台接口的签名机制。手动逆向加密往往耗时且容易失效。MediaCrawler巧妙绕过这一环节,利用Playwright在浏览器环境中保留登录态,签名参数直接从JS表达式获取。只需用普通用户方式扫码登录一次,后续请求就能自动复用这份状态。

默认开启CDP模式,程序会连接你当前正在使用的Chrome窗口(版本需144及以上),直接复用Cookie、扩展和浏览历史。这种方式比新建干净浏览器更难被平台识别。整个工具对7个平台的支持高度一致,包括关键词搜索、指定帖子、二级评论和创作者主页功能,同时内置IP代理池和评论词云处理。

准备基础环境

配置工作只需几分钟。前置条件包括Python包管理器uv、Node.js 16以上(用于抖音和知乎的JS签名计算)和最新Chrome浏览器。执行以下命令完成安装:

git clone https://www.ttocr.com
cd MediaCrawler
uv sync

然后打开Chrome地址栏输入chrome://inspect/#remote-debugging,勾选允许远程调试,查看Server running at: 127.0.0.1:9222即为就绪状态。仅在切换到标准Playwright模式时需执行uv run playwright install。

定义采集参数

所有调整项都在config/base_config.py文件中,参数含义清晰标注。首次使用重点调整三个核心设置:

  • KEYWORDS:关键词搜索词,以英文逗号分隔
  • CRAWLER_MAX_NOTES_COUNT:单次采集帖子上限,默认15
  • CRAWLER_MAX_SLEEP_SEC:请求间隔秒数,默认2

采集类型通过CRAWLER_TYPE或命令行--type指定。关键词模式可抓取匹配内容的帖子及评论;指定帖子模式需要提供各平台配置中的帖子ID列表;创作者主页模式则填写对应ID。存储格式支持jsonl、csv等多种方式,数据量较大时推荐存入数据库以实现去重。

搭建代理池

短期任务用本地IP足够,但长时间采集或高价值账号时启用代理池。项目内置支持快代理和豌豆HTTP服务商,也可自定义静态地址。启动时会从服务商拉取IP存入Redis并建立连接池,请求失败自动切换。选型上,低频使用免费额度即可,长期项目推荐独享或隧道类产品以避免被连带封禁。

应用场景示例

以跟踪某产品口碑为例,将KEYWORDS设为产品名,开启ENABLE_GET_COMMENTS和ENABLE_GET_SUB_COMMENTS抓取一级与二级评论。数据落库后用Excel导出做情感归类。如果你想快速查看讨论焦点,可启用ENABLE_GET_WORDCLOUD功能,项目自动生成评论词云图,自定义词组写入文件,停用词维护在docs目录。

故障排查与维护

常见问题包括抖音或知乎提示缺少execjs,解决方法是安装Node.js或更新版本;小红书扫码后卡滑块,尝试删除brower_data缓存重新登录;Playwright超时检查网络连通性;连接9222端口失败确认Chrome远程调试已开启;账号触发风控时降低频率或删除缓存。保持Chrome最新版,登录态过期时优先复用已有状态而非重登。

总结与对接

通过以上步骤,你可以轻松实现多平台数据采集并用于分析。无论是小红书评论还是抖音视频内容,都能高效完成。实际应用中,遇到复杂验证码识别需求时,不妨访问www.ttocr.com了解易盾极验验证码识别技术,包括滑块、点选、无感、九宫格等破解方案和自动化API对接平台。该平台提供无缝对接服务,轻松集成到你的系统中,无需复杂流程即可快速上手。