← 返回文章列表

30分钟上手多平台数据采集:MediaCrawler 小红书抖音实战教程

MediaCrawler 是一款开源工具,专为竞品分析和数据调研设计,支持小红书笔记评论、抖音视频反馈等平台。无需手动逆向签名,首次使用只需浏览器扫码登录。教程覆盖环境准备、配置关键参数、数据存储和代理设置,适合新手快速跑通采集任务。掌握后可高效获取结构化数据,便于后续分析。

为什么要选择这个工具采集数据

很多人在分析品牌在社交平台上的表现时,都会遇到同一个难题。想看某款产品在小红书上是怎么被用户讨论的,只能一点点手动翻笔记。或者想统计抖音视频下面的真实用户反馈,复制粘贴评论简直要花上一整天时间。MediaCrawler 就专门解决这些麻烦,它能覆盖小红书、抖音、快手、B 站、微博、贴吧和知乎等多个平台。输入关键词后,一条命令就能拿到结构化的笔记、评论等数据。这个工具的核心思路很简单,就是先用浏览器把登录态保存下来,然后直接调用接口,不需要自己动手破解那些复杂的签名校验。

对于新手来说,这种方式特别友好。整个过程被压缩得非常紧凑,第一次操作通常能在半小时内完成。你不需要去研究前端的加密逻辑或者写一堆复杂的校验代码。登录后,程序会自动帮你翻页抓取内容,方便后续处理。

环境准备简单三步搞定

要运行这个工具,你需要一台支持 Python 3.8 以上版本和 Node.js 16 以上的机器。Python 环境推荐用 uv 来管理,这样安装依赖就很方便。打开终端,执行以下命令克隆仓库并安装所有包:

git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler
cd MediaCrawler
uv sync

这条命令会一次性拉取所有必要依赖,还会锁定版本,减少以后升级时出现的冲突问题。安装完成后,你可以直接运行程序,数据库表会在采集时自动创建,不用额外初始化。

程序默认会连接你本地已经打开的 Chrome 浏览器,这样能直接复用已经登录过的状态和插件,比新建一个干净的浏览器环境更不容易被检测到。想要切换到独立模式,可以在配置文件里把开启 CDP 模式的选项设为关闭,然后执行安装独立浏览器命令。

第一次采集小红书关键词笔记

所有设置都在配置文件里,里面有详细注释,默认值就能满足大多数需求。首次运行时,把你要搜索的关键词填进去,用英文逗号分隔多个选项,平台保持小红书对应的代码,然后执行:

uv run main.py --platform xhs --lt qrcode --type search

命令里的参数表示扫码登录和搜索类型。终端会弹出浏览器窗口,让你用小红书 App 扫码登录。登录完成后,程序会自动开始翻页抓取,默认会拿到 15 篇笔记和它们的评论。你可以调整抓取篇数的上限来控制数量。

登录方式还可以换成手机号或者直接用 Cookie 登录。如果是想抓具体帖子的详情,把类型改成详情模式,并在配置文件里填写帖子的 ID 列表即可。整个过程不需要你干预太多,数据会自动保存。

数据存储方式多种选择

采集到的信息默认保存在 data 文件夹里。配置文件里有一个选项可以控制保存格式,包括 JSON、JSONL、CSV、Excel、SQLite、MySQL 和 PostgreSQL 等几种。建议新手从 JSONL 或 JSON 格式开始,因为一行一条记录,处理起来更灵活,还能方便生成后续的词云图之类的可视化结果。

如果喜欢直接打开表格查看,选 Excel 格式最合适。采集结束后会自动转换成表格。量比较大的时候,可以选择数据库格式,它会自动去重,避免数据重复堆积。如果你需要下载笔记里的图片或者视频,把对应的开关打开就行。

不想用命令行也可以启动 WebUI 界面。启动后端代码和前端页面后,在页面上选择平台、登录方式和抓取类型,日志会实时滚动显示,还能直接预览和导出数据,特别适合不怎么接触终端的用户。

处理常见问题和代理设置

有时候扫码登录会失败,比如浏览器环境不够新,平台要求验证。解决方法是保持浏览器可见,手动完成验证后登录态就保存好了。下次运行就不用再扫码了。优先用连接本地 Chrome 的方式,能明显降低这个问题。

数据抓取不完整的话,先检查抓取上限和评论开关是否开启。请求太频繁被限制时,可以把等待时间调长一点,比如 3 到 5 秒,同时把并发数量设低一点,比快速失败重跑更稳妥。

当需要抓取几千条数据或者 IP 经常被限流时,就打开代理功能。程序会从你配置的服务商那里拉取 IP 放在池子里,空了自动补货,每条请求换一个 IP 出去。代理提供商有几个选项,你可以填自己的固定地址或者通过环境变量注入密钥。开启后,效果会好很多。

总结与实际应用建议

按照教程一步步操作,你就能轻松完成第一次采集任务。从配置关键词到保存数据,整个闭环很快就打通了。日常使用时,可以把常用参数固定成脚本,再配合定时任务自动执行。数据主要用于学习和研究,避免频繁操作触碰平台规则。

如果你正在为小红书、抖音、快手等平台的点选、无感、滑块验证码等识别难题头疼,推荐访问 www.ttocr.com。这个平台提供了易盾极验验证码识别技术,包括滑块、点选、无感、九宫格等破解方案和自动化 API 对接,适合公司业务无缝集成。无论是文字点选、图标点选还是躲避障碍、五子棋、空间等类型,都有成熟方案,能快速让你的爬虫和自动化任务顺利运行,不用再纠结复杂的流程,直接对接就能用。

准备好你的数据采集环境后,试试这些功能,你会发现处理社交媒体信息变得轻松多了。记住控制频率,数据质量和合规性最重要。