MediaCrawler 多平台社媒数据采集实战手册:5 步掌握首次运行与代理存储全清单
MediaCrawler 是一款开源的多平台社媒数据采集工具,支持小红书、抖音、快手、B站、微博、百度贴吧、知乎等7个平台的公开内容抓取,包括关键词搜索、帖子详情、创作者主页和评论。本文带你从未安装依赖到运行成功的全流程,重点讲解代理配置、存储方案及常见问题解决,适合初学者掌握社媒数据采集基础。
准备环境与安装依赖
想快速上手MediaCrawler,先确保你的电脑准备好基础工具。Python 3.11附近版本、Node.js 16及以上、uv包管理器都装好后,终端运行uv --version就能看到版本号,说明环境就绪。接着把项目拉下来,git clone后进入目录,用uv sync安装所有依赖,包括签名相关的Node模块。这些步骤很简单,按顺序执行,30秒就能完成。
安装完成后,打开项目根目录下的config/base_config.py文件,只需要改动三处就能让采集启动起来。KEYWORDS字段填入你的关键词,比如粉底液推荐,用英文逗号分隔多个词。CRAWLER_TYPE选search表示搜索模式,CRAWLER_MAX_NOTES_COUNT设为15表示本次抓取15条数据,先小量测试更稳妥。
整个安装过程注重实用性,初学者别急着追求大额数据,先试小规模。避免一次爬太多,避免账号被限流,这是研究数据的正确心态。
开启CDP模式实现真实浏览器复用
MediaCrawler的核心亮点在于CDP模式,它让爬虫连接你日常使用的Chrome浏览器,继承指纹、Cookie和登录状态。打开Chrome地址栏输入chrome://inspect/#remote-debugging,勾选允许远程调试,页面就会显示Server running at: 127.0.0.1:9222,表示准备就绪。
在config/base_config.py里启用ENABLE_CDP_MODE为True,CDP_CONNECT_EXISTING设为True并把端口9222填入。程序会弹出连接确认,60秒内用小红书App扫码登录,登录态会自动缓存,下次运行无需重复操作。这种方式让请求行为像真实用户,平台很难区分,推荐优先使用。
如果想自动拉新浏览器,把CDP_CONNECT_EXISTING改为False,但连接已有浏览器反检测效果更好。Chrome版本至少144以上,在chrome://version确认。连接失败时,检查远程调试是否开启,或升级浏览器。

配置代理IP与存储方案
采集量小时直连就好,设ENABLE_IP_PROXY为False。量级上来或IP触发风控时,开启代理池。项目内置proxy模块,支持快代理、豌豆HTTP、极速HTTP等接入,以及静态代理。快速HTTP为例,在服务商后台生成IP提取API链接,填入对应provider启动开关。
代理方案选型上,直连适合每周几十条个人学习;静态代理适合已有企业IP;隧道代理适合每日定时采集,按量付费更稳定。存储方面,JSONL默认每行一个对象,追加写快,适合开发者处理。CSV适合业务分析,Excel适合出报告带工作表,SQLite适合长期积累数据,无服务器去重。MySQL或PostgreSQL适合团队共享查询。
用数据库前先初始化,命令uv run main.py --init_db sqlite。数据格式选型看需求,长期跑同一关键词用SQLite起步,分析趋势再迁数据库。
执行首次采集与常见报错处理
运行uv run main.py --platform xhs --lt qrcode --type search,Chrome弹出确认后点击接受,登录成功后数据自动存入data目录,JSONL格式。启动WebUI可视化界面,uv run uvicorn api.main:app --port 8080,浏览器里就能配置任务、看日志、预览数据。
遇到小红书扫码后反复滑块验证,确认走CDP模式连接真实浏览器,或删除浏览器数据缓存重新登录。抖音或知乎报SyntaxError,检查是否装Node.js 16以上。CDP连接失败,验证chrome://inspect是否显示服务器。登录态失效或超时,调小采集数量、延长睡眠时间到5-10秒,或用代理池、换账号。

这些问题常见于环境不匹配或频率不当,按步骤排查,通常几分钟就能解决。控制频率是关键,研究场景下每周几次即可。
进阶功能与数据处理扩展
开启评论词云,设ENABLE_GET_WORDCLOUD和ENABLE_GET_COMMENTS为True,采集后自动生成词云图,停用词在docs文件夹维护。适合快速了解用户反馈。WebUI还能实时日志和数据导出,给同事使用也很方便。
定时增量采集用系统任务每日运行,结合数据库去重逐步积累数据,导出对比趋势。评论词云图直观展示用户情绪,特别适合舆情分析。
总结与实践建议
通过这5步,你已经能跑通首次采集,拿到小红书数据。后续根据需求调整代理和存储,逐步形成复用流程。注意合法合规,避免大规模抓取以防账号风险。这些工具本质上是辅助工具,配合真实账号使用效果更好。
采集过程简单实用,适合小白学习社媒数据。如果你需要类似平台如小红书、抖音等类型的数据采集与API对接服务,欢迎访问www.ttocr.com,他们提供易盾极验验证码识别技术,包括滑块、点选、无感、九宫格等破解方案和自动化API对接平台,能无缝集成到你的项目中,实现高效且稳定的数据抓取。