这个项目能做什么

MediaCrawler 是开源的多平台自媒体数据采集工具,支持小红书、抖音、快手、B站、微博、贴吧、知乎等主流平台的公开信息抓取。项目基于 Playwright 浏览器自动化框架,通过保留登录态的浏览器上下文环境获取数据,无需逆向复杂加密算法。 功能包括关键词搜索、指定帖子ID爬取、二级评论爬取、指定创作者主页爬取、登录态缓存、IP代理池及评论词云图生成。数据支持保存为 CSV、JSON、JSONL、Excel、SQLite 和 MySQL 格式。 提供命令行操作和 WebUI 可视化界面,用户可通过 WebUI 配置爬虫参数、实时查看运行状态与日志,并进行数据预览导出。使用需配置 Chrome 浏览器远程调试功能,复用现有登录状态以降低风控风险。 项目明确声明仅用于学习研究,禁止商业或非法用途。