scrapyscrapy
新收录Scrapy 是一个用于 Python 的快速、高级 Web 抓取框架,旨在从网站提取结构化数据。它跨平台且需要 Python 3.10 或更高版本,由 Zyte(前 Scrapinghub)及众多贡献者维护。
发现优质开源项目,匿名提交开源项目,认领编辑你的开源项目。
带着好奇心,发现开源世界。
THE FIRST COLLECTIONScrapy 是一个用于 Python 的快速、高级 Web 抓取框架,旨在从网站提取结构化数据。它跨平台且需要 Python 3.10 或更高版本,由 Zyte(前 Scrapinghub)及众多贡献者维护。
面向Python的自适应网页抓取框架:智能DOM追踪、反爬绕过抓取器、支持暂停/恢复的并发爬取、代理轮换以及MCP/AI就绪输出。
Firecrawl 是一个开源网页数据 API,用于搜索、抓取、爬取网站并与之交互,将页面转换为干净的 Markdown、JSON 或截图,供 AI 智能体和应用以 LLM 就绪的方式使用。
Crawlee 是一个用于构建可靠爬虫的 Python 网页抓取和浏览器自动化库。它支持 HTTP 和无头浏览器抓取、自动重试、代理轮换,以及面向 AI/LLM 应用的数据存储。
Maigret 是一款开源 OSINT 命令行工具,仅凭用户名即可对目标人物建立档案,扫描 3000 多个网站,提取个人资料信息,并支持导出 HTML、PDF、JSON、CSV 和图形等多种格式的报表。