OPEN SOURCE, OPEN TO EVERYONE

好开源,值得被发现。

发现优质开源项目,匿名提交开源项目,认领编辑你的开源项目。

人工精选 · 发现好开源4101已发现

带着好奇心,发现开源世界。

THE FIRST COLLECTION
Topic: crawling清除
newspapercodelucas
新收录

newspaper3k 是一个 Python 3 库,用于从网络抓取和整理文章,提供全文与元数据提取、NLP、多语言支持及多线程下载等功能。

数据与数据库自动化ETL / 数据集成
scrapyscrapy
新收录

Scrapy 是一个用于 Python 的快速、高级 Web 抓取框架,旨在从网站提取结构化数据。它跨平台且需要 Python 3.10 或更高版本,由 Zyte(前 Scrapinghub)及众多贡献者维护。

自动化数据与数据库数据自动化
scraplingD4Vinci
新收录

面向Python的自适应网页抓取框架:智能DOM追踪、反爬绕过抓取器、支持暂停/恢复的并发爬取、代理轮换以及MCP/AI就绪输出。

自动化数据与数据库数据自动化
新收录

Crawlee 是一个用于构建可靠爬虫的 Python 网页抓取和浏览器自动化库。它支持 HTTP 和无头浏览器抓取、自动重试、代理轮换,以及面向 AI/LLM 应用的数据存储。

开发工具人工智能后端与 API