OPEN SOURCE, OPEN TO EVERYONE

好开源,值得被发现。

发现优质开源项目,匿名提交开源项目,认领编辑你的开源项目。

人工精选 · 发现好开源4109已发现

带着好奇心,发现开源世界。

THE FIRST COLLECTION
Topic: crawler清除
newspapercodelucas
新收录

newspaper3k 是一个 Python 3 库,用于从网络抓取和整理文章,提供全文与元数据提取、NLP、多语言支持及多线程下载等功能。

数据与数据库自动化ETL / 数据集成
easyspiderNaiboWang
新收录

易采集EasySpider是一款完全免费的可视化无代码网页爬虫与浏览器自动化工具,通过图形界面点选网页元素即可设计采集任务,支持命令行执行、流程图逻辑、定时任务与二次开发。

自动化开发工具浏览器与 RPA
新收录

一个可自托管的抖音与TikTok数据API,支持获取作品、个人资料、评论、合集、粉丝/关注列表,并可下载无水印视频与图集。具备自修复身份池、PostgreSQL归档、REST API、MCP服务器、CLI和Web控制台。

自托管数据与数据库服务器管理
scrapyscrapy
新收录

Scrapy 是一个用于 Python 的快速、高级 Web 抓取框架,旨在从网站提取结构化数据。它跨平台且需要 Python 3.10 或更高版本,由 Zyte(前 Scrapinghub)及众多贡献者维护。

自动化数据与数据库数据自动化
luxiawia002
新收录

Lux 是一款用 Go 语言编写的快速、简洁的命令行视频下载工具,支持从 YouTube、Bilibili、Instagram 等多个平台下载视频、播放列表、图片和音频。

视频与影视开发工具下载与录制
scraplingD4Vinci
新收录

面向Python的自适应网页抓取框架:智能DOM追踪、反爬绕过抓取器、支持暂停/恢复的并发爬取、代理轮换以及MCP/AI就绪输出。

自动化数据与数据库数据自动化
firecrawlfirecrawl
新收录

Firecrawl 是一个开源网页数据 API,用于搜索、抓取、爬取网站并与之交互,将页面转换为干净的 Markdown、JSON 或截图,供 AI 智能体和应用以 LLM 就绪的方式使用。

人工智能开发工具智能体 Agent
ahcrawleraxelhahn
新收录

AH Crawler是用于网站搜索和分析的开源工具,支持PHP环境运行。

开发工具自托管后端与 API
新收录

Crawlee 是一个用于构建可靠爬虫的 Python 网页抓取和浏览器自动化库。它支持 HTTP 和无头浏览器抓取、自动重试、代理轮换,以及面向 AI/LLM 应用的数据存储。

开发工具人工智能后端与 API