newspaper3k 是一个 Python 3 库,用于从网络抓取和整理文章,提供全文与元数据提取、NLP、多语言支持及多线程下载等功能。
OPEN SOURCE, OPEN TO EVERYONE
好开源,值得被发现。
发现优质开源项目,匿名提交开源项目,认领编辑你的开源项目。
✳人工精选 · 发现好开源4109已发现
带着好奇心,发现开源世界。
THE FIRST COLLECTIONTopic: crawler清除
newspapercodelucas
新收录easyspiderNaiboWang
新收录易采集EasySpider是一款完全免费的可视化无代码网页爬虫与浏览器自动化工具,通过图形界面点选网页元素即可设计采集任务,支持命令行执行、流程图逻辑、定时任务与二次开发。
douyin_tiktok_download_apiEvil0ctal
新收录一个可自托管的抖音与TikTok数据API,支持获取作品、个人资料、评论、合集、粉丝/关注列表,并可下载无水印视频与图集。具备自修复身份池、PostgreSQL归档、REST API、MCP服务器、CLI和Web控制台。
scrapyscrapy
新收录Scrapy 是一个用于 Python 的快速、高级 Web 抓取框架,旨在从网站提取结构化数据。它跨平台且需要 Python 3.10 或更高版本,由 Zyte(前 Scrapinghub)及众多贡献者维护。
luxiawia002
新收录Lux 是一款用 Go 语言编写的快速、简洁的命令行视频下载工具,支持从 YouTube、Bilibili、Instagram 等多个平台下载视频、播放列表、图片和音频。
scraplingD4Vinci
新收录面向Python的自适应网页抓取框架:智能DOM追踪、反爬绕过抓取器、支持暂停/恢复的并发爬取、代理轮换以及MCP/AI就绪输出。
firecrawlfirecrawl
新收录Firecrawl 是一个开源网页数据 API,用于搜索、抓取、爬取网站并与之交互,将页面转换为干净的 Markdown、JSON 或截图,供 AI 智能体和应用以 LLM 就绪的方式使用。
ahcrawleraxelhahn
新收录AH Crawler是用于网站搜索和分析的开源工具,支持PHP环境运行。
crawlee-pythonapify
新收录Crawlee 是一个用于构建可靠爬虫的 Python 网页抓取和浏览器自动化库。它支持 HTTP 和无头浏览器抓取、自动重试、代理轮换,以及面向 AI/LLM 应用的数据存储。