这个项目能做什么
Colly 是一个用 Go 编写的轻量级高性能网页抓取和爬行框架。它提供了干净直观的 API,用于构建抓取器、爬行器和蜘蛛程序,使得从网站提取结构化数据变得容易,适用于数据挖掘、处理或归档等应用。
主要特性包括:
- 干净优雅的 API
- 高速(单核每秒超过 1000 个请求)
- 自动处理请求延迟和每个域名的最大并发数
- 自动 cookie 和会话管理
- 支持同步、异步和并行抓取
- 内置缓存
- 自动编码非 Unicode 响应
- 支持 robots.txt
- 分布式抓取能力
- 通过环境变量进行配置
- 可通过插件扩展
README 中包含一个简单示例,演示如何创建收集器、访问页面上的所有链接以及处理请求。它还列出了几个使用 Colly 的开源项目,例如搜索引擎、Steam 游戏数据库和网站克隆器。该项目维护活跃,并接受贡献。
评论
0 评分人数达到10人后显示
登录后参与讨论。