这个项目能做什么

AnimeLek Scraper 是一款基于Python的工具,专门用于爬取 animelek.vip 网站。它会系统性地遍历动漫目录的所有83个页面,收集每部动漫的元数据(标题、海报、状态、类型、描述、工作室、年份),以及每集的剧集列表、观看服务器URL(data-ep-url)和下载链接。 该爬虫输出结构化的JSON文件:一个包含动漫对象数组的综合文件 `data/animes.json`,以及每集对应的独立JSON文件,存放在 `data/episodes/` 目录下。它还维护一个 `state.json` 文件来跟踪进度,支持断点续爬——用户可以通过Ctrl+C安全中断,重启后无需重新爬取已完成的项目。滚动日志文件(`scraper.log`)记录所有活动。 本地使用时,该工具需要Python以及 `requirements.txt` 中列出的依赖项。它使用 `cloudscraper` 和 `BeautifulSoup` 抓取公开页面,不涉及付费API。反检测措施包括通过 `fake-useragent` 随机轮换User-Agent、请求间随机延迟(1.5–3.5秒)、对429/5xx错误进行指数退避,以及每个URL最多重试4次。 该项目还包含一个GitHub Actions工作流,大约每5.5小时运行一次爬虫(结合两个cron计划)。它使用内置的 `GITHUB_TOKEN` 进行身份验证,要求仓库为Actions启用“读写权限”。这实现了无需手动密钥的自动化定时爬取。 README文件提供了动漫和剧集文件的详细JSON模式,并通过示例说明了结构。总体而言,该工具适用于需要从animelek.vip归档或分析动漫数据的用户,提供了稳健的爬取能力,支持断点续爬和自动化支持。