这个项目能做什么
Maxun 是一个开源、可自托管的无代码网页数据平台,旨在将网站转化为结构化、可复用的数据源。用户无需编写代码即可创建自动化机器人,用于提取、页面抓取、网站爬取、网络搜索和文档解析。
Extract 功能可以记录浏览操作并将其转换为可复用的机器人,或使用 AI 模式,让用户用自然语言描述所需数据。它支持分页、滚动、定时运行、需要认证的页面,以及网站布局变化时的自动恢复。提取的数据可以通过 RESTful 端点公开,或导出到 Google Sheets 和 Airtable。
Scrape 机器人将完整网页转换为干净的 Markdown 或 HTML,并可捕获截图,生成的输出适用于 AI 工作流、智能体和文档处理。Crawl 机器人遍历网站并从发现的页面中提取内容,同时控制爬取范围。Search 机器人执行自动化网络搜索,包括基于时间的过滤,并可收集或抓取结果页面。
Maxun 还支持文档和图像提取。它可以解析 PDF、DOCX、XLSX 和 CSV 文件;对扫描版 PDF、JPG 和 PNG 使用 OCR;将文件转换为 Markdown、HTML、链接或摘要;并在 AI 辅助下提取结构化字段。示例用途包括收据、发票、纸质表单、表格截图和扫描文档。
对于开发者,Maxun 提供 SDK 和 CLI,用于创建机器人、触发运行、管理定时任务和获取数据。它还包括 Model Context Protocol 支持以及用于将提取的数据与其他工具连接的集成。
该项目采用 AGPLv3 许可证。它在 app.maxun.dev 提供托管应用,也可以使用 Docker Compose 或非 Docker 方式在本地安装或自托管,并提供环境变量和升级的相关文档。
评论
0 评分人数达到10人后显示
登录后参与讨论。