这个项目能做什么

Xberg是一个围绕Rust核心构建的多语言文档智能引擎。将其指向PDF、扫描图像、电子表格、音频文件、URL、归档文件或源代码树,它就能返回干净的文本、表格、元数据和结构化数据。格式检测、读取、OCR和提取由一个引擎处理,而不是由多个独立库拼凑而成。 覆盖范围与能力 - 格式:README声称支持141种文件扩展名和56种MIME别名下的107种格式,涵盖办公文档(Word、Excel、PowerPoint、OpenDocument、Apple iWork、Hangul HWP/HWPX)、PDF、电子书(EPUB、FB2)、数据库(DBF、SQLite、GeoPackage)、光栅和高级图像(PNG、JPEG、TIFF、JPEG2000、JBIG2、HEIC/AVIF、SVG)、音频和视频轨道(MP3、M4A、WAV、WebM、MP4/MPEG音频轨道)、网页和结构化数据(HTML、XML、JSON、YAML、TOML、CSV)、文本和Markdown变体(AsciiDoc、CommonMark、MyST、Quarto、Djot、MDX、DocTags、reStructuredText、Org)、电子邮件(EML、MSG、PST)、归档文件(ZIP、TAR、GZ、7z)以及学术格式(BibTeX、RIS、EndNote、LaTeX、Typst、JATS、Jupyter笔记本、DocBook、OPML)。 - 代码智能:通过tree-sitter从371种编程语言中提取结构、导入、符号和文档字符串,并提供面向RAG管道的语法感知分块。 - OCR:支持Tesseract、PaddleOCR、Candle或VLM后端,具备回退链、置信度分数和语言自动检测功能。 - 布局和表格:ML布局模型(PP-DocLayout-V3、RT-DETR)和表格结构模型(TATR、SLANet)可重建阅读顺序和单元格网格。 - 增强功能:NER、关键词提取(YAKE/RAKE)、摘要、翻译、PII编辑、页面分类、QR检测、语言检测以及TOON令牌缩减格式。 - 嵌入和搜索:本地ONNX嵌入或提供商托管的嵌入、稀疏和后期交互检索,以及交叉编码器重排序。 - 结构化提取:使用本地引擎(Ollama、LM Studio、vLLM)或托管LLM提供商,从文档中提取基于模式的JSON。 - 输出:纯文本、Markdown、Djot、HTML、JSON树或Docling DocTags,以及自定义渲染器。 接口与部署 列出了15种绑定:Rust、Python、Node.js、WebAssembly、Java、Go、C#、PHP、Ruby、Elixir、Dart、Kotlin(Android)、Swift、Zig和C FFI。部署选项包括库API、具有14个命令的CLI(extract、batch、detect、formats、version、cache、tree-sitter、doctor、serve、mcp、api、embed、chunk、completions)、通过`xberg serve`提供的REST API服务器、具有9个工具、3个提示和4个资源的MCP服务器(适用于Claude Desktop、Cursor等客户端),以及Docker和Helm打包。README指出默认仅CPU运行、内容哈希缓存、并行批处理和每文件超时。 注意事项 某些功能受Cargo功能标志限制(url-ingestion、transcription、reranker、layout/ORT);预构建包和Docker镜像捆绑了常用集合。该项目自称是Kreuzberg的继任者,并采用MIT许可证。README中的性能和基准声明是项目自身的,此处未独立验证。