这个项目能做什么

TARS 是一个开源的多模态 AI 智能体(Agent)技术栈,目前包含两个相关项目:Agent TARS 和 UI-TARS Desktop。两者均采用 Apache 2.0 许可协议,由字节跳动(ByteDance)开发。 Agent TARS 被描述为一个通用的多模态 AI 智能体技术栈,将 GUI 智能体和视觉能力引入终端、电脑、浏览器和产品中。它主要以 CLI 和 Web UI 的形式提供。根据 README,它旨在通过多模态大语言模型(LLM)以及与真实世界 MCP 工具的集成,提供更接近人类任务完成方式的工作流。其核心功能包括:支持有头(headful)Web UI 和无头(headless)服务器执行的一键开箱即用 CLI;可通过 GUI 智能体、DOM 或混合策略控制浏览器的混合浏览器智能体;用于上下文工程和智能体 UI 的协议驱动型事件流(Event Stream);以及支持挂载 MCP 服务器以连接外部工具的基于 MCP 的内核。安装示例使用 npx 或全局 npm 安装(Node.js >= 22),并且可以通过指定提供商、模型和 API 密钥,与火山引擎(Volcengine)或 Anthropic 等不同的模型提供商一起运行。v0.3.0 版本说明中提到了对多个工具的流式传输支持、带有耗时统计的运行时设置、事件流查看器(Event Stream Viewer),以及支持将 AIO 智能体沙箱(Sandbox)作为隔离的执行环境。 UI-TARS Desktop 是一款桌面应用程序,为本地电脑提供原生 GUI 智能体,由 UI-TARS 模型和 Seed-1.5-VL/1.6 系列模型驱动。它提供本地和远程电脑操作器以及浏览器操作器。其列出的功能包括:由视觉语言模型驱动的自然语言控制、屏幕截图和视觉识别支持、精准的鼠标和键盘控制、跨平台支持(Windows/macOS/浏览器)、实时反馈和状态显示,以及保障隐私的完全本地化处理。README 链接指向了一篇论文(arXiv 2501.12326)、Hugging Face 模型、魔搭社区(ModelScope)以及 Discord 社区。 README 还提到了 UI TARS SDK(一个用于构建 GUI 自动化智能体的跨平台工具包),以及涵盖快速入门、部署和 MCP 集成的文档。展示的示例用例包括预订机票或酒店、生成图表以及通过自然语言指令调整应用程序设置。