프로젝트 소개

FastChat은 대규모 언어 모델(LLM) 기반 챗봇을 훈련, 서빙, 평가하기 위한 오픈소스 플랫폼입니다. Vicuna의 릴리스 저장소이자 Chatbot Arena(lmarena.ai)의 기술 기반이며, README에 따르면 70개 이상의 LLM에 대해 1,000만 건 이상의 채팅 요청을 처리하고 온라인 LLM Elo 리더보드를 위해 150만 개 이상의 인간 투표를 수집했습니다. README에 설명된 핵심 기능: - Vicuna 및 MT-Bench와 같은 모델을 위한 훈련 및 평가 코드. - 웹 UI와 OpenAI 호환 RESTful API를 갖춘 분산 멀티모델 서빙 시스템. - 단일 GPU, 모델 병렬 처리를 통한 다중 GPU, CPU 전용, Apple Metal(MPS), Intel XPU, Ascend NPU 백엔드를 지원하는 명령줄 추론. - 8비트 압축 및 CPU 오프로딩을 포함한 메모리 절약 옵션과 ExLlama V2, GPTQ 4비트, AWQ 4비트 같은 양자화 지원. - 컨트롤러, 모델 워커, Gradio 웹 서버로 구성된 웹 GUI 아키텍처. 여러 워커를 하나의 컨트롤러에 등록하여 더 높은 처리량 또는 여러 모델을 지원할 수 있습니다. - 로컬에서 실행할 수 있는 나란히 비교 배틀 UI(Chatbot Arena)로, OpenAI, Anthropic, Gemini, Mistral을 포함한 API 기반 모델을 지원합니다. - openai-python 라이브러리 및 cURL과 함께 사용할 수 있는 OpenAI 호환 API와 Hugging Face 생성 API 및 LangChain 통합. - GPT-4와 같은 강력한 LLM이 심사자 역할을 하는 다중 턴 개방형 질문 세트인 MT-bench를 통한 평가. - 다중 턴 대화 지원, LoRA 지원, Vicuna-13B용 하이퍼파라미터 문서화를 갖춘 Stanford Alpaca 기반 미세 조정 코드. - Hugging Face에서 다운로드할 수 있는 Vicuna(7B, 13B, 33B, 16K 컨텍스트 변형 포함), LongChat, FastChat-T5 모델 가중치. - Llama 2, Vicuna, Alpaca, Baize, ChatGLM, Dolly, Falcon, FastChat-T5, GPT4ALL, Guanaco, OpenAssistant, OpenChat, RedPajama, StableLM, WizardLM, xDAN-AI를 포함한 다양한 모델 지원. - pip 또는 소스에서 설치 가능하며, 모델 워커, 웹 UI, 훈련을 위한 선택적 추가 기능 제공. README는 또한 LMSYS-Chat-1M 및 Chatbot Arena Conversations를 포함하여 프로젝트에서 공개한 데이터셋과 보고서를 언급하며, "Judging LLM-as-a-judge with MT-Bench and Chatbot Arena" 논문을 인용합니다.