프로젝트 소개
FastChat은 대규모 언어 모델(LLM) 기반 챗봇을 훈련, 서빙, 평가하기 위한 오픈소스 플랫폼입니다. Vicuna의 릴리스 저장소이자 Chatbot Arena(lmarena.ai)의 기술 기반이며, README에 따르면 70개 이상의 LLM에 대해 1,000만 건 이상의 채팅 요청을 처리하고 온라인 LLM Elo 리더보드를 위해 150만 개 이상의 인간 투표를 수집했습니다.
README에 설명된 핵심 기능:
- Vicuna 및 MT-Bench와 같은 모델을 위한 훈련 및 평가 코드.
- 웹 UI와 OpenAI 호환 RESTful API를 갖춘 분산 멀티모델 서빙 시스템.
- 단일 GPU, 모델 병렬 처리를 통한 다중 GPU, CPU 전용, Apple Metal(MPS), Intel XPU, Ascend NPU 백엔드를 지원하는 명령줄 추론.
- 8비트 압축 및 CPU 오프로딩을 포함한 메모리 절약 옵션과 ExLlama V2, GPTQ 4비트, AWQ 4비트 같은 양자화 지원.
- 컨트롤러, 모델 워커, Gradio 웹 서버로 구성된 웹 GUI 아키텍처. 여러 워커를 하나의 컨트롤러에 등록하여 더 높은 처리량 또는 여러 모델을 지원할 수 있습니다.
- 로컬에서 실행할 수 있는 나란히 비교 배틀 UI(Chatbot Arena)로, OpenAI, Anthropic, Gemini, Mistral을 포함한 API 기반 모델을 지원합니다.
- openai-python 라이브러리 및 cURL과 함께 사용할 수 있는 OpenAI 호환 API와 Hugging Face 생성 API 및 LangChain 통합.
- GPT-4와 같은 강력한 LLM이 심사자 역할을 하는 다중 턴 개방형 질문 세트인 MT-bench를 통한 평가.
- 다중 턴 대화 지원, LoRA 지원, Vicuna-13B용 하이퍼파라미터 문서화를 갖춘 Stanford Alpaca 기반 미세 조정 코드.
- Hugging Face에서 다운로드할 수 있는 Vicuna(7B, 13B, 33B, 16K 컨텍스트 변형 포함), LongChat, FastChat-T5 모델 가중치.
- Llama 2, Vicuna, Alpaca, Baize, ChatGLM, Dolly, Falcon, FastChat-T5, GPT4ALL, Guanaco, OpenAssistant, OpenChat, RedPajama, StableLM, WizardLM, xDAN-AI를 포함한 다양한 모델 지원.
- pip 또는 소스에서 설치 가능하며, 모델 워커, 웹 UI, 훈련을 위한 선택적 추가 기능 제공.
README는 또한 LMSYS-Chat-1M 및 Chatbot Arena Conversations를 포함하여 프로젝트에서 공개한 데이터셋과 보고서를 언급하며, "Judging LLM-as-a-judge with MT-Bench and Chatbot Arena" 논문을 인용합니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.