vLLM은 대규모 언어 모델(LLM) 추론 및 서빙을 위해 설계된 고처리량 및 메모리 효율적인 라이브러리입니다.
오픈 소스. 새로운 가능성.
우수한 오픈 소스 프로젝트를 발견하고, 익명으로 프로젝트를 제출하며, 내 프로젝트를 신청해 편집하세요.
호기심으로 오픈 소스의 세계를 발견하세요.
THE FIRST COLLECTIONMithril은 Gemini, OpenAI, Anthropic, Groq, 로컬 GGUF 모델을 단일 Ollama 호환 API로 통합하는 다중 모델 오케스트레이션 엔진입니다. YAML로 멀티에이전트 팀을 구성하고, 24개 내장 도구, Docker 지원, MCP 통합을 제공합니다.
OpenAI의 Whisper 자동 음성 인식(ASR) 모델을 위한 고성능 C/C++ 구현체로, 가볍고 교차 플랫폼 배포가 가능하도록 설계되었습니다.
Oumi는 데이터 준비, 학습 및 미세 조정(SFT, LoRA, QLoRA, GRPO), 평가, LLM 판정자를 통한 데이터 합성, vLLM/SGLang 배포까지 파운데이션 모델의 전체 수명주기를 지원하는 오픈소스 플랫폼입니다. CLI와 클라우드 작업 실행 기능을 제공합니다.
Xinference는 언어, 음성, 멀티모달 모델을 제공하는 통합 추론 라이브러리입니다. OpenAI 호환 RESTful API, 이기종 GPU/CPU 활용, 분산 배포를 지원하며 LangChain, LlamaIndex, Dify, Chatbox와 통합됩니다.
CTranslate2를 사용하여 OpenAI의 Whisper 모델을 빠르게 재구현한 프로젝트로, 전사 속도 향상과 메모리 사용량 감소를 제공합니다.
DeepSpeed는 대규모 모델의 학습과 추론을 쉽고 효율적이며 효과적으로 만들기 위해 설계된 딥러닝 최적화 라이브러리입니다.
RunAnywhere는 휴대폰, 브라우저, 데스크톱, 서버에서 AI 모델을 온디바이스로 실행하기 위한 크로스플랫폼 SDK 모음입니다. 단일 세맨틱 API를 통해 LLM, 비전, 음성, 음성 에이전트, RAG, 임베딩, 이미지 생성을 지원합니다.
SGLang은 저지연 및 고처리량 추론을 위해 설계된 대규모 언어 모델(LLM) 및 멀티모달 모델용 고성능 서빙 프레임워크입니다.
jetson-inference는 NVIDIA Jetson용 C++ 및 Python 딥비전 라이브러리로, TensorRT로 온디바이스 추론을, PyTorch로 학습을 수행하며 분류, 탐지, 분할, 포즈, 행동, 깊이, 카메라 스트리밍 예제와 사전 학습 모델, 튜토리얼을 제공합니다.
MediaPipe는 Google의 크로스플랫폼 프레임워크이자 온디바이스 머신러닝 솔루션 모음으로, Android, iOS, 웹, 데스크톱, 엣지 기기에서 비전, 텍스트, 오디오 작업을 지원합니다.
YOLOv5는 Object Detection, Instance Segmentation, Image Classification을 위한 PyTorch 기반의 고속·고성능 컴퓨터 비전 프레임워크입니다. 커스텀 데이터셋 학습, 다양한 소스의 추론, ONNX/TensorRT/CoreML 등 모델 수출을 지원합니다.
Colossal-AI는 대규모 AI 모델을 더 저렴하고 효율적으로 학습·실행할 수 있도록 병렬 학습 전략, 메모리 관리, 추론 가속을 제공하는 오픈소스 시스템입니다.