방글라어 NLP 리소스의 커뮤니티 관리형 카탈로그로, 13개 작업에 걸쳐 논문 712편, 데이터셋 63개, 모델 20개, 도구 9개를 제공합니다. 정적 Astro 사이트로 구축되었으며 엄격한 데이터 검증과 공유 가능한 필터 기능을 갖추고 있습니다.
오픈 소스. 새로운 가능성.
우수한 오픈 소스 프로젝트를 발견하고, 익명으로 프로젝트를 제출하며, 내 프로젝트를 신청해 편집하세요.
호기심으로 오픈 소스의 세계를 발견하세요.
THE FIRST COLLECTIONTextBlob은 NLTK와 pattern을 기반으로 한 Python 자연어 처리 라이브러리로, 감정 분석, 품사 태깅, 명사구 추출, 분류, 토큰화 등 간단한 API를 제공합니다.
대규모 중국어 NLP 코퍼스 프로젝트는 위키백과, 뉴스, QA 등 고품질 데이터셋을 제공하여 대모델 사전 훈련 및 NLP 연구에 기여합니다.
Batchalign3는 CHAT 전사본을 생성하고 강화하기 위한 TalkBank 오디오 및 ML 파이프라인으로, ASR, 강제 정렬, 신경 형태소 태깅, 번역 및 발화 분할을 다룹니다. CLI, Python 패키지, PyO3 브리지, React 대시보드 및 실험적 Tauri 데스크톱 셸을 제공합니다.
소비자용 노트북 하드웨어에서 처음부터 학습하도록 설계된 소형 GPT 언어 모델(약 5억 4천만 파라미터)로, Fineweb-edu 사전 학습 및 채팅 파인튜닝 기능을 제공합니다.
微舆(BettaFish)는 제로부터 구현된 멀티 에이전트 여론 분석 시스템으로, AI 크롤러 클러스터, 다중 모달 분석, 포럼 협업 메커니즘 및 지능형 보고서 생성을 통해 사용자가 정보 버블을 깨고 여론의 원형을 재현하며 향후 추세를 예측하고 의사 결정을 지원합니다. 국내외 30+ 주요 소셜 미디어 분석을 지원하고, 프라이빗 데이터베이스 연동이 가능하며, 순수 Python 모듈식 설계와 Docker 원클릭 배포를 지원합니다.
무료 오픈소스 AI 엔지니어링 커리큘럼으로, 첫 원리부터 20단계 523개 수업(약 342시간)을 Python, TypeScript, Rust, Julia로 제공. 각 수업은 수학 기반 구현부터 재사용 가능한 프롬프트, 스킬, 에이전트, MCP 서버까지 포함하며, 설치형 AI 튜터와 Claude 인증 준비도 지원.
생성형 AI의 기반이 되는 연구 논문 107편을 정선하여 요약한 교육용 저장소입니다. 학습 로드맵, 용어집, 결정 가이드 등을 제공하여 최신 AI 연구를 누구나 이해할 수 있게 돕습니다.
순수 파이썬 기반 과학 컴퓨팅 플랫폼으로, 양자·머신러닝·통계·ODE 솔버 등 22개 모듈을 제공하며 런타임 의존성이 없고, 선택적 NumPy/SciPy 어댑터로 검증과 재현성을 지원합니다.
Haqumei(薄明/拍命)는 Rust로 작성된 일본어 Grapheme-to-Phoneme(G2P) 라이브러리로, Python 바인딩과 CLI 도구를 제공하며, 운율 정보, 단어-음소 매핑, 음성 합성 프론트엔드를 위한 정확한 텍스트-음소 변환을 제공합니다.
오픈소스 중국어 LLaMA 및 Alpaca 대규모 언어 모델 프로젝트로, 원본 LLaMA 기반으로 중국어 어휘를 확장하고 추가 사전학습을 수행하며, 명령어 미세조정 모델, LoRA 가중치, 학습 및 양자화 배포 스크립트를 제공하고 로컬 CPU/GPU 실행을 지원합니다.
NLTK는 자연어 처리(NLP) 연구 및 개발을 지원하기 위해 설계된 오픈 소스 Python 모듈, 데이터 세트 및 튜토리얼의 종합적인 제품군입니다.
SpellKit은 Rust SymSpell 구현을 갖춘 빠르고 안전한 Ruby gem입니다. 서브 밀리초 대기 시간, 정규식을 통한 용어 보호, 핫 리로드 가능한 사전, 제로 종속성을 제공합니다. 여러 인스턴스, 건너뛰기 패턴을 지원하며 검색어 추출에 적합한 프로덕션 준비 상태입니다.
시맨틱 검색, LLM 오케스트레이션, 언어 모델 워크플로우를 위한 올인원 AI 프레임워크.
Swift Tokenizers는 Hugging Face의 Rust tokenizers 크레이트를 래핑한 고성능 Swift 패키지입니다. Hub 의존성 없이 토큰화에만 집중하며 macOS, iOS, Linux를 지원합니다. 인코딩, 디코딩, 스트리밍 디토큰화, 채팅 템플릿 및 도구 호출 기능을 제공합니다.
HanLP는 PyTorch와 TensorFlow 2.x 기반의 프로덕션 환경용 다국어 자연어 처리(NLP) 도구 키트입니다. 형태소 분석, 품사 태깅, 개체명 인식, 구문 분석 등 다양한 작업을 지원하며, RESTful 및 네이티브 두 가지 API를 제공합니다.
Premove ITN은 영어 음성 에이전트 대본을 위한 오픈소스 컨텍스트 인지 역텍스트 정규화 도구로, DeBERTa 컨텍스트 점수를 사용하는 생성-점수-디코드 파이프라인을 통해 음성 ASR 출력을 표준 서면 형식으로 변환합니다.
Tsuut'ina(Sarsi) 언어를 위한 유한 상태 및 제약 문법 기반 형태소 분석기, 교정 도구, 언어 자원을 포함하는 GiellaLT 오픈소스 언어 인프라의 일부입니다.
LlamaFactory는 100개 이상의 대규모 언어 및 멀티모달 모델을 효율적으로 파인튜닝하기 위한 Python 프레임워크로, 제로코드 CLI, Gradio 웹 UI, LoRA/QLoRA 및 다양한 학습 알고리즘을 제공합니다.
ModelScope는 Model-as-a-Service를 구현한 오픈소스 Python 라이브러리로, CV, NLP, 오디오, 멀티모달, 과학 모델의 추론·파인튜닝·평가를 위한 통합 pipeline, Trainer, MsDataset 인터페이스와 모델/데이터셋 허브 연동을 제공합니다.