프로젝트 소개

ClearML은 머신러닝 및 딥러닝 개발과 프로덕션을 위한 오픈소스 스위트로, 실험 관리자, MLOps/LLMOps 오케스트레이션, 데이터 관리, 모델 서빙, 보고서의 5개 주요 모듈과 오케스트레이션 대시보드, 부분 GPU 지원으로 구성됩니다. 실험 관리자: 코드 두 줄(Task.init)을 추가하면 소스 제어 정보와 커밋되지 않은 로컬 변경 사항, 실행 환경 및 패키지 버전, argparse/Click/PythonFire의 하이퍼파라미터, 명시적 파라미터 사전, TensorFlow Defines, Hydra 구성, 초기 모델 가중치를 포함한 실험 설정이 캡처됩니다. 출력 캡처는 stdout/stderr, 리소스 모니터링(CPU/GPU 사용률, 온도, IO, 네트워크), 공유 폴더·S3·GS·Azure·HTTP 업로드 옵션이 있는 모델 스냅샷, 아티팩트 로깅, TensorBoard/TensorBoardX 스칼라, 메트릭, 히스토그램, 이미지, 오디오·비디오 샘플, Matplotlib/Seaborn 출력을 다룹니다. 사용자 지정 로깅을 위한 ClearML Logger 인터페이스도 제공됩니다. 프레임워크 및 도구 통합에는 PyTorch(ignite 및 lightning 포함), TensorFlow, Keras, AutoKeras, FastAI, XGBoost, LightGBM, MegEngine, Scikit-Learn과 Jupyter Notebook 통합, PyCharm 원격 디버깅이 포함됩니다. MLOps/LLMOps: ClearML Agent는 Kubernetes, 클라우드, 베어메탈 환경 전반에서 ML/DL/GenAI 작업의 오케스트레이션, 자동화, 파이프라인을 처리합니다. 관련 도구로는 Docker에서 원격 JupyterLab/VSCode-server를 위한 clearml-session, 원격 로깅으로 코드베이스를 원격 실행하는 clearml-task, AWS 오토스케일러, 베이지안 방식의 하이퍼파라미터 최적화, 파이프라인의 파이프라인을 구축할 수 있는 자동화 파이프라인, 진행 상황 및 실패 알림을 위한 Slack 통합이 있습니다. 데이터 관리: 객체 스토리지(S3, GS, Azure, NAS) 기반의 차별화된 데이터 관리 및 버전 관리 솔루션으로, 데이터셋 생성·업로드·다운로드를 위한 clearml-data CLI를 제공합니다. 모델 서빙: Nvidia Triton 기반의 최적화된 GPU 서빙과 기본 제공 모델 모니터링을 갖춘 클라우드 지원 확장형 서빙 솔루션입니다. 보고서: 온라인 콘텐츠를 삽입할 수 있는 Markdown 문서를 생성하고 공유합니다. 아키텍처: ClearML Python 패키지는 기존 스크립트에 통합되며, ClearML Server는 실험·모델·워크플로 데이터를 저장하고 웹 UI를 구동합니다. ClearML Agent는 오케스트레이션, 재현성, 확장성을 제공합니다. 서버는 자체 호스팅하거나 호스팅 서비스로 사용할 수 있으며, 환경 변수를 통해 데모 서버를 활성화할 수 있습니다(해당 실험은 공개됨). 시작하기: clearml Python 패키지를 설치하고, clearml-init을 실행하여 생성된 자격 증명으로 SDK를 서버에 연결한 다음 코드에 Task.init을 추가합니다. 튜토리얼에서는 실험 관리, 원격 실행 에이전트 설정, 원격 작업 실행을 다룹니다. 이 프로젝트는 Apache 2.0 라이선스로 제공되며 문서, 예제, Slack 채널, Stack Overflow 태그, GitHub 이슈를 통한 지원을 제공합니다.