프로젝트 소개

Kronos는 금융 캔들스틱(K-라인) 데이터를 위한 오픈소스 파운데이션 모델로, 45개 이상의 글로벌 거래소 데이터로 학습되었다고 설명됩니다. 이 프로젝트는 AAAI 2026에 채택되었으며, 논문은 arXiv에서 볼 수 있습니다. 아키텍처 및 접근 방식 Kronos는 K-라인 시퀀스로 사전 학습된 디코더 전용 파운데이션 모델 제품군입니다. 2단계 프레임워크는 먼저 특수 토크나이저를 사용하여 연속적인 다차원 OHLCV 데이터를 계층적 이산 토큰으로 양자화한 다음, 해당 토큰으로 대규모 자동회귀 Transformer를 사전 학습하여 동일한 모델이 여러 양적 작업에 사용될 수 있도록 합니다. 저자들은 범용 시계열 파운데이션 모델과 달리 금융 데이터의 높은 노이즈 특성을 고려해 설계되었다고 설명합니다. 모델 주 사전 학습된 모델은 Hugging Face의 NeoQuasar 조직을 통해 배포됩니다: - Kronos-mini: Kronos-Tokenizer-2k, 컨텍스트 길이 2048, 4.1M 파라미터. - Kronos-small: Kronos-Tokenizer-base, 컨텍스트 길이 512, 24.7M 파라미터. - Kronos-base: Kronos-Tokenizer-base, 컨텍스트 길이 512, 102.3M 파라미터. - Kronos-large: Kronos-Tokenizer-base, 컨텍스트 길이 512, 499.2M 파라미터, 오픈소스로 공개되지 않음. 사용 방법 Python 3.10+ 및 requirements 파일을 설치한 후, 사용자는 Hugging Face에서 토크나이저와 모델을 로드하고, max_context 값을 사용하여 KronosPredictor를 인스턴스화한 다음, open, high, low, close(volume과 amount는 선택 사항)와 과거 및 미래 타임스탬프 시리즈를 포함하는 pandas DataFrame으로 predict를 호출합니다. 샘플링은 temperature, top_p, sample_count로 제어되어 확률적 예측을 수행합니다. predict_batch 메서드는 여러 시리즈에 걸친 병렬 예측을 지원하며, 각 시리즈에 대해 동일한 lookback 및 예측 길이를 요구합니다. 이 메서드는 시리즈별 정규화 및 역정규화를 처리하고 GPU 병렬 처리를 사용합니다. 예제 스크립트는 volume/amount 데이터가 있거나 없는 예측을 다루며, 라이브 데모는 24시간 BTC/USDT 예측을 시각화합니다. 파인튜닝 및 백테스팅 Qlib 기반 A주식 시장 데모로 4단계 파인튜닝 파이프라인이 제공됩니다: 구성, 데이터 준비, 토크나이저 및 예측기 파인튜닝(torchrun을 통한 멀티 GPU), 그리고 간단한 top-K 전략을 사용한 백테스팅입니다. README는 이를 프로덕션 준비 완료된 양적 거래 시스템이 아닌 단순화된 데모로 명시하며, 실제 워크플로우에는 포트폴리오 최적화, 리스크 팩터 중립화, 거래 비용 및 슬리피지 모델링, 더 복잡한 포지션 사이징이 추가될 것이라고 언급합니다. 또한 파인튠 디렉토리의 많은 주석이 AI 생성되었으며 부정확할 수 있다고 설명합니다. 라이선스 MIT 라이선스로 배포됩니다.