프로젝트 소개

OpenSRE는 AI SRE(Site Reliability Engineering) 에이전트를 구축하기 위한 오픈소스 프레임워크입니다. SWE-bench가 코딩 에이전트를 위한 벤치마크를 제공하는 것과 유사하게, 프로덕션 인시던트를 처리하는 AI 에이전트를 위한 훈련 및 평가 환경을 제공하는 것을 목표로 합니다. 이 프로젝트는 현재 공개 알파 단계입니다. 주요 기능은 다음과 같습니다: - **증거 기반 진단**: 로그, 메트릭, 트레이스, 배포, 구성을 상호 연관시켜 근본 원인을 식별합니다. - **런북 인식 추론**: 런북을 자동으로 읽고 적용합니다. - **가역적 식별자 마스킹**: 외부 LLM 호출 전에 민감한 식별자를 삭제하고 출력에서 복원합니다. - **세션 비용 및 기록**: 토큰 사용량을 추적하고 재개 가능한 세션을 지원합니다. - **로컬 에이전트 플릿 모니터링**: Claude Code, Cursor, Codex와 같은 코딩 에이전트를 모니터링합니다. - **LLM 유연성**: Anthropic, OpenAI, Codex, Ollama, Gemini, OpenRouter, TrustedRouter, NVIDIA NIM, Bedrock을 지원합니다. OpenSRE는 AI/LLM 제공자, 관측 가능성(Grafana, Datadog, Sentry 등), 인프라(Kubernetes, AWS, Azure), 데이터베이스(MongoDB, PostgreSQL 등), 데이터 플랫폼(Airflow, Kafka), 개발 도구(GitHub, GitLab), 인시던트 관리(PagerDuty, Jira), 커뮤니케이션(Slack, Discord, Telegram), 배포 플랫폼(Vercel, EC2, ECS, Railway) 등 여러 범주에 걸쳐 60개 이상의 도구와 통합됩니다. 또한 MCP 프로토콜도 지원합니다. 사용 옵션: - **대화형 셸**: 인시던트를 자연어로 설명하기 위한 REPL로, 세션 제어 및 통합을 위한 슬래시 명령을 제공합니다. - **헤드리스 CLI**: 예를 들어 `opensre ask "why is checkout-api slow?"`와 같이 비대화형으로 하나의 에이전트 턴을 실행합니다. - **Python API**: 자체 코드에서 에이전트를 인프로세스로 구동합니다. 배포 옵션에는 OpenSRE Cloud 관리형 게이트웨이, systemd를 사용하는 AWS EC2, 자체 호스팅 컨테이너(Railway, ECS, Vercel)가 포함됩니다. 보안 기능에는 구조화되고 감사 가능한 LLM 프롬프트, 기본적으로 로컬 트랜스크립트 처리, 원시 로그의 무음 대량 내보내기 없음 등이 포함됩니다. 텔레메트리는 `OPENSRE_NO_TELEMETRY=1`을 통해 옵트아웃할 수 있습니다. 라이선스: Apache 2.0.