Looper

2025.04 - 2025.08 / 카카오테크 부트캠프

AI 기반 일정 관리 플랫폼, GCP(AI)와 AWS(Web)를 분리한 멀티클라우드 인프라 담당

FastAPI Kubernetes Terraform GCP AWS OpenTelemetry Prometheus Grafana / Loki / Tempo GitHub Actions

핵심 성과

단일 대시보드 메트릭 / 로그 / 트레이스 통합 가시성 확보 OTel + Prometheus + Loki + Tempo + Grafana
GCP + AWS 멀티클라우드 구성 AI 워크로드(GCP) / Web 서비스(AWS) 클라우드 분리

멀티클라우드 구성

GCP (AI 클러스터)
  • kubeadm 기반 K8s 클러스터 (GPU 노드 포함)
  • FastAPI 비동기 AI 추론 서버
  • VXLAN 오버레이 네트워크로 Pod 간 통신
  • Cloud DNS Health Check 기반 Failover 라우팅
AWS (Web 클러스터)
  • EKS 기반 애플리케이션 서버
  • Terraform IaC로 전체 인프라 코드화
  • GitHub Actions CI/CD 파이프라인
  • 통합 Observability 스택 운영

Observability 스택

OpenTelemetry 분산 트레이싱 수집. 각 서비스의 Span을 Tempo로 전송
Prometheus 메트릭 수집 / 저장. CPU/메모리/요청 지연 등 시계열 데이터
Loki 로그 집계. Promtail로 Pod 로그 수집 → Loki 저장
Tempo 트레이스 백엔드. Grafana와 연동해 요청 경로 시각화
Grafana 통합 대시보드. 메트릭 / 로그 / 트레이스를 단일 화면에서 상관 분석. 기존 로그 파일 직접 탐색 방식 대비 장애 위치 특정 속도 향상

아키텍처

Looper 멀티클라우드 아키텍처 다이어그램

주요 구현 내용

  • 멀티클라우드 분리 설계: AI 워크로드(GPU 집약적)는 GCP에, 일반 Web 서비스는 AWS에 배치. 비용 최적화와 벤더 락인 방지
  • kubeadm 기반 K8s 클러스터: GCP VM에 직접 kubeadm으로 클러스터 구성. VXLAN 오버레이 네트워크로 클라우드 간 Pod 통신 구현
  • Failover 라우팅: Cloud DNS Health Check로 AI 서버 장애 시 자동 대체 엔드포인트로 라우팅
  • FastAPI 비동기 처리: AI 추론 요청을 async/await로 처리해 I/O 대기시간 감소 및 처리량 향상
  • Terraform IaC: AWS / GCP 전체 인프라를 코드로 관리. 환경 재현성 보장 및 드리프트 감지
  • GitHub Actions CI/CD: 코드 Push → 이미지 빌드 → K8s 롤링 배포 자동화
  • 통합 APM 구축: OpenTelemetry + Prometheus + Loki + Tempo + Grafana 연동. Grafana 단일 대시보드에서 메트릭 / 로그 / 트레이스 상관 분석. 기존 로그 파일 직접 탐색 방식 대비 장애 원인 파악 환경을 구성하여 대응 속도 향상

GitHub

jinho7/web-3tier-terraform