Skip to content
JUNGWOO LEE

장애 삽질이 가르쳐 준 것들

이정우 프로필 사진

Backend Developer

이정우

대용량 트래픽과 분산 시스템을 다뤄 온 9년차 백엔드 개발자

9년 동안 협업 메신저와 O2O, IoT 플랫폼을 만들며 대용량 트래픽과 분산 시스템을 다뤘습니다. 새 기능을 얹는 일보다, 그 기능이 몇 년 뒤에도 흔들리지 않게 구조를 잡는 데 더 관심이 많습니다. 문제가 생기면 증상을 덮기보다 왜 생겼는지부터 파고듭니다.

토스랩에서는 MAU 300만 협업 메신저 잔디의 서버를 이벤트 기반으로 다시 설계하며 트래픽·동시성 문제와 씨름했고, 지금 SK D&D에서는 여러 IoT 장비와 정산 흐름이 서로 어긋나지 않게 맞물리는 일을 합니다. 어느 쪽이든 결국 조용히 잘 돌아가는 서버를 만드는 게 목표입니다.

JavaSpringAWSKafkaIoT
9년백엔드 경력
300만MAU 협업 메신저
3종AWS Professional
89블로그 글

Core Strengths

  • 운영 중심 설계 — 장애 예방, 자동화, 리스크 최소화를 우선시해 개발팀과 운영팀 모두가 효율적으로 사용할 수 있는 시스템 구축
  • 성능 최적화 — 동기 처리의 비동기 전환, 캐시 전략 수립, 트랜잭션 일관성 확보를 통해 시스템 안정성과 성능 개선
  • IoT 플랫폼 통합 — 삼성·LG·현대 등 이기종 프로토콜을 단일 API 및 서버 아키텍처로 통합하여 확장 가능한 시스템 구현
  • 이벤트 기반 아키텍처 — Kafka 등 메시지 큐를 활용해 서비스 간 결합도를 낮추고 장애 격리성을 확보하는 분산 시스템 설계
  • 지식 공유 및 문서화 — 기술 블로그 운영, 사내 위키 작성을 통해 온보딩 효율화 및 팀 지식 공유 문화 정착

Skills

Backend

Java, Spring Boot, Spring MVC, Spring WebFlux, JPA, QueryDSL, gRPC, Spring Batch

Cloud & Infra

AWS (EC2, ECS, S3, SQS, Lambda, DynamoDB, CloudWatch, Kinesis, ElastiCache, Redshift), Docker, Jenkins, GitHub Actions

Database & Cache

MySQL, PostgreSQL, Oracle, Redis

Monitoring & Observability

Datadog, CloudWatch, Whatap

Architecture & Practice

Event-Driven Architecture, Domain Modeling, Clean Code, API Design, System Reliability, IoT Integration

Development Practices

JDK LTS 버전업, 공통 린트 규칙 배포, 개발자 경험 향상을 위한 CI/CD 고도화

Experience

2024.06 — 재직

SK D&D — Backend Engineer정산 정합성 · IoT 통합 · 성능
  • 정산 데드락을 근본 원인까지 추적해 락 처리를 재설계, 응답을 20초에서 1ms로 단축
  • 외주 자산관리 시스템을 자체 서비스로 내재화하며 27만 건을 무중단 이관, 대사 스케줄러로 장부와 외부 응답을 대조해 정합성 보장
  • 가상계좌 결제 누락을 플래그 기반 자가 복구로 차단해 정산 안정성 확보
  • 삼성·LG·현대·아카라 등 이기종 IoT 프로토콜을 단일 API로 통합해 확장 가능한 아키텍처를 설계하고, 신규 사이트 IoT 구성을 빠르게 배포
  • 조건부 재조회·재구독 패턴으로 IoT 자동화 안정성을 높이고, 장비 매핑 오류 및 오프라인 장비 검출 로직 개선
  • Datadog·CloudWatch 통합 모니터링을 구축하고, 트랜잭션 롤백 일관화와 캐시 무효화를 자동화해 운영 안정성 확보
  • Monthly Report 자동화(데이터 모델링·스케줄러·조회 API)로 리포트 작성 시간을 수 시간에서 수 분으로 단축

2021.09 — 2024.04

TossLab — Server Developer (JANDI)대용량 트래픽 · EDA · 동시성
  • DAU 15만·MAU 300만 협업 메신저의 인증 서버를 Kafka 이벤트 기반으로 재설계 — 서버를 30대에서 5~8대로 줄이고 Multi-AZ 고가용성 확보
  • 접속 이력 적재 구조를 재설계해 배치 성능을 20배(3~4분 → 10초) 개선
  • 리액션 이모지 API를 WebFlux + R2DBC + gRPC로 재구축하고, Redis Set 기반 멱등 처리로 동시성 문제 해결
  • Kafka 이벤트 아키텍처로 서비스 간 결합도를 낮추고 장애 격리성 확보
  • AWS S3·카카오 Object Storage를 단일 인터페이스로 추상화해 벤더 종속성 제거 및 스토리지 유연 전환 지원
  • SQS Producer/Consumer 패턴으로 예약 메시지 발송을 재설계하고, 대량 적재는 Bulk Insert·병렬 처리로 개선, DLQ 분석으로 간헐적 장애의 근본 원인 해결

2016.05 — 2021.01

HamonSoft — Full-stack Developer금융/공공 · 관제 · 데이터
  • 우리은행 영업점 전용회선 재구축 사업 PL로 프로젝트 일정 및 품질 관리
  • 군·공공기관 웹 시스템 및 관제 솔루션(NMS/SMS/TMS) 설계·개발
  • 대규모 엑셀 데이터 업로드 병렬 처리 구조 개선으로 처리 속도 및 안정성 향상

Projects

Jarvis

직접 설계하고 운영하는 개인 AI 비서. 매일 아침 브리핑을 정리하고, 주식 알림을 보내고, 시스템 장애를 감지합니다. AI를 쓰는 것과 안정적으로 돌아가게 만드는 건 다른 문제라, 실제 서버처럼 재시도와 비용, 장애를 관리합니다.

Claude Code · MCP · Node.js개발기 →

Gatsby 블로그 스타터

이 블로그를 구동하는 Gatsby 스타터. 직접 개발하고 유지보수합니다.

Gatsby · React · GraphQLGitHub →

기술 블로그

백엔드 운영과 트러블슈팅, AI 에이전트 경험을 기록합니다.

운영 · 트러블슈팅 · AI블로그 →

Education

  • 세종대학교 컴퓨터공학부 학사 (2010–2016)
  • 고용노동부 웹·안드로이드 국비교육 수료 (2015)

Certifications

AWS Solutions Architect – ProfessionalSAP-C02 · 2026
AWS DevOps Engineer – ProfessionalDOP-C02 · 2026
AWS Generative AI Developer – ProfessionalAIP-C01 · 2026
AWS AI PractitionerAIF-C01 · 2026
정보처리기사2018

개발 철학

기능을 만드는 일은 어렵지 않습니다. 어려운 건 그게 몇 년 뒤에도, 트래픽이 몇 배로 늘어도 버티도록 설계하는 일입니다. 눈에 띄지 않아도 오래 안정적으로 돌아가는 시스템, 그게 제가 만들고 싶은 백엔드입니다.

기술은 혼자 쌓아두면 팀의 병목이 됩니다. 배운 건 블로그와 사내 문서로 남겨서, 동료가 같은 문제를 두 번 풀지 않게 합니다.

AI와 함께 일하기

2025년부터 Claude와 GPT를 도구로 쓰다가, 지금은 직접 AI 에이전트를 만들어 운영합니다. 처음엔 코드 리뷰를 거드는 정도였는데, 어느새 아침 브리핑을 챙기고 주식 알림을 보내고 장애까지 감지하고 있습니다.

백엔드 개발자에게 AI를 쓰는 것과, AI가 안정적으로 돌아가게 만드는 건 전혀 다른 일이더군요. 요청 한도에 걸리고, 재시도를 설계하고, 비용을 들여다보는 일 — 결국 서버 운영에서 늘 하던 고민과 똑같았습니다. 그 경험을 이 블로그 AI 카테고리에 정리하고 있습니다.

OpenClawClaude CodeMCPAI Agent