IT | 데이터·AI 통합 구현, 데이터브릭스 카카오스타일의 개인화 쇼핑 혁신
카카오스타일이 데이터브릭스(Databricks)를 통해 분산된 데이터 인프라를 통합하고, 데이터와 AI를 기반으로 개인화 쇼핑 경험과 운영 효율성을 고도화했다.
AI 기반 개인화 쇼핑 경험 혁신을 위한 데이터 인프라 전환: 패션·뷰티·라이프스타일을 아우르는 종합 스타일 커머스 플랫폼 카카오스타일은 AI를 활용한 고객 경험 혁신과 운영 효율화를 추진하며 개인화 추천과 검색 고도화, AI 리뷰 검수, AI 자동화 기획전 등 다양한 AI 기술을 서비스에 적용하고 있다. 그러나 기존 데이터 환경에서는 데이터 탐색, 모델 학습, 운영이 서로 분리되어 업무 효율성이 떨어졌으며, 배치 중심 파이프라인으로 인해 신상품 입고, 품절, 가격 변경 등 빠르게 변화하는 데이터를 실시간에 가깝게 반영하는 데에도 한계가 있었다.
또한 복잡한 파이프라인 구조와 통합 모니터링 체계의 부재로 데이터 품질 이슈를 사전에 탐지하기 어려웠다. 이에 카카오스타일은 데이터 관리, 분석, AI를 하나의 흐름으로 통합하기 위해 데이터브릭스 데이터 + AI 플랫폼을 도입했다.
데이터·분석·AI 통합을 통한 데이터 활용 및 업무 효율성 향상: 카카오스타일은 데이터브릭스를 중심으로 분산된 데이터 인프라를 통합하고, 데이터 파이프라인, 메타데이터 관리, 대시보드, 모델 서빙을 단계적으로 데이터브릭스로 이관했다. 이를 통해 전사 핵심 데이터를 안정적으로 제공하고 데이터 지연으로 인한 의사결정 공백을 해소했으며, 데이터 분석과 AI를 하나의 환경에서 운영할 수 있는 기반을 마련했다.
또한 데이터브릭스 지니(Genie)를 통해 현업 부서가 자연어 기반으로 직접 데이터를 탐색하고 활용할 수 있는 환경을 구축해 반복적인 분석 요청을 줄이고, 분석부터 시각화까지 하나의 흐름으로 연결했다. MLflow를 활용해 모델 배포 및 운영을 간소화하고, 유니티 카탈로그(Unity Catalog)를 통해 데이터 접근 권한과 관리 체계를 중앙화해 보안성과 데이터 신뢰성을 강화했다.
배치 실패 알림 약 90% 감소 및 쿼리 실행 속도 약 2.6배 개선: 데이터브릭스 서버리스 환경으로 이관한 이후 데이터 엔지니어링 팀 기준 배치 실패 알림이 약 90% 감소했으며, 기존 인프라 관리와 장애 대응에 투입되던 리소스를 데이터 품질 개선과 신규 파이프라인 개발에 집중할 수 있게 됐다.
또한 데이터브릭스의 Lakeflow Jobs, 서버리스 SQL, 모델 서빙 등의 기능을 활용해 기존 수 분에서 수십 분이 소요되던 쿼리 문법 오류 대응 시간을 1~2분 이내로 단축했다. 특정 쿼리 기준 실행 속도도 기존 대비 약 2.6배 빨라졌으며, 과거 며칠이 소요되던 대시보드 제작도 프롬프트 기반으로 빠르게 구축할 수 있게 됐다. 이를 통해 분석 및 개발 생산성을 높이고, 지니(Genie) 기반 셀프서비스 분석 환경을 바탕으로 현업의 데이터 기반 의사결정을 지원할 수 있는 기반을 마련했다.







