데이터브릭스
Databricks는 Apache Spark 창립팀이 설립한 통합 데이터 레이크 웨어하우스이자 AI 플랫폼입니다. 데이터 엔지니어링 SQL 분석부터 ML 교육 및 LLM 미세 조정까지 전체 링크 기능을 제공합니다. 핵심 제품에는 Databricks MLflow, Feature Store, Model Serving 및 mosaic AI가 포함됩니다.
데이터브릭스
Databricks의 핵심 매개변수 및 통계
데이터브릭스는 단순한 트레이닝 프레임워크나 데이터 웨어하우스가 아닌 통합된 '데이터 + AI' 플랫폼으로 포지셔닝됩니다. 데이터 레이크 웨어하우스(Delta Lake), SQL 분석, ML 실험 추적 및 대규모 모델 교육을 동일한 거버넌스 시스템에 배치하며 핵심 제공 형태는 엔터프라이즈급 호스팅 플랫폼입니다.
| 프로젝트 | 공공정보 |
|---|---|
| 공식 포지셔닝 | 데이터 + AI 통합 플랫폼 |
| 핵심 형태 | 데이터 레이크 웨어하우스 + ML 플랫폼 + AI 추론 배포 |
| 배포 경로 | 멀티 클라우드 호스팅(AWS, Azure, GCP), 아직 독립형 버전 없음 |
| 핵심 구성 요소 | Delta Lake, MLflow, Unity 카탈로그, 모자이크 AI, 모델 제공, 서버리스 SQL |
| 오픈 소스 프로젝트 | Apache Spark, Delta Lake, MLflow, Apache Iceberg 통합 |
| 시장가치 | 2024년 기준 약 430억 달러, 2025년 신규 자금 조달 규모는 600억 달러 이상에 달할 것이라는 소문 |
| 주요 인수 | mosaicML(2023년, 13억 달러), Tabular(2024년, 금액 미공개), Arcion(2024) |
| 기업 고객 | 전 세계 10,000개 이상의 기업 고객(2025년 기준 공식 공개) |
모자이크 AI 통합의 본질: Databricks는 2023년 모자이크ML을 인수한 후 LLM 교육 프레임워크뿐만 아니라 MPT 시리즈 오픈 소스 모델 가중치와 MLSys 정상 회의 배경 지식을 갖춘 엔지니어링 팀도 확보했습니다. 이를 통해 Databricks는 경쟁 환경에서 "데이터 레이크 웨어하우스 회사"에서 "데이터 + AI 플랫폼 회사"로 ID 전환을 완료하여 Snowflake, AWS SageMaker 및 Google Vertex AI와 직접 3단계 교차 경쟁을 형성할 수 있었습니다.
다중 클라우드 전략의 숨겨진 비용: 다중 클라우드 지원이 주장되지만 각 클라우드의 서비스 가용성은 일관되지 않습니다. AWS의 Photon 엔진은 가장 최적화되어 있고 Azure는 Active Directory와 긴밀하게 통합되어 있으며 GCP는 가장 최근에 시작되었으며 일부 고급 기능은 출시가 지연됩니다. 모델을 선택할 때 기업은 "멀티 클라우드" 약속으로 인해 실제 마이그레이션 비용을 과소평가하지 않도록 대상 클라우드의 기능 완전성을 확인해야 합니다.
Databricks 사용자 및 시장 인지도
데이터브릭스의 시장 인지도는 'B면이 강하고 C면이 약하다'는 명확한 패턴을 보여준다. 상업적 가치는 개별 개발자의 입소문 확산보다는 주로 기업 수준의 데이터 및 AI 팀의 조달 결정에 의해 주도됩니다.
엔터프라이즈 고객 규모: 공식 공개에 따르면 Databricks는 금융 서비스, 의료, 소매, 제조, 미디어, 엔터테인먼트 및 기타 산업을 포괄하는 전 세계 10,000개 이상의 기업 고객에게 서비스를 제공하고 있습니다. 일반적인 고객으로는 Shell Regeneron, Comcast H&M 등이 있습니다. 2025 회계연도 매출은 20억 달러를 초과하며 전년 대비 성장률은 40% 이상을 유지합니다. 수익 구조는 연간 기업 계약(예약된 DBU 패키지 및 유연한 종량제 부분 포함)에 의해 지배됩니다. 커뮤니티 버전과 개인 버전은 직접적인 수익이 거의 발생하지 않습니다.
오픈소스 생태학적 영향: Apache Spark는 GitHub에서 별 39,000개 이상, Delta Lake는 별 7,500개 이상, MLflow는 별 19,000개 이상 등 3대 오픈소스 프로젝트의 데이터를 확인할 수 있습니다. 이 세 가지 프로젝트의 커뮤니티 활동 및 기업 채택률은 유사한 프로젝트 중 선두에 있습니다. 그러나 이러한 오픈 소스 프로젝트와 Databricks 상용 제품 사이에 "오픈 소스 커뮤니티 버전 대 엔터프라이즈 강화 버전"의 기능적 계층이 있다는 점은 주목할 가치가 있습니다. 일부 고급 기능(예: Delta Sharing, Photon 벡터화 엔진 MLflow 엔터프라이즈 수준 인증)은 상용 버전에서만 사용할 수 있습니다.
업계 경쟁 환경: Databricks와 Snowflake는 데이터 웨어하우스/레이크 웨어하우스 분야에서 직접 경쟁하고 있습니다. Snowflake는 "사용 용이성 및 호스팅 경험"으로 유명하며 Databricks는 "AI 통합의 개방성과 깊이"로 유명합니다. Gartner와 같은 분석 기관은 데이터 관리 분야의 리더 사분면에 두 가지를 나란히 배치했습니다. 그러나 실제 선택에서 두 가지가 완전히 대체되는 것은 아닙니다. 표준 SQL 분석을 선호하고 Spark 생태계에 의존하지 않는 팀은 Snowflake를 선호하는 경향이 있습니다. 이미 Spark/ML 기술 스택을 보유하고 있고 데이터와 AI 플랫폼을 통합해야 하는 기업은 Databricks를 선호하는 경향이 있습니다.
제3자 평가 및 벤치마크: 데이터+AI 통합 플랫폼 범주에서 TPCDS 벤치마크 테스트에서 Databricks의 성능은 유사한 경쟁 제품보다 2~4배 우수하지만(Photon 벡터화 엔진 덕분에) TPC-H 기존 데이터 웨어하우스 시나리오에서는 이점이 명확하지 않습니다. ML 플랫폼 차원에서 MLflow의 커뮤니티 채택률은 Kubeflow 및 SageMaker Pipelines보다 앞서지만 프로덕션 수준 관찰 가능성 및 모델 모니터링 깊이 측면에서 일부 시나리오에서는 MLflow를 대체할 수 있는 타사 도구(예: Weights & Biases, Arize AI)가 여전히 있습니다.
Databricks의 비용 이점
데이터브릭스의 비용 구조는 "컴퓨팅 서비스와 플랫폼 서비스에 대한 이중 과금"의 특징을 나타냅니다. 비용은 기본 클라우드 리소스 요금과 상위 계층 Databricks DBU(Databricks Unit)로 구성됩니다. 비용 관리를 위해서는 이 2계층 아키텍처를 이해하는 것이 전제 조건입니다.
C 클라이언트/개인 사용자: 커뮤니티 버전은 제한된 무료 할당량을 제공하므로 개인 학습 및 소규모 실험에 적합합니다. 그러나 Community Edition에는 클러스터 동시 실행 수가 제한되고, Unity Catalog 엔터프라이즈 수준 거버넌스가 지원되지 않으며, mosaic AI 교육 액세스가 없고, 최대 저장 용량이 제한되는 등 여러 가지 엄격한 제한 사항이 있습니다. Databricks에서 데이터 엔지니어링 및 ML을 배우고 싶은 개인 사용자의 경우 커뮤니티 버전으로 시작하기에 충분합니다. LLM 미세 조정 또는 프로덕션 수준 배포에 참여한 후에는 종량제 또는 선불 요금제로 업그레이드해야 합니다.
개발자/API 호출: Serverless SQL Warehouse 또는 Notebook API를 통해 호출하는 경우 DBU 사용량을 기준으로 요금이 청구되며 통합된 고정 패키지가 없습니다. DBU 단가는 워크로드 유형(SQL, ETL, ML 교육, 추론) 및 클라우드 공급업체에 따라 다릅니다. AWS의 SQL Warehouse를 예로 들면 DBU당 약 $0.55(참고 가격, 공식 가격 페이지에 따름)이며 단일 중간 쿼리는 1~5 DBU를 소비합니다. 이는 간단한 분석의 직접적인 계산 비용이 $0.5-$3일 수 있으므로 소규모 팀이 유연하게 사용하는 데 적합하다는 것을 의미합니다.
기업/개인 배포: 이것이 Databricks의 실제 수익 핵심입니다. 기업은 일반적으로 세 가지 주요 비용 요소를 포함하는 기업 계약을 통해 구매합니다.
| 비용 요소 | 설명 | 비율 추정 |
|---|---|---|
| DBU 사전 구매 패키지 | 연간 또는 다년 계약을 선불로 지불하고 할인된 요금을 받으세요(일반적으로 1년 계약의 경우 약 15-25%, 3년의 경우 최대 30-40%) | 약 50-60% |
| 클라우드 인프라 | 기본 AWS/Azure/GCP 리소스(EC2/VM, S3/Blob Storage, 네트워크 트래픽)는 DBU | 약 30-40% |
| 부가 가치 서비스 | 엔터프라이즈 수준 지원 계획, 교육, 전문 서비스(PS) 및 기타 선택적 추가 기능 | 약 5-10% |
기업 계약에서 주목할 가치가 있는 것은 예약 비용 효율성 및 유연한 과매도 위험입니다. DBU 패키지를 사전 구매하면 단가를 크게 줄일 수 있지만, 예약된 DBU가 실제로 다 사용되지 않으면 만료(사용하지 않으면 손실)되는 경우가 많아 숨겨진 낭비가 발생합니다. 반대로, 초과판매로 인해 선불제(초과분)가 발생하면 단가는 구매 전 가격보다 40~60% 더 높아집니다. 따라서 권장되는 구매 전략은 예상 사용량의 70~80%를 기준으로 예약 패키지를 구매하고 나머지 부분은 볼륨을 기준으로 유연하게 구매하고 계약서에 "예약 DBU는 연장 가능" 조항을 명시하도록 노력하는 것입니다.
경쟁 제품을 사용한 비용 벤치마킹: Snowflake와 비교하여 Databricks는 ETL 및 ML 교육 시나리오에서 Spark와의 기본 통합으로 인해 플랫폼 간 데이터 전송 비용을 방지합니다(Snowflake는 ML 교육 환경으로 데이터를 출력할 때 추가 송신 비용이 발생함). 그러나 순수한 SQL 분석 시나리오에서는 Snowflake의 초당 청구 및 자동 일시 중단 전략이 일반적으로 활동이 적은 기간에 더 경제적입니다. AWS SageMaker와 비교하여 Databricks의 통합 거버넌스(Unity Catalog)는 여러 도구 간의 권한 동기화에 대한 숨겨진 운영 및 유지 관리 비용을 제거합니다.
데이터브릭스의 주요 기능
Databricks의 기능 시스템은 흩어져 있는 도구를 하나로 묶는 것이 아니라 "레이크에 데이터 입력 -> 관리 -> 분석 -> 훈련 -> 배포"라는 완전한 개념을 중심으로 진행됩니다.
-
Delta Lake Data Lake Warehouse: 통합 스토리지 계층은 ACID 트랜잭션 스키마 진화 및 시간 여행(데이터 버전 역추적)을 제공합니다. 원본 파일을 처리하기 위해 Spark를 직접 사용하는 것과 비교하여 Delta Lake는 "더티 쓰기" 및 "중간 업데이트"로 인한 데이터 불일치를 방지하여 데이터베이스 수준까지 데이터 안정성을 향상시킵니다. 수용 문제: 레이크 웨어하우스 시나리오에서는 선택하기 전에 매우 큰 테이블(PB 수준)에 대한 Delta Lake의 OPTIMIZE/ZORDER 유지 관리 작업의 실행 시간과 리소스 소비를 벤치마킹해야 합니다.
-
Unity 카탈로그 통합 거버넌스: 데이터, 기능, 모델 및 노트북을 포괄하는 세분화된 액세스 제어는 Databricks의 엔터프라이즈 수준 기능의 핵심 장벽입니다. Unity 카탈로그는 여러 팀이 클러스터를 공유할 때 "데이터의 위치, 데이터에 액세스할 수 있는 사람, 감사 방법"과 같은 핵심 문제를 해결하여 작업 공간 전반에 걸쳐 메타데이터에 대한 통합 보기를 제공합니다. 경쟁 제품과의 차이점: Snowflake의 거버넌스는 컴퓨팅 레이어와 독립적인 반면, Unity Catalog는 Databricks의 컴퓨팅 레이어와 긴밀하게 통합되어 있습니다. 즉, 외부 엔진을 사용하여 Unity Catalog에서 관리하는 데이터에 액세스하는 경우 거버넌스 정책의 일관성이 문제가 될 것입니다.
-
모자이크 AI 모델 훈련 및 미세 조정: mosaicML 인수를 통해 획득한 역량을 바탕으로 LLM 분산 훈련, 미세 조정 및 평가를 제공합니다. Megatron-LM, FSDP 등의 병렬 전략은 물론 최적화된 자체 Composer 교육 라이브러리도 지원합니다. 플랫폼은 실험 추적 Checkpoint 저장 및 모델 등록을 직접 관리하여 실험에서 생산까지 마이그레이션하는 데 드는 비용을 절감합니다. 구현 팁: 모자이크 AI 훈련 작업은 많은 양의 DBU를 소비합니다. 개발 단계에서 학습 파이프라인과 데이터 품질을 검증하기 위해 소규모 모델(예: 7B 매개변수 수준)을 사용한 다음 확인 후 70B+ 규모로 확장하는 것이 좋습니다.
-
MLflow 전체 수명 주기 관리: 기본 내장 MLflow는 실험 추적, 모델 등록, 버전 관리 및 배포를 지원합니다. MLflow의 개방성은 Databricks에 바인딩되지 않는다는 사실에 있습니다. 동일한 실험 기록 세트는 외부 추론 컨텍스트에서 읽을 수 있지만 Databricks에서 제공하는 MLflow 배포(모델 제공)는 GPU 확장 대기 시간 및 A/B 테스트 지원 측면에서 커뮤니티 버전보다 낫습니다.
-
Delta Sharing 개방형 데이터 공유: 수신자가 Databricks를 사용하지 않고도 공유 데이터를 읽을 수 있는 플랫폼 간, 조직 간 보안 데이터 공유 프로토콜입니다. 이는 대규모 데이터 협력 시나리오(업스트림 및 다운스트림 공급망 간 데이터 공유, 금융 기관의 공동 위험 제어 모델링 등)에서 마찰이 적은 협업 솔루션을 제공합니다.
-
Photon Vectorization Engine: SQL 분석 및 ETL 시나리오(공식 벤치마크)에서 기존 Spark JVM 엔진보다 2~4배 빠른 Delta Lake에 최적화된 네이티브 C++ 엔진입니다. Photon은 자동으로 활성화되며 사용자 조정이 필요하지 않습니다. 그러나 가속 효과는 열 검색 및 집계 쿼리에서 가장 명백하며 셔플이 자주 발생하는 복잡한 JOIN 시나리오에서는 개선이 제한된다는 점에 유의해야 합니다.
Databricks 모델 및 버전 진화
독립 소프트웨어가 아닌 호스팅 플랫폼인 Databricks의 버전 진화는 런타임(Databricks Runtime, DBR)을 기반으로 하며, 분기마다 약 한 번씩 LTS 메이저 버전이 출시되고 월별 마이너 버전이 보완됩니다. 다음은 검증 가능한 주요 릴리스 마일스톤입니다.
DBR 메인라인 LTS 출시
| 버전 | 출시일 | 핵심 변경 사항 |
|---|---|---|
| DBR 10.4 LTS | 2022-04 | Spark 3.2.x, Photon 공개 미리보기 소개 |
| DBR 11.3 LTS | 2022-08 | Unity 카탈로그 GA, MLflow 2.0 통합 |
| DBR 12.2 LTS | 2023-04 | Photon GA, 서버리스 SQL 공식 출시, Delta Lake 2.3 |
| DBR 13.3 LTS | 2023-08 | MLflow 2.4, 모자이크 AI 통합 시작, Delta Sharing GA |
| DBR 14.3 LTS | 2024-04 | Spark 3.5.x, ETL로 확장된 Photon, Unity 카탈로그 리니지 GA |
| DBR 15.4 LTS | 2025-12 | 최신 LTS 버전은 모자이크 AI 교육을 완벽하게 지원하고 Lakehouse Federation |
버전 정책 참고: Databricks의 LTS 버전은 최소 2년의 유지 관리 주기를 제공하고 LTS가 아닌 버전은 6개월만 제공합니다. 프로덕션 워크로드의 경우 항상 LTS 릴리스를 사용하고 업그레이드하기 전에 주요 릴리스 후 2~3개월을 기다리는 것이 좋습니다. 커뮤니티 피드백 주기를 기다리는 것은 이전 릴리스의 안정성 문제를 피하는 데 도움이 될 수 있습니다.
제품 마일스톤(비런타임 수준)
- 2020-06: Delta Lake는 오픈 소스로 Lakecang의 기술 로드맵의 기반을 마련합니다.
- 2021-06: Databricks SQL GA, 데이터 엔지니어링에서 SQL 분석 시장으로 이동, Snowflake를 직접 벤치마킹.
- 2022-07: 다중 팀 데이터 거버넌스 단편화 문제를 해결하기 위해 Unity 카탈로그가 공식 출시되었습니다.
- 2023-06: LLM 교육 기능 및 MPT 시리즈 모델을 확보하기 위해 mosaicML을 인수했습니다(13억 달러).
- 2024-06: Iceberg 통합 강화를 위해 Tabular(Apache Iceberg 핵심 기여자 팀) 인수.
- 2025-05: Lakehouse Federation GA, 마이그레이션 없이 외부 데이터 소스(Snowflake, Redshift, PostgreSQL 등)에 대한 통합 쿼리.
핵심 판단: Databricks 버전 진화의 주요 라인은 "Spark 호스팅 플랫폼에서 데이터 + AI 통합 플랫폼"으로의 전환입니다. 2023년의 mosaicML 인수가 전환점이 되었습니다. 이후 LTS가 출시될 때마다 데이터 엔지니어링과 AI 교육 간의 경험 격차가 줄어들었습니다. 2025년 Lakehouse Federation은 신호를 발표합니다. 즉, 더 이상 Delta Lake에 데이터가 있어야 할 필요가 없지만 거버넌스 범위를 외부 데이터 소스로 확장하여 기존 Snowflake/Redshift 사용자가 Databricks로 마이그레이션하는 임계값을 낮춥니다.
Databricks의 기술적 장점
Databricks의 기술적 장벽은 단일 구성 요소의 절대적인 성능 리더십에 있는 것이 아니라 "데이터 엔지니어링과 AI 훈련 간의 거울 격차"를 해결하는 데 있습니다. 기존 아키텍처에서는 데이터가 웨어하우스에서 관리되지만 훈련 모델은 데이터를 독립적인 환경으로 ETL해야 하며 프로세스에서 권한, 버전 및 품질 추적이 깨지는 경우가 많습니다.
통합 스토리지 및 거버넌스: Delta Lake + Unity Catalog의 조합은 "데이터가 있는 곳에 AI가 있다"는 아키텍처를 실현합니다. 모델 교육에는 데이터 웨어하우스 외부로 데이터를 이동하기 위해 더 이상 추가 ETL이 필요하지 않습니다. 교육 스크립트는 Delta Lake에서 선별된 데이터를 직접 읽고 Unity Catalog를 활용하여 테이블의 행 수준/열 수준 권한을 상속합니다. 이 아키텍처의 직접적인 효과는 데이터 엔지니어링팀과 ML팀이 동일한 데이터, 동일한 권한 구성 세트, 동일한 감사 로그 세트를 사용하여 팀 간 조정에 따른 '번역 비용'을 제거한다는 것입니다.
Photon 엔진의 벡터화된 실행: Photon은 Databricks가 C++로 다시 작성한 쿼리 실행 엔진으로, Spark의 JVM 기반 실행을 기본 벡터화된 실행으로 대체합니다. TPCDS 벤치마크에서 Photon은 일반적인 SQL 쿼리에 대한 대기 시간을 2~4배 줄였습니다. 기술 핵심에는 열 기반 벡터화 처리(SIMD 명령 세트 사용), 적응형 실행 계획 최적화(셔플 파티션 수의 적응형 조정), 특별히 최적화된 해시 집계 및 JOIN 알고리즘이 포함됩니다. Photon은 사용자가 SQL 또는 파이프라인 코드를 수정하지 않고도 자동으로 활성화됩니다. 즉, 기업은 기존 코드를 변경하지 않고도 성능 향상을 얻을 수 있으며 마이그레이션 비용은 거의 0에 가깝습니다.
Mosaic AI를 위한 분산 교육 최적화: 모자이크ML 인수를 통해 Databricks는 Composer 교육 라이브러리와 Flash Attention 통합을 플랫폼에 심층적으로 통합합니다. 미세 조정된 벤치마크인 Llama 2/3 시리즈에서 mosaic AI의 처리량은 표준 PyTorch FSDP 구현(공식 벤치마크, 실제 상황에 따라 다름)보다 약 1.3~1.8배 더 높습니다. 주요 최적화에는 자동 그래디언트 누적, 활성화 체크포인트, FP8 혼합 정밀 교육, 교육 데이터의 무복사 판독을 달성하기 위한 Photon 엔진과의 연결 등이 포함됩니다. 실제 함정: 분산 훈련의 안정성은 네트워크 토폴로지에 크게 영향을 받습니다. NCCL 시간 초과로 인해 훈련이 자주 중단되는 것을 방지하려면 공식적으로 훈련을 시작하기 전에 지연 대역폭 테스트를 사용하여 노드 간 통신 성능을 확인하는 것이 좋습니다.
Lakehouse Federation을 위한 제로 마이그레이션 쿼리: GA 2025의 기능. 사용자는 데이터 이동 없이 Unity Catalog를 통해 Snowflake, Redshift, BigQuery, PostgreSQL 등과 같은 외부 데이터 소스를 직접 쿼리할 수 있습니다. 연합 계층은 전체 테이블을 복사하는 대신 조건자 푸시다운 및 통계 정보 정리를 사용하여 실제로 필요한 행과 열만 계산 계층으로 다시 가져옵니다. 이는 "마이그레이션 전환기"의 기업에 양쪽 시스템이 공존할 수 있는 기능을 제공하여 "올인 마이그레이션"에 따른 의사 결정 압력과 비즈니스 중단 위험을 줄입니다.
보안 및 규정 준수 아키텍처: Unity Catalog는 행 수준 필터링, 열 수준 마스킹(열 수준 마스킹) 및 속성 기반 액세스 제어(ABAC)를 제공합니다. SOC 2 및 GDPR 규정 준수 요구 사항을 충족하기 위해 감사 로그를 SIEM 시스템으로 내보낼 수 있습니다. 데이터는 전송 및 저장 과정에서 기본적으로 암호화되며, 고객은 BYOK(Bring Your Own Key)를 통해 암호화 키를 관리할 수 있습니다. 규정 준수 경계: Databricks의 인증은 SOC 2 Type II, ISO 27001 및 HIPAA를 포함하지만 중국에서 운영할 때 데이터 상주 제한에 주의해야 합니다. 중국의 규정 준수 배포는 Azure 중국 지역 또는 파트너를 통해 완료해야 하며 직접 다중 클라우드 글로벌 배포는 분류 요구 사항을 완전히 충족하지 못할 수 있습니다.
데이터브릭스를 사용하는 방법
Databricks의 사용 입구는 역할과 시나리오에 따라 세 가지 경로로 구분됩니다. 각 경로에는 서로 다른 기능과 권한이 있습니다.
| 사용 방법 | 역할에 적합 | 특징 | 비용 |
|---|---|---|---|
| 작업공간 UI | 데이터 엔지니어, 데이터 과학자 | 노트북 개발 SQL 쿼리 대시보드 구축 ML 실험 추적 | DBU + 클라우드 리소스 기준 |
| 서버리스 SQL 웨어하우스 | SQL 분석가 | 순수 SQL 쿼리, 클러스터 관리 필요 없음, 자동 확장 및 축소 | DBU로 청구 |
| API/SDK | 플랫폼 엔지니어 ML 엔지니어 | REST API 또는 Python SDK를 통해 프로그래밍 방식으로 작업, 모델 배포 및 클러스터 관리 | DBU별로 청구됨 |
일반적인 작업흐름:
-
작업 영역 생성: 대상 클라우드(AWS/Azure/GCP)에 Databricks 작업 영역을 생성하고 Unity Catalog 메타데이터 초기화 및 ID 공급자(IdP) 통합을 완료합니다. 이 단계는 일반적으로 클라우드 콘솔 또는 Databricks 계정 콘솔에서 완료되며 약 1~2일이 소요됩니다(네트워크 구성 및 보안 정책 조정 포함).
-
레이크에 데이터: 자동 로더(클라우드 스토리지에 있는 새 파일의 증분 읽기) 또는 COPY INTO 명령을 통해 원시 데이터(CSV, JSON, Parquet)를 Delta Lake 테이블에 로드합니다. Auto Loader는 스키마의 자동 추론 및 진화를 지원하여 스키마를 수동으로 정의하는 작업량을 줄여줍니다.
-
데이터 변환 및 분석: Notebook에서 ETL용 Python/SQL/Scala를 사용하거나 Databricks SQL을 통해 임시 쿼리를 수행합니다. 프로덕션 ETL 작업의 경우 종속성 및 증분 업데이트를 자동으로 처리하는 DLT(델타 라이브 테이블)를 사용하여 데이터 파이프라인을 선언적으로 정의하는 것이 좋습니다.
-
ML 훈련 및 모델 배포: 노트북 또는 모자이크 AI 인터페이스에서 훈련 작업을 시작하면 실험 지표가 MLflow에 자동으로 기록되고 모델 제품이 Unity 카탈로그의 모델 레지스트리에 등록됩니다. 등록된 모델을 모델 제공 엔드포인트에 배포하고, GPU 자동 크기 조정 규칙을 구성하고, 호출할 다운스트림 애플리케이션에 대한 REST API를 노출합니다.
일반적인 통합 시나리오: Databricks는 기본적으로 MLflow Tracking과 통합됩니다. 학습 코드에서 mlflow.start_run()을 호출하면 추가 구성 없이 매개변수, 지표, 모델 제품을 자동으로 기록할 수 있습니다. 외부 MLflow 서버를 사용하는 경우 클러스터에 'mlflow' 라이브러리를 설치하고 추적 URI를 구성해야 합니다.
제품 가격
가격 모델은 공식 실시간 페이지에 따릅니다. 일반적으로 프리미엄(Freemium)이나 구독제(Subscription System)를 채택하고 기본 기능은 무료로 사용할 수 있으며, 고급 기능이나 빈도가 높은 기능을 사용하려면 결제가 필요합니다.
애플리케이션 시나리오
Databricks의 애플리케이션 시나리오는 기존 데이터 엔지니어링과 AI 교육의 두 가지 차원을 포괄합니다. 다음 네 가지 시나리오는 실제 기업 배포에서 널리 검증되었습니다.
-
엔터프라이즈 레이크 및 웨어하우스 통합 구축: 원래 Hadoop/Spark 클러스터와 여러 데이터 소스를 Delta Lake에 통합하여 동일한 플랫폼에서 데이터 관리 및 AI 교육을 실현합니다. 일반적인 고객 경로: 먼저 여러 주요 데이터 필드(예: 사용자 행동, 거래 기록)에서 기존 Hive 테이블을 교체하고 성능 개선 및 데이터 품질 개선을 확인한 후 점차적으로 모든 데이터 소스로 확장합니다. 구현 팁: 레이크 웨어하우스 구축의 첫 번째 단계에서 모든 데이터 마이그레이션을 추구하는 것은 권장되지 않습니다. 관리가 필요한 고주파 쿼리 및 데이터 도메인 마이그레이션에 우선순위가 부여됩니다. 액세스 빈도가 낮은 보관된 데이터는 Delta Sharing 또는 외부 테이블을 통해 그대로 유지될 수 있습니다.
-
라이브 및 배치 ETL 파이프라인: 자동 로더 및 델타 라이브 테이블을 사용하여 선언적 데이터 파이프라인을 구축하여 클라우드 스토리지에서 데이터를 점진적으로 로드하고 스키마 발전 및 데이터 품질 제약 조건을 자동으로 처리합니다. DLT의 기대 메커니즘을 사용하면 데이터 품질 규칙(비어 있지 않음, 고유성, 참조 무결성)을 정의할 수 있으며 규칙을 충족하지 않는 데이터는 전체 파이프라인을 차단하지 않고 "실패" 또는 "경고" 대기열에 들어갑니다. Airflow 솔루션과의 차이점: DLT에는 DAG 및 구성 일정을 수동으로 작성할 필요가 없습니다. ETL 논리는 SQL 또는 Python으로 선언되며 플랫폼은 실행 계획 및 오류 복구를 자동으로 관리합니다.
-
LLM 미세 조정 및 엔터프라이즈 규모 모델 배포: 모자이크 AI를 활용하여 독점 데이터 세트에서 오픈 소스 대규모 모델(Llama, Falcon, MPT 등)을 미세 조정합니다. 핵심 가치는 훈련 프레임워크 자체가 아니라 Unity 카탈로그와의 통합입니다. 훈련 데이터는 관리되는 Delta Lake 테이블에서 직접 읽고, 모델 제품은 카탈로그에 등록되어 Model Serving에 의해 배포되며, 전체 링크의 데이터 계보 및 권한 제어가 균일하게 감사됩니다. 시나리오 경계: 기업이 자체 데이터로 모델을 교육하는 대신 외부 API(예: OpenAI 또는 Anthropic 사용)만 호출하면 되는 경우 Databricks의 장점은 유효하지 않습니다. 가벼운 도구(예: LangChain + 벡터 데이터베이스)가 더 비용 효율적입니다.
-
데이터 과학 및 ML 탐구 분석: 데이터 과학자는 노트북을 사용하여 신속하게 데이터를 탐색하고, 프로토타입 모델을 교육하고, 실험을 MLflow에 자동으로 기록합니다. Feature Store(온라인 기능 웨어하우스)를 추가하면 실험 모델을 프로덕션 추론에 원활하게 연결할 수 있어 "오프라인 AUC가 높고 온라인 기능이 없음"이라는 고전적인 중단점을 피할 수 있습니다. 구성 문제: Feature Store의 실시간 기능 지연 시간(보통 몇 초에서 몇 분)은 온라인 추론의 지연 시간 요구 사항과 일치해야 합니다. 밀리초 수준의 실시간 기능 요구 사항에는 Redis와 같은 외부 온라인 스토리지가 필요합니다.
해당자
Databricks는 역할별로 계층화된 명확한 적응 전략을 가지고 있지만 학습 곡선과 비용 임계값은 모든 데이터 실무자에게 적합하지 않다는 것을 결정합니다.
-
데이터 엔지니어링 팀: 핵심 사용자 그룹입니다. 통합 데이터 관리 ETL 및 거버넌스 도구는 다중 시스템 유지 관리 비용을 줄여줍니다. Delta Live Tables는 DAG 스타일 오케스트레이션에서 선언적 정의까지 파이프라인 유지 관리 워크로드를 줄여 팀이 파이프라인 예약보다 데이터 품질에 더 집중할 수 있도록 해줍니다. 경계에 맞지 않음: 팀의 핵심 워크로드가 이미 순수한 SQL 분석이고 ML 또는 스트림 처리가 필요하지 않은 경우 Snowflake 또는 Redshift는 학습 곡선이 더 얕고 총 비용이 더 낮을 수 있습니다.
-
ML 팀 및 데이터 과학자: 제한된 마이그레이션으로 인해 발생하는 불일치 문제를 줄이기 위해 실험부터 프로덕션까지 동일한 플랫폼에서 작업하기를 희망합니다. MLflow 통합 및 Feature Store의 가치는 이 역할에서 가장 분명합니다. 실험 매개변수, 모델 아티팩트 및 기능 파이프라인이 동일한 거버넌스 도메인 내에 있습니다. Unfit Boundary: 훈련 프레임워크에 대해 매우 높은 수준의 제어가 필요한 팀(예: LLM 사전 훈련 연구에 참여하는 AI Lab)의 경우 Databricks의 훈련 일정 유연성은 Slurm + 기본 PyTorch를 직접 사용하는 것보다 낮으며 대규모 훈련에서 GPU DBU 비용은 원래 GPU 인스턴스를 사용하는 것보다 높을 수 있습니다.
-
SQL 분석가 및 비즈니스 분석 팀: Databricks SQL을 사용하면 Python 또는 Scala를 작성하지 않고도 표준 SQL을 사용하여 Delta Lake 데이터를 쿼리할 수 있습니다. 서버리스 SQL Warehouse는 클러스터 관리 부담을 제거하지만 핵심 장애물은 SQL 방언의 차이입니다. 일부 복잡한 분석 기능은 표준 Spark SQL과 Photon 엔진에서 약간 다르게 작동할 수 있습니다. 전제 조건: 팀에는 기본적인 데이터 웨어하우스 개념이 있어야 합니다. SQL 지식이 전혀 없는 비즈니스 담당자가 직접 시작하는 것은 권장되지 않습니다.
-
엔터프라이즈 설계자 및 IT 의사 결정자: 보안 감사, 비용 제어 및 플랫폼 표준화에 중점을 두고 멀티 클라우드 환경에서 데이터와 AI 인프라를 통합해야 합니다. Unity 카탈로그와 Delta Sharing은 엔터프라이즈 규모 배포를 위한 규정을 준수하는 기반을 제공합니다. 경계에 적합하지 않음: 기업의 데이터 거버넌스가 아직 특정 수준의 성숙도에 도달하지 않은 경우(예: 기본 메타데이터 관리가 확립되지 않은 경우) Databricks를 직접 도입해도 거버넌스 문제가 자동으로 해결되지는 않지만 플랫폼의 복잡성으로 인해 운영 및 유지 관리 부담이 증가할 수 있습니다. 데이터 거버넌스 프레임워크를 먼저 구축한 후 플랫폼 기술을 선택하는 것이 좋습니다.
요약 및 전망
데이터브릭스의 핵심가치는 데이터 엔지니어링과 AI 트레이닝이라는 '동일 플랫폼' 개념에 있다. Delta Lake, Unity Catalog 및 mosaic AI의 결합을 통해 데이터 거버넌스, 모델 교육 및 추론 배포가 동일한 거버넌스 도메인에 통합되어 실험에서 생산으로의 컨텍스트 전환 비용과 숨겨진 데이터 전송 손실이 줄어듭니다.
현재 핵심 장점: Delta Lake + Unity Catalog + mosaic AI는 데이터 + AI 플랫폼의 가장 완벽한 조합 중 하나를 형성합니다. Photon 엔진은 코드 변경 없이 SQL 분석 시나리오에서 2~4배의 가속을 달성합니다. 오픈 소스 에코시스템(Spark, Delta Lake, MLflow)은 기업에 기술 스택 이식성을 제공하고 단일 클라우드 공급업체에 종속되는 것을 방지합니다. Lakehouse Federation은 외부 데이터 소스 마이그레이션의 마찰을 더욱 줄여줍니다.
현재 주요 제한 사항: DBU 가격은 원시 GPU 인스턴스를 직접 사용하는 것보다 대규모 교육 시나리오에서 총 비용이 더 높을 수 있습니다. 다중 클라우드 배포의 통합 운영 및 유지 관리 복잡성은 단일 클라우드 솔루션보다 높습니다. 클라우드 전반의 데이터 복제 지연 및 일관성 유지 관리에는 추가 엔지니어링 투자가 필요합니다. 순수 SQL 분석 시나리오에서 Snowflake와 직접 경쟁할 경우 표면 수준(진입 경험)에서는 학습 및 사용 비용이 불리합니다. mosaic AI의 훈련 프레임워크 스케줄링 유연성은 Slurm/PBS와 같은 전문 스케줄러를 직접 사용하는 것보다 여전히 낮습니다.
후속 관찰 포인트: 2025년에 인수한 Tabular 팀이 Iceberg 생태계에 미치는 영향 - Delta Lake와 Iceberg 간의 형식 경쟁은 어떻게 진행되나요? 서버리스 제품 라인이 ML 교육으로 확장되는지 여부(현재 서버리스는 SQL 및 ETL만 다루고 교육에는 여전히 수동 클러스터 관리가 필요함) 국내 시장에서 Databricks의 규정 준수 진행 상황 - 현재는 주로 Azure 중국 지역에 의존하고 있으며 직접적인 전체 스택 현지화 대안은 아직 성숙되지 않았습니다.
조달 및 채택 위험 평가: 기업은 먼저 중요하지 않은 데이터 도메인(예: 마케팅 분석 보고서 또는 내부 지식 기반)을 파일럿으로 선택하고 3~6개월 이내에 기능 검증 및 팀 역량 구축을 완료하고 확장하기 전에 기존 데이터 파이프라인에 대한 플랫폼의 적응성을 확인하는 것이 좋습니다. 조달 계약 수준에서는 DBU 단가 고정 기간 및 초과 판매 가격 한도, 예약 패키지의 미사용 할당량(연장 및 무효) 처리 방법, 데이터 마이그레이션 수수료 조건, Unity 카탈로그와 기존 IdP(LDAP/AD/Okta) 간의 통합 성숙도에 중점을 둡니다. 데이터 주권에 대한 엄격한 요구 사항이 있는 산업(금융, 정부 업무, 의료)의 경우 단일 공급자 종속의 위험을 피하기 위해 민영화된 배포 또는 Azure 독점 지역 솔루션 외에도 제어 솔루션으로 오픈 소스 기술 스택(Trino + Iceberg + MLflow)의 자체 구축 경로를 동시에 평가하는 것이 좋습니다. 종합하면, Databricks는 해당 분야에서 가장 완벽한 기능을 갖춘 플랫폼 중 하나이지만, 가치 출시는 회사의 데이터 거버넌스 성숙도와 엔지니어링 팀의 기술 보유량에 크게 좌우됩니다. 이 두 가지 전제 조건이 충족되지 않으면 플랫폼의 투자 수익이 크게 할인됩니다.
관련 도구: hugging-face, replicate
데이터브릭스를 사용하는 방법
- 웹 클라이언트 : 공식 홈페이지에 접속하여 계정을 등록하시면 사용하실 수 있습니다. 대부분의 기능은 설치가 필요하지 않습니다.
- API 액세스: RESTful API를 제공하므로 개발자는 API 키를 획득하여 자신의 애플리케이션에 통합할 수 있습니다.
버전 정보
- Databricks 2026년 6월 플랫폼 업데이트 :클라우드 플랫폼은 지속적으로 반복되고 있으며 아직 고정된 버전 번호가 없습니다.
- Databricks 런타임 15.4 LTS :아직 공식적인 정확한 날짜는 없습니다.
사용자 후기