주요 컨텐츠로 이동

Data Engineering with Databricks - Korean

이 과정은 Databricks를 사용한 데이터 엔지니어링을 학습하기 위한 적절한 시작점이 되는 입문 과정입니다.

아래에서는 이 과정에 포함된 4개의 4시간짜리 모듈을 각각 설명합니다.


참고: 다음 4개 모듈의 경우, Databricks Academy는 Databricks 환경 내 강의실 세션을 위해 notebook 기반 형식으로 전환하고 있으며, 강의용 슬라이드 덱 사용을 중단합니다. 강의 notebook은 Vocareum lab 환경에서 액세스할 수 있습니다.


1. Data Ingestion with Lakeflow Connect


이 과정에서는 다양한 소스로부터 Databricks로 데이터를 수집하기 위한 확장 가능하고 간소화된 솔루션인 Lakeflow Connect를 종합적으로 소개합니다. 먼저 Lakeflow Connect 커넥터의 다양한 유형(Standard 및 Managed)을 살펴보고 배치, 증분 배치, 스트리밍 수집을 비롯한 여러 데이터 수집 기법을 학습합니다. 또한 Delta table과 Medallion 아키텍처 사용의 주요 이점도 검토합니다.


다음으로, Lakeflow Connect Standard Connectors를 사용하여 클라우드 오브젝트 스토리지에서 데이터를 수집하는 실용적인 기술을 개발합니다. 여기에는 CREATE TABLE AS SELECT (CTAS), COPY INTO, Auto Loader와 같은 방법을 다루며, 각 접근 방식의 이점과 고려 사항에 중점을 둡니다. 또한 Databricks Data Intelligence Platform으로 수집하는 동안 bronze 수준 테이블에 메타데이터 열을 추가하는 방법도 학습합니다. 이어서 rescued data 열을 사용하여 테이블 스키마와 일치하지 않는 레코드를 처리하는 방법과 이러한 데이터를 관리하고 분석하는 전략을 다룹니다. 또한 반정형 JSON 데이터를 수집하고 평면화하는 기법도 살펴봅니다.


그다음에는 Lakeflow Connect Managed Connectors를 사용하여 데이터베이스와 Software-as-a-Service (SaaS) 애플리케이션에서 데이터를 가져오는 엔터프라이즈급 데이터 수집을 수행하는 방법을 살펴봅니다. 또한 파트너 도구를 수집 워크로드에 통합하는 옵션으로 Partner Connect를 소개합니다.


마지막으로, MERGE INTO 작업과 Databricks Marketplace 활용을 비롯한 대체 수집 전략으로 과정을 마무리하며, 최신 데이터 엔지니어링 사용 사례를 지원하는 탄탄한 기반을 갖추게 됩니다.


2. Deploy Workloads with Lakeflow Jobs

Deploy Workloads with Lakeflow Jobs 과정에서는 Databricks 에코시스템 내의 통합 오케스트레이션 플랫폼인 Lakeflow Jobs를 사용하여 데이터, 분석, AI 워크플로를 오케스트레이션하고 자동화하는 방법을 학습합니다.


방향성 비순환 그래프(DAG)를 사용하여 데이터 워크로드를 설계 및 구현하고, 다양한 스케줄링 옵션을 구성하며, 조건부 작업 실행, run-if 종속성, for each 루프와 같은 고급 워크플로 기능을 구현하는 방법을 학습합니다.

이 과정에서는 적절한 컴퓨트 선택, 모듈식 오케스트레이션, 오류 처리 기법, 내결함성 설계를 갖춘 견고하고 프로덕션에 적합한 파이프라인을 만들기 위한 모범 사례를 다루며, 이 모든 것은 Databricks Data Intelligence Platform에 기본적으로 통합되어 있습니다.


3. Build Data Pipelines with Apache Spark Declarative Pipelines

이 과정에서는 Databricks의 Apache Spark Declarative Pipelines (SDP)를 사용하여 여러 스트리밍 테이블과 구체화된 뷰를 통한 증분 배치 또는 스트리밍 수집 및 처리를 위한 데이터 파이프라인을 구축하는 데 필요한 필수 개념과 기술을 소개합니다. Spark Declarative Pipelines를 처음 접하는 데이터 엔지니어를 위해 설계된 이 과정은 증분 데이터 처리, 스트리밍 테이블, 구체화된 뷰, 임시 뷰와 같은 핵심 구성 요소를 종합적으로 개괄하고 각각의 구체적인 목적과 차이점을 강조합니다.


다루는 주제는 다음과 같습니다.

SQL을 사용하여 Spark Declarative Pipelines의 다중 파일 편집기로 ETL 파이프라인 개발 및 디버깅(Python 코드 예제 제공)

Spark Declarative Pipelines가 파이프라인 그래프를 통해 파이프라인 내 데이터 종속성을 추적하는 방식

파이프라인 컴퓨트 리소스, 데이터 자산, 트리거 모드 및 기타 고급 옵션 구성


다음으로, Spark Declarative Pipelines의 데이터 품질 기대치(expectations)를 소개하고, 데이터 무결성을 검증하고 적용하기 위해 기대치를 파이프라인에 통합하는 과정을 안내합니다. 이후 학습자는 스케줄링 옵션을 포함하여 파이프라인을 프로덕션에 배포하는 방법과, 파이프라인 성능 및 상태를 모니터링하기 위한 파이프라인 이벤트 로깅 활성화 방법을 살펴봅니다.


마지막으로, 이 과정에서는 Spark Declarative Pipelines 내에서 AUTO CDC INTO 구문을 사용하여 Change Data Capture (CDC)를 구현해 천천히 변화하는 차원(SCD Type 1 및 Type 2)을 관리하는 방법을 다루며, 학습자가 CDC를 자신의 파이프라인에 통합할 수 있도록 준비시킵니다.


4. DevOps Essentials for Data Engineering

이 과정에서는 Databricks로 작업하는 데이터 엔지니어를 위해 특별히 설계된 소프트웨어 엔지니어링 모범 사례와 DevOps 원칙을 살펴봅니다. 참석자는 코드 품질, 버전 관리, 문서화, 테스트와 같은 핵심 주제에 대한 탄탄한 기반을 구축합니다. 이 과정은 DevOps에 중점을 두어 핵심 구성 요소, 이점, 그리고 데이터 엔지니어링 워크플로를 최적화하는 데 있어 지속적 통합 및 배포(CI/CD)의 역할을 다룹니다.


재사용 가능한 구성 요소를 만들고 코드를 효율적으로 구조화하기 위해 PySpark에서 모듈성 원칙을 적용하는 방법을 학습합니다. 실습에는 pytest 프레임워크를 사용하여 PySpark 함수에 대한 단위 테스트를 설계하고 구현한 다음, 신뢰성을 보장하기 위해 Spark Declarative Pipeline 및 Jobs를 사용하여 Databricks 데이터 파이프라인에 대한 통합 테스트를 수행하는 과정이 포함됩니다.


또한 이 과정에서는 지속적 통합 관행을 통합하기 위한 Databricks Git Folders 사용을 비롯하여 Databricks 내의 필수 Git 작업을 다룹니다. 마지막으로 REST API, CLI, SDK, Declarative Automation Bundles (DABs)와 같은 Databricks 자산의 다양한 배포 방법을 개괄적으로 살펴봄으로써 파이프라인을 배포하고 관리하는 기법에 대한 지식을 갖추게 됩니다.


과정을 마치면 소프트웨어 엔지니어링 및 DevOps 모범 사례에 능숙해져 확장 가능하고 유지 관리가 용이하며 효율적인 데이터 엔지니어링 솔루션을 구축할 수 있게 됩니다.


Languages Available: English | 日本語 | Português BR | 한국어 | Español | française

Skill Level
Associate
Duration
16h
Prerequisites

1. Data Ingestion with Lakeflow Connect

Databricks Workspaces, Apache Spark, Delta Lake, Medallion 아키텍처, Unity Catalog를 비롯한 Databricks Data Intelligence Platform에 대한 기본적인 이해.

데이터 수집 워크플로(배치, 스트리밍, 증분)와 일반적인 ETL 원칙에 대한 기본적인 이해.

다양한 파일 형식(예: Parquet, CSV, JSON, TXT)을 다룬 경험.

SQL 및 Python 숙련도.

Databricks 노트북에서 코드를 실행하는 데 대한 익숙함.


2. Deploy Workloads with Lakeflow Jobs

"Get Started with Databricks for Data Engineering" 과정 수료, 또는 Databricks Data Intelligence Platform에 대한 탄탄한 이해.

Databricks Workspace 탐색, Apache Spark, Delta Lake, Medallion 아키텍처, Unity Catalog와 같은 주제에 대한 기본적인 이해.

Python/PySpark에 대한 익숙함.

중급 수준의 SQL 쿼리 작성 경험.


3. Build Data Pipelines with Apache Spark Declarative Pipelines

Databricks Workspaces, Apache Spark, Delta Lake, Medallion 아키텍처, Lakeflow Jobs, Unity Catalog를 비롯한 Databricks Data Intelligence Platform에 대한 기본적인 이해.

read_files SQL 함수를 사용하여 CSV, JSON, TXT, Parquet와 같은 형식을 로드하는 것을 포함하여, raw 데이터를 Delta table에 수집한 경험.

중급 수준의 쿼리 작성과 SQL 조인에 대한 기본적인 이해를 포함하여, SQL을 사용한 데이터 변환 숙련도.

ETL 개념 및 배치/스트리밍 워크플로에 대한 이해.


4. DevOps Essentials for Data Engineering

Databricks Workspaces, Apache Spark, Delta Lake 및 Medallion 아키텍처, Unity Catalog, Delta Live Tables, Workflows를 다룬 경험을 비롯한 Databricks 플랫폼에 대한 능숙한 지식. 또한 Git 버전 관리에 대한 기본적인 이해도 필요합니다.

데이터 수집 및 변환 경험과 데이터 처리 및 DataFrame 조작을 위한 PySpark 숙련도. 또한 지원자는 데이터 분석 및 변환을 위해 중급 수준의 SQL 쿼리를 작성한 경험이 있어야 합니다.

Python 프로그래밍 지식과 함수 및 클래스를 설계하고 구현하는 능력을 포함하여 중급 수준의 Python 코드를 작성하는 숙련도. 또한 사용자는 Python 패키지를 생성, 가져오기 및 효과적으로 활용하는 데 능숙해야 합니다.

Outline

1. Data Ingestion with Lakeflow Connect

• Databricks의 데이터 엔지니어링

• 랩 환경 살펴보기

• 클라우드 스토리지에서의 데이터 수집

• 데모 - CREATE TABLE AS 및 COPY INTO를 사용한 데이터 수집

• 데모 - Auto Loader를 사용하여 SQL로 스트리밍 테이블 만들기

• 수집 시 메타데이터 열 추가

• 데모 - 수집 중 메타데이터 열 추가

• Rescued Data 열 다루기

• 데모 - Rescued Data 열을 사용한 CSV 수집 처리

• 랩 - CSV 파일에서 Bronze 테이블 만들기

• 반정형 데이터 수집: JSON

• 데모 - Databricks로 JSON 파일 수집

• 랩 - JSON 파일에서 Bronze 테이블 만들기

• 엔터프라이즈 데이터 수집 개요

• 데모 - LakeFlow Connect를 사용한 엔터프라이즈 데이터 수집

• 추가 기능 및 기존 Delta Tables로의 수집

• 데모 - 보너스 - MERGE INTO를 사용한 데이터 수집


2. Deploy Workloads with Lakeflow Jobs

• Databricks의 데이터 엔지니어링 소개

• Lakeflow Jobs 핵심 구성 요소

• 과정 프로젝트 개요

• 데모: Lakeflow Jobs UI를 사용하여 작업 만들기

• 랩: 첫 번째 작업 만들기

• 작업 만들기 및 스케줄링

• 데모: 스케줄링과 트리거를 사용한 워크로드 자동화

• 조건부 및 반복 태스크

• 데모: 고급 태스크를 사용한 동적 워크로드 구축

• 랩: If-Else 태스크 추가 및 작업 자동화

• 태스크 실패 처리 및 작업 성능 모니터링

• 데모: 태스크 모니터링 및 복구

• 프로덕션 환경의 Lakeflow Jobs 및 모범 사례

• 보너스 랩: 모듈식 오케스트레이션


3. Build Data Pipelines with Apache Spark Declarative Pipelines

• Databricks의 데이터 엔지니어링 소개

• 데모: 과정 설정 및 파이프라인 만들기

• 과정 프로젝트 및 데이터셋 유형 개요

• 간소화된 파이프라인 개발 및 일반적인 파이프라인 설정

• 데모: 간단한 파이프라인 개발

• Expectations로 데이터 품질 보장

• 데모: 데이터 품질 Expectations 추가

• 랩: 파이프라인 만들기

• 스트리밍 조인 및 프로덕션으로 파이프라인 배포

• 데모: 프로덕션으로 파이프라인 배포

• Change Data Capture (CDC) 개요

• 데모: SCD TYPE 1과 함께 AUTO CDC를 사용한 Change Data Capture

• 보너스 랩: SCD Type 1과 함께 AUTO CDC INTO


4. DevOps Essentials for Data Engineering

Continuous Integration (CI)

• 소프트웨어 엔지니어링(SWE) 모범 사례 소개

• PySpark 코드 모듈화 소개

• 데모: PySpark 코드 모듈화 - 필수

• 랩: PySpark 코드 모듈화

• DevOps 기초

• DevOps에서 CI와 CD의 역할

• 프로젝트 계획

• 데모: 프로젝트 설정 살펴보기

• PySpark 단위 테스트 소개

• 데모: 단위 테스트 만들기 및 실행

• 랩: 단위 테스트 만들기 및 실행

• SDP 및 Jobs로 통합 테스트 실행

• 데모: 통합 테스트 수행

• Git을 사용한 버전 관리 개요

• 랩: Databricks Git Folders 및 GitHub를 사용한 버전 관리

Continuous Deployment (CD)

• Databricks 자산 배포 개요

• 데모: Databricks 자산 배포

Upcoming Public Classes

Date
Time
Your Local Time
Language
Price
Sep 01 - 02
09 AM - 05 PM (Asia/Seoul)
-
Korean
$1500.00
Oct 13 - 14
09 AM - 05 PM (Asia/Seoul)
-
Korean
$1500.00

Public Class Registration

If your company has purchased success credits or has a learning subscription, please fill out the Training Request form. Otherwise, you can register below.

Private Class Request

If your company is interested in private training, please submit a request.

See all our registration options

Registration options

Databricks has a delivery method for wherever you are on your learning journey

Runtime

Self-Paced

Custom-fit learning paths for data, analytics, and AI roles and career paths through on-demand videos

지금 등록하세요

Instructors

Instructor-Led

Public and private courses taught by expert instructors across half-day to two-day courses

지금 등록하세요

Learning

Blended Learning

Self-paced and weekly instructor-led sessions for every style of learner to optimize course completion and knowledge retention. Go to Subscriptions Catalog tab to purchase

Purchase now

Scale

Skills@Scale

Comprehensive training offering for large scale customers that includes learning elements for every style of learning. Inquire with your account executive for details

Upcoming Public Classes

Generative AI Engineer

Generative AI Engineering with Databricks - Korean

본 과정은 최신의 가장 인기 있는 프레임워크와 Databricks 기능을 사용하여 생성형 AI 애플리케이션을 구축하려는 데이터 과학자, 머신러닝 엔지니어 및 기타 데이터 실무자를 대상으로 합니다.

참고: Databricks Academy는 Databricks 환경 내 강의실 세션을 노트북 기반 형식으로 전환하고 있으며, 강의에 슬라이드 덱 사용을 중단합니다. 강의 노트북은 Vocareum 실습 환경에서 이용할 수 있습니다.

아래에서는 본 과정에 포함된 네 개의 4시간 모듈을 각각 설명합니다.

Building RAG Agents with Agent Bricks: 본 과정에서는 Databricks Agent Bricks를 사용하여 검색 에이전트를 구축하기 위한 실습 교육을 제공합니다. 참가자는 Knowledge Assistants를 탐색하고 쿼리하며, AI Functions를 사용하여 비정형 문서를 정형 데이터로 파싱하고, 시맨틱 검색을 위해 텍스트를 청크로 나누며, Vector Search 인덱스를 구축하고, 여러 지식 소스를 기반으로 하는 프로덕션 준비된 Knowledge Assistants를 생성하는 방법을 학습합니다.

Building Agentic Applications on Databricks: 본 과정에서는 학생들이 Databricks에서 프로덕션 등급의 에이전트 애플리케이션을 구축하는 방법을 학습합니다. 학생들은 Unity Catalog와 MCP를 사용하여 거버넌스된 에이전트 도구를 생성하고, OpenAI Agents SDK로 단일 및 다중 에이전트 시스템을 구축하며, 슈퍼바이저 에이전트로 오케스트레이션되는 knowledge assistant 사용 사례를 위해 Agent Bricks와 Genie를 활용하는 방법을 학습합니다. 본 과정은 도구 프로토타이핑부터 프로덕션 배포까지의 전체 진행 과정을 다루며, MLflow 트레이싱을 사용하여 에이전트 실행을 관찰하는 실습 경험을 제공합니다.

Agent Evaluation on Databricks: 본 과정에서는 학생들이 MLflow의 평가 프레임워크를 사용하여 AI 에이전트를 체계적으로 평가하는 방법을 학습하며, 기존 소프트웨어 테스트로는 처리할 수 없는 비결정론적 AI 시스템의 고유한 과제를 다룹니다. 학생들은 정확성 및 안전성과 같은 일반적인 기준을 위한 기본 내장 심사위원(built-in judges), 비즈니스별 요구 사항을 위한 가이드라인 심사위원, 특수한 요구 사항을 위한 맞춤형 심사위원 등 다양한 평가 접근 방식을 구현하는 방법을 학습합니다. 본 과정은 큐레이션된 데이터셋을 사용하는 오프라인 평가와 온라인 프로덕션 모니터링을 모두 다루며, MLflow의 트레이싱 기능을 사용하여 에이전트 실행 패턴을 이해하고 다양한 유형의 이해관계자로부터 인간 피드백을 수집하는 실습 경험을 제공합니다. 실용적인 데모와 랩을 통해 학생들은 AI 에이전트 개발 수명 주기 전반에 걸쳐 지속적인 품질 개선을 이끄는 평가 워크플로를 만드는 기술을 개발합니다.

Deploying and Monitoring Agent Applications on Databricks: 본 과정에서는 Databricks에서 생성형 AI 에이전트를 배포하고 모니터링하기 위한 엔드투엔드 수명 주기를 다룹니다. 참가자는 Declarative Automation Bundles(DABs)를 사용하여 에이전트를 Databricks Apps로 배포하고, Model Context Protocol(MCP)을 통해 도구를 통합하며, MLflow Tracing으로 에이전트를 계측하고, 스코어러, 멀티턴 심사위원 및 온라인 평가를 사용하여 프로덕션 품질을 평가하는 방법을 학습합니다. 실습 데모와 랩을 통해 참가자는 Databricks 플랫폼에서 프로덕션 등급의 AI 에이전트를 구축, 관찰 및 모니터링하는 실용적인 경험을 얻습니다.

Languages Available: English | 日本語 | Português BR | 한국어

Paid
16h
Lab
instructor-led
Associate

Questions?

If you have any questions, please refer to our Frequently Asked Questions page.