하둡·스파크 분산 처리로 테라바이트급 데이터를 다루고 딥러닝까지 완성하는 과정
교육 기간
1월 11일 ~ 7월 9일
총 교육시간
520시간 · 약 6개월
수강료
국비지원 · 자부담 0원
접수 마감
D-114 · 12월 28일
IT/개발
IT·소프트웨어·인공지능 분야 오프라인 강의
데이터의 양과 속도가 기존 단일 서버 처리 방식의 한계를 넘어서면서, 하둡(Hadoop)과 아파치 스파크(Spark) 기반의 분산 처리 역량과 이를 딥러닝 모델링까지 연결할 수 있는 데이터 엔지니어링 인력에 대한 수요가 커지고 있다. 본 과정은 Python·SQL 기초와 데이터베이스 설계를 다진 뒤, HDFS 분산 파일 시스템, MapReduce, Hive, Spark(Spark SQL·Spark Streaming·MLlib)를 활용한 대용량 데이터 수집·적재·가공 파이프라인 구축을 실습한다. 교육생은 Kafka 기반 실시간 데이터 스트리밍 처리와 Airflow를 통한 배치 파이프라인 스케줄링을 익히고, 이렇게 처리된 대규모 데이터를 활용해 머신러닝·딥러닝(CNN·RNN·Transformer) 모델을 학습시키는 전 과정을 다룬다. 최종적으로는 테라바이트급 로그·정형/비정형 데이터를 분산 환경에서 처리하여 실시간 추천, 이상 탐지, 지능형 챗봇 등 실제 서비스에 활용 가능한 딥러닝 응용 프로젝트를 완성한다. 실습 환경은 클라우드 기반 Hadoop/Spark 클러스터로 구성되며 데이터엔지니어링 실무 중심의 프로젝트 비중이 높다.
Python·SQL을 활용해 정형·비정형 데이터를 수집하고 전처리할 수 있다. HDFS·MapReduce·Hive를 활용해 분산 파일 시스템 기반 대용량 데이터 처리를 수행할 수 있다. Apache Spark(Spark SQL·Spark Streaming·MLlib)로 배치 및 실시간 데이터 파이프라인을 구축할 수 있다. Kafka를 활용한 실시간 스트리밍 데이터 처리 아키텍처를 설계할 수 있다. 분산 처리된 대규모 데이터로 딥러닝(CNN·RNN·Transformer) 모델을 학습시킬 수 있다. Airflow로 데이터 파이프라인을 자동화하고 운영 환경에 배포할 수 있다.
비전공자 중 데이터 엔지니어로 전직을 희망하는 구직자, 데이터 분석·백엔드 개발 경력자 중 대용량 분산 처리 역량을 확장하려는 재직자, 통계학·산업공학·컴퓨터공학 전공자 중 빅데이터 실무 프로젝트 경험을 쌓으려는 자
데이터 전문기업(포털·커머스·금융 데이터 조직) 및 클라우드 사업자 채용 연계, 협약 기업 대상 채용설명회·잡페어 참여, 테라바이트급 공공/기업 데이터셋을 활용한 분산처리·딥러닝 응용 프로젝트(추천 시스템 또는 이상탐지 시스템)를 포트폴리오로 완성, 빅데이터분석기사·SQLD 등 관련 자격증 응시 대비반 운영, 1:1 이력서·면접 코칭 및 취업 컨설팅.
정원 24명 규모의 강의실에서 실습 중심으로 진행됩니다. 수강생 1인당 실습용 PC와 유·무선 인터넷 환경을 제공하며, 조별 프로젝트가 가능한 좌석 배치로 운영됩니다.
Python·SQL을 활용해 정형·비정형 데이터를 수집하고 전처리할 수 있다.
협약기업 채용연계
채용 박람회 참가
협약 AI·IT 기업 대상 채용설명회와 화상면접, 채용 박람회 참가 기회를 제공합니다.
1:1 취업 컨설팅
이력서·포트폴리오 첨삭
담당 취업지원관을 통한 이력서·포트폴리오 첨삭과 모의면접을 지원합니다.
국비지원 혜택
자부담금 0원
K-디지털 트레이닝 국비지원 대상 과정으로 수강료 자부담이 없습니다.
출석률 80% 이상, 평가 기준 충족 시 고용노동부 K-디지털 트레이닝 수료증이 발급되며 국민내일배움카드 훈련이력에 등록된다. 빅데이터분석기사, SQLD(SQL 개발자), 정보처리기사 등 국가기술자격 실기 대비 특강이 병행 제공되며, 자격 취득은 과정 수료와 별개로 개별 응시가 필요하다.
Related
인공지능·데이터
Llama 3 등 경량 언어모델을 사내 데이터로 미세조정해 온프레미스로 구축하는 과정
인공지능·데이터
AI 코딩 에이전트를 보조 개발자로 활용해 완성하는 실전 풀스택 웹 서비스
인공지능·데이터
파이썬·ChatGPT로 데이터 정제부터 대시보드·인사이트 리포트까지 자동화