Data 영역의 카테고리
안녕하세요 오늘은 BESPIN GLOBAL Data실 한제호님이 작성해주신 ‘Spark 2편 – Caching 및 Persist’ 에 대해 소개해드리도록 하겠습니다.
Data 영역의 카테고리
안녕하세요 오늘은 BESPIN GLOBAL Data실 한제호님이 작성해주신 ‘Spark 2편 – Caching 및 Persist’ 에 대해 소개해드리도록 하겠습니다.
안녕하세요 오늘은 BESPIN GLOBAL Data실 한제호님이 작성해주신 ‘Spark 1편 – Backend Service – Optimizer’가 무엇인지 소개해드리도록 하겠습니다.
오늘은 BESPIN GLOBAL Innovate AI실 김철환님이 작성해주신 [BigData] Spark 개요 정리에 대해 소개해드리도록 하겠습니다.
‘Kubeflow란 무엇인가’에 대해 소개해드리도록 하겠습니다.
Splunk를 WSL(Windows Subsystem for Linux)을 이용해서 개인 PC에 설치하여 사용하는 방법에 대해 설명드립니다. 전제 조건, 설치 방법 및 주의사항까지 자세히 알아봅니다.
Apache Airflow에 대한 개요와 핵심 용어, 아키텍처, DAG(Directed Acyclic Graph)의 생성 및 실행 과정, Web UI, 내장 및 외부 Operator, Catch Up과 Backfill과 같은 데이터 처리 및 실행 제어 기능에 …
Spark Backend Service – Optimizer에 대해 알아봅니다. Spark의 Catalyst Project는 데이터 처리 작업 최적화와 실행 계획 생성을 담당하며, Catalyst Pipeline은 분석과 최적화로 쿼리 성능을 향상시킵니다.
Apache Kafka에 대한 개요와 기본 개념을 다루며, 이벤트 스트리밍 플랫폼으로서의 역할, 데이터 전송 아키텍처의 변화, Kafka의 구성요소 및 동작 원리, 기존 메시징 시스템과의 차이점, 활용 사례 등을 알아봅니다.
Data Lakehouse에 대해 알아봅니다. 정형(DBMS), 반정형(CSV, XML, JSON등), 비정형 및 이진 데이터(PDF, dnjem, 이메일, 오디오, 비디오, 이미지 등)의 다양한 형태의 데이터를 원시 형태로 저장하는 단일 데이터 저장소입니다.