카테고리 없음

QA/QC 스파르타클럽 47일차 - ADSP

penguin 2026. 7. 21. 19:30

ADSP 3과목 1~4장 학습 내용 요약

오늘은 ADSP 3과목인 데이터 분석의 1장부터 4장까지 학습하였다. 데이터 분석의 전체적인 흐름과 통계 분석의 기본 개념, 회귀분석, 분류분석까지 학습하면서 실제 데이터 분석 프로젝트에서 자주 활용되는 핵심 이론들을 정리할 수 있었다.


1. 데이터 분석의 이해

데이터 분석은 단순히 데이터를 계산하는 것이 아니라 데이터 속에서 의미 있는 패턴을 발견하고, 이를 바탕으로 의사결정을 지원하는 과정이다.

  • 데이터 분석의 목적과 절차 이해
  • 탐색적 데이터 분석(EDA)의 중요성
  • 기술통계와 추론통계의 차이
  • 모집단과 표본의 개념
  • 변수의 종류(연속형, 범주형 등)
  • 척도의 종류(명목척도, 서열척도, 등간척도, 비율척도)

특히 분석을 시작하기 전 데이터의 구조와 특성을 먼저 파악하는 과정이 매우 중요하다는 점을 다시 한번 확인할 수 있었다.


2. 통계분석

통계분석은 데이터를 객관적으로 해석하기 위한 기본적인 방법이다.

기술통계

  • 평균, 중앙값, 최빈값
  • 분산과 표준편차
  • 사분위수와 박스플롯
  • 왜도와 첨도

확률분포

  • 정규분포
  • 이항분포
  • 포아송분포

가설검정

  • 귀무가설과 대립가설
  • 유의수준과 p-value
  • 제1종 오류와 제2종 오류

검정 방법

  • t-test
  • ANOVA(분산분석)
  • 카이제곱 검정

프로젝트를 진행하면서 사용했던 t-test와 카이제곱 검정이 ADSP에서도 중요한 개념으로 다뤄진다는 점을 확인할 수 있었다.


3. 회귀분석

회귀분석은 하나 이상의 독립변수를 이용하여 종속변수를 예측하는 분석 기법이다.

주요 학습 내용

  • 단순선형회귀
  • 다중선형회귀
  • 회귀계수 해석
  • 결정계수(R²)
  • 잔차분석

회귀분석의 기본 가정

  • 선형성
  • 독립성
  • 등분산성
  • 정규성
  • 다중공선성

특히 다중공선성은 VIF를 이용하여 확인할 수 있으며, 프로젝트에서 모델을 구축할 때도 중요한 요소라는 점을 이해하였다.


4. 분류분석

분류분석은 데이터를 미리 정의된 범주로 분류하는 분석 기법이다.

대표적인 분류모델

  • 로지스틱 회귀
  • 의사결정나무(Decision Tree)
  • 랜덤포레스트(Random Forest)
  • 나이브 베이즈
  • K-NN

모델 평가 지표

  • Accuracy(정확도)
  • Precision(정밀도)
  • Recall(재현율)
  • F1-Score
  • ROC Curve
  • ROC-AUC

최근 머신러닝 프로젝트에서 XGBoost, Random Forest, Logistic Regression 등을 활용하여 모델을 비교했던 경험과 연결되면서, 각각의 성능 지표가 어떤 의미를 가지는지 더욱 쉽게 이해할 수 있었다.


핵심 정리

  • 데이터 분석은 문제 정의부터 결과 해석까지의 전체 과정을 포함한다.
  • 통계분석은 데이터의 특성을 이해하고 가설을 검증하는 기본 도구이다.
  • 회귀분석은 연속형 값을 예측하며 변수 간의 관계를 설명하는 데 활용된다.
  • 분류분석은 데이터를 특정 범주로 예측하는 머신러닝 기법으로 다양한 모델과 평가 지표를 함께 이해하는 것이 중요하다.
  • 실제 프로젝트에서는 데이터 전처리, 통계분석, 회귀분석, 분류모델 구축이 하나의 흐름으로 연결되어 진행된다는 점을 다시 한번 확인할 수 있었다.

학습 후기

이번 학습을 통해 ADSP 3과목에서 다루는 내용들이 단순한 시험 이론이 아니라 실제 데이터 분석 프로젝트와 매우 밀접하게 연결되어 있다는 점을 느꼈다. 특히 통계분석과 회귀분석, 분류분석은 최근 진행했던 머신러닝 프로젝트에서도 직접 활용했던 개념들이 많아 복습 효과가 컸다. 앞으로는 단순히 공식을 암기하는 것이 아니라 각각의 분석 기법이 어떤 상황에서 활용되는지 함께 이해하며 학습을 이어갈 계획이다.