카테고리 없음

QA/QC 스파르타클럽 48일차 - ADSP

penguin 2026. 7. 22. 20:30

ADsP 3과목 5장 학습 정리: 정형 데이터 마이닝

오늘은 ADsP 3과목의 마지막 단원인 정형 데이터 마이닝에 대해 학습했다. 정형 데이터 마이닝은 일정한 구조를 가진 대규모 데이터에서 의미 있는 규칙과 패턴을 찾아내고, 이를 예측이나 의사결정에 활용하는 분석 방법이다.

이번 단원에서는 데이터 마이닝의 개념과 진행 절차를 시작으로 분류분석, 앙상블, 인공신경망, 군집분석, 연관분석의 특징과 활용 방법을 정리했다.

1. 데이터 마이닝의 개요

데이터 마이닝은 대규모 데이터에 숨어 있는 규칙과 패턴을 발견해 미래의 결과를 예측하거나, 의사결정에 활용하는 과정이다.

전통적인 통계분석이 가설을 설정하고 이를 검증하는 데 초점을 둔다면, 데이터 마이닝은 데이터 자체에서 새로운 패턴을 탐색하고 예측모형을 만드는 데 상대적으로 더 큰 목적을 둔다.

데이터 마이닝은 크게 정답이 있는 데이터를 사용하는 지도학습과 정답 없이 데이터의 구조를 찾는 비지도학습으로 구분할 수 있다.

  • 지도학습: 분류분석, 회귀분석, 의사결정나무, 인공신경망 등
  • 비지도학습: 군집분석, 연관분석, 자기조직화지도 등

데이터 마이닝의 일반적인 추진 과정은 다음과 같다.

  • 목적 설정
  • 데이터 준비
  • 데이터 가공
  • 분석기법 적용
  • 결과 검증 및 활용

즉, 분석기법을 바로 적용하는 것이 아니라 먼저 해결할 문제와 목표를 명확히 설정하고, 분석에 적합하도록 데이터를 정리하는 과정이 중요하다.

2. 분류분석

분류분석은 기존 데이터의 특성과 결과를 학습한 후, 새로운 데이터가 어떤 범주에 속하는지를 예측하는 지도학습 방법이다.

예를 들어 제조 공정 데이터를 이용해 제품을 정상과 불량으로 분류하거나, 고객 데이터를 이용해 이탈 여부를 예측하는 문제에 활용할 수 있다.

대표적인 분류기법은 다음과 같다.

  • 로지스틱 회귀분석
  • 의사결정나무
  • K-최근접 이웃
  • 나이브 베이즈
  • 서포트 벡터 머신
  • 인공신경망

로지스틱 회귀분석

로지스틱 회귀분석은 종속변수가 정상·불량, 성공·실패와 같은 범주형 변수일 때 사용하는 방법이다.

분석 결과를 0과 1 사이의 확률로 변환하며, 특정 사건이 발생할 가능성을 예측할 수 있다. 이때 성공확률과 실패확률의 비율을 오즈, 오즈에 로그를 취한 값을 로그 오즈라고 한다.

의사결정나무

의사결정나무는 데이터의 특성에 따라 조건을 반복적으로 나누어 최종 결과를 예측하는 분석방법이다.

분석 결과가 나무 형태로 표현되기 때문에 다른 모델에 비해 해석이 쉽고, 범주형 변수와 연속형 변수를 모두 사용할 수 있다는 장점이 있다.

다만 나무가 지나치게 복잡해지면 학습 데이터에 과도하게 맞춰지는 과적합이 발생할 수 있으므로 가지치기와 같은 과정이 필요하다.

3. 앙상블 분석

앙상블은 여러 개의 모델을 결합해 하나의 모델보다 더 안정적이고 높은 예측성능을 얻는 방법이다.

각 모델이 서로 다른 오류를 범하더라도 여러 결과를 종합하면 개별 모델의 약점을 보완할 수 있다.

배깅

배깅은 원본 데이터에서 여러 개의 표본을 복원추출하고, 각 표본으로 모델을 학습한 뒤 결과를 종합하는 방식이다.

대표적인 알고리즘으로 랜덤 포레스트가 있으며, 여러 개의 의사결정나무 결과를 투표하거나 평균 내어 최종 결과를 결정한다.

배깅은 주로 모델의 분산을 줄이고 과적합을 완화하는 데 효과적이다.

부스팅

부스팅은 이전 모델이 잘못 예측한 데이터에 더 큰 가중치를 부여하며 모델을 순차적으로 학습하는 방법이다.

약한 학습기를 여러 번 보완해 강한 학습기를 만드는 방식이며, AdaBoost와 Gradient Boosting 등이 대표적이다.

예측성능이 높을 수 있지만 이상치와 잡음에 민감하고, 순차적으로 학습하기 때문에 계산시간이 길어질 수 있다.

4. 인공신경망

인공신경망은 인간의 신경세포 연결구조를 모방한 분석모형으로, 입력층·은닉층·출력층으로 구성된다.

각 노드는 입력값에 가중치를 적용하고 활성화 함수를 통과시켜 다음 계층으로 결과를 전달한다.

학습 과정에서는 실제값과 예측값의 차이를 계산한 뒤, 역전파를 통해 오차를 줄이는 방향으로 가중치를 수정한다.

인공신경망은 복잡한 비선형 관계를 학습할 수 있다는 장점이 있지만, 학습 과정과 결과를 명확하게 설명하기 어렵고 많은 데이터와 계산량이 필요할 수 있다.

주요 용어

  • 가중치: 각 입력변수가 결과에 미치는 영향의 크기
  • 활성화 함수: 입력값을 출력값으로 변환하는 함수
  • 역전파: 출력 오차를 이전 계층으로 전달하며 가중치를 수정하는 과정
  • 학습률: 한 번의 학습에서 가중치를 변경하는 정도
  • 과적합: 학습 데이터에는 잘 맞지만 새로운 데이터에 대한 성능이 떨어지는 현상

5. 군집분석

군집분석은 정답이 없는 데이터를 비슷한 특성을 가진 집단으로 묶는 비지도학습 방법이다.

분류분석은 미리 정해진 정답을 예측하지만, 군집분석은 데이터 내부의 유사성을 바탕으로 새로운 그룹을 발견한다는 차이가 있다.

고객 세분화, 설비 운전상태 구분, 제품 유형 분류, 이상 패턴 탐색 등에 활용할 수 있다.

계층적 군집분석

계층적 군집분석은 가까운 관측치부터 단계적으로 결합하거나, 하나의 큰 군집을 계속 나누는 방식이다.

분석 결과는 덴드로그램으로 표현할 수 있어 데이터가 군집으로 묶이는 과정을 시각적으로 확인할 수 있다.

K-means 군집분석

K-means는 분석자가 군집의 수 K를 미리 정한 후, 각 데이터를 가장 가까운 군집 중심에 배정하는 방법이다.

군집 배정과 중심점 갱신을 반복하면서 군집 내부의 거리를 최소화한다.

알고리즘이 단순하고 계산속도가 빠르지만, 초기 중심점과 K값에 따라 결과가 달라질 수 있고 이상치에 민감하다.

6. 연관분석

연관분석은 데이터에서 특정 항목들이 함께 발생하는 규칙을 찾는 비지도학습 방법이다.

대표적으로 장바구니 분석에서 “상품 A를 구매한 고객이 상품 B도 함께 구매하는가”와 같은 관계를 파악할 때 사용한다.

연관규칙은 일반적으로 다음 세 가지 지표로 평가한다.

지지도

전체 거래 중 항목 A와 B가 동시에 발생한 거래의 비율이다.

지지도가 높을수록 해당 조합이 데이터에서 자주 나타난다는 의미다.

신뢰도

항목 A가 발생한 거래 중 항목 B도 함께 발생한 비율이다.

즉, A가 발생했을 때 B가 발생할 조건부확률을 나타낸다.

향상도

A와 B가 서로 독립적으로 발생할 때와 비교해 실제로 얼마나 더 자주 함께 발생하는지를 나타낸다.

  • 향상도 1: A와 B가 서로 독립
  • 향상도 1 초과: 양의 연관관계
  • 향상도 1 미만: 음의 연관관계

신뢰도가 높더라도 B 자체가 매우 자주 발생하는 항목이라면 의미가 과대평가될 수 있기 때문에, 지지도와 향상도를 함께 확인해야 한다.

7. 제조·품질관리 분야에서의 활용

정형 데이터 마이닝은 제조업의 품질관리와 공정개선에도 다양하게 활용할 수 있다.

  • 분류분석으로 정상·불량 제품 예측
  • 의사결정나무로 불량을 구분하는 주요 공정조건 확인
  • 랜덤 포레스트와 부스팅으로 불량 예측성능 향상
  • 군집분석으로 유사한 설비 운전상태와 불량 패턴 분류
  • 연관분석으로 특정 공정조건과 불량 유형의 동시 발생 규칙 탐색
  • 인공신경망으로 복잡한 공정변수와 품질 결과의 비선형 관계 학습

다만 모델의 예측 결과만으로 공정조건을 바로 변경하기보다는, 변수 중요도와 SHAP 분석, 통계검정, 현장 지식을 함께 활용해 결과의 타당성을 검증해야 한다.

8. 오늘 학습을 통해 알게 된 점

오늘 학습을 통해 데이터 마이닝은 단순히 높은 정확도의 모델을 만드는 과정이 아니라, 분석 목적에 맞는 기법을 선택하고 그 결과를 실제 의사결정에 연결하는 과정이라는 점을 알게 되었다.

또한 분류, 군집, 연관분석은 사용하는 데이터와 목적이 서로 다르기 때문에, 분석을 시작하기 전에 정답 변수의 존재 여부와 해결하려는 문제를 먼저 구분해야 한다.

특히 이전 프로젝트에서 사용했던 로지스틱 회귀, 의사결정나무, 랜덤 포레스트, XGBoost 등의 모델이 ADsP 이론에서 어떤 분류에 해당하는지 다시 정리할 수 있었다. 앞으로는 모델의 성능뿐 아니라 해석 가능성, 과적합, 데이터 품질, 현장 적용 가능성까지 함께 고려해야겠다고 생각했다.