2025. 12. 1. 20:49ㆍTIL
1. 머신러닝이란?

컴퓨터가 인간의 개입 없이 데이터를 학습하여 패턴을 찾아내고, 새로운 데이터에 대해 분류나 예측을 수행하는 기술
AI(인공지능)의 하위 분류에 속하며, 머신러닝의 한 종류로 딥러닝이 있다.
2. 제조업에서 사용할 수 있는 머신러닝 메소드
- 예측 유지보수 (predictive maintenance) : 생산 설비에 부착된 센서(온도, 진동, 소움)등에서 수집된 데이터를 바탕으로 ,장비 고장 시점을 사전에 예측
- 품질 관리 (QC) : 이미지 분석, 센서 데이터 분석 등을 통해 제품 결함이나 불량 여부를 판별
- 생산 공정 최적화
- 수요 예측 : 과거 판매량, 계절성, 프로모션, 경제 지표 등의 데이터를 종합적으로 분석해 미래 수요량 예측
- 에너지 효율 최적화 : 공장에서 전기, 가스 등을 언제 얼마나 쓰는지 실시간으로 파악해서, 낭비되는 부분을 줄이고 필요한 곳에만 적절히 에너지를 공급하도록 조절하는 방식
3. 머신러닝의 종류

학습의 종류에 따라 3가지로 구분할 수 있음
1) Supervised(지도학습)
정답값이 있는 labeled data를 학습
분류 (classification) : 범주별 결과를 예측. 어느 그룹에 속하는지 결정
회귀 (regression) : 숫자로 된 결과를 예측
2) Unsupervised(비지도학습)
모델 또는 알고리즘이 알아서 데이터를 학습해 스스로 패턴을 찾아 결과를 만들어냄
학습 방법에 따라 머신러닝이 수행할 수 있는 작업의 종류가 달라짐
군집화 (clustering) : 성향이 비슷한 삶이나 사물을 자동으로 묶어내는 기법
차원 축소 (dimensionality reduction) : 데이터의 특징(변수)이 너무 많아서 복잡할 때, 핵심 정보만 남기고 압축하는 기법. 변수 선택과 헷갈리면 안됨(변수 선택은 일부만 택하는 것, 차원 축소는 변형을 하더라도 압축을 하는 것). 데이터 전처리나 시각화에도 많이 사용됨
3) Reinforcement(강화학습)
Agent가 Environment와 상호작용하며 Reward를 최대화하도록 학습
게임, 전략, 알파고 등 매우 복잡한 작업을 수행해야 할 때 사용
Agent : 학습을 수행하는 주인공. 게임 플레이어, 로봇, 바둑의 바둑돌, 스타크래프트의 유닛 등
Environment : Agent가 움직이고 상호작용하는 무대. 스타크래프트의 맵, 바둑의 바둑판.
State : Agent가 action을 했을 때 environment에서의 상태
Reward : Agent가 action을 했을 때 얻어지는 결과. 잘했다면 많은 점수를 얻고, 잘못하면 벌점이나 적은 점수를 얻는 것 같은 개념
지속적으로 학습을 통해 reward가 높아지는 방향으로 Agent가 action을 수행하게 함. (알아서 전략을 찾음)
Action - Reward를 반복하며 가장 높은 보상을 보장해주는 행동 규칙 (전략)을 학습
컴퓨터 성능이 좋아야 한다.
웬만해서는 supervised랑 unsupervised로 모두 해결할 수 있다.
4. 머신러닝 모델링 프로세스

데이터 수집 ~ 머신러닝 배포까지의 전체 흐름
1) 데이터 수집 (Collection)
웹 크롤링, 센서 측정 (제조업), 설문조사 (마케팅), DB 추출 (기업) 등 다양한 방법
있는 걸 쓰는 게 제일 편하긴 한데..없거나 부족한 경우 만들어야 함
양질의 데이터 확보가 가장 중요하다. (특히 설문조사 같은 경우)
2) 전처리 (Preprocessing)
전처리가 잘못되면 아무리 좋은 머신러닝 모델을 써도 좋은 결과를 얻을 수 없음
- 결측치 처리 - 빈칸을 평균이나 가장 빈도가 높은 값으로 채우거나, 삭제하고 분석
- 이상치 처리 - 대부분의 데이터 범위에서 심하게 벗어난 값을 해결
- 스케일링 - 각각 다른 단위(kg, cm, L 등등)를 쓰는 데이터를 비슷한 수준으로 맞춰주는 작업
- ex. 키와 몸무게, 연봉은 가질 수 있는 값의 범위가 다르다 ⇒ 따로 처리하지 않고 머신러닝에 넣으면 큰 값의 영향을 많이 받는다.
- ex. 정규화 : 각각의 데이터를 0 ~ 1 범위로 바꾸는 것
- 그 외 표준화 등의 방식도 있다.
- 범주형 변환 - 글자로 된 정보를 숫자로 바꿔주는 과정 (머신러닝은 글자로 된 정보를 해석하지 못함)
- ex. One-Hot encoding : 해당 범주에 속하면 1, 아니면 0
RGB → R(1, 0, 0), G(0, 1, 0), B(0, 0, 1)이라는 형태로 변환 - ex. Label encoding : 순서대로 숫자를 부여
S = 0, M = 1, L = 2 … → 숫자에 순위 의미가 생길 수 있기 때문에, 순서가 없는 범주(ex.국가 등)에는 사용하면 안 된다.
- ex. One-Hot encoding : 해당 범주에 속하면 1, 아니면 0
3) 모델링 (Modeling)
Supervised의 경우 분류/회귀 알고리즘 선택
Unsupervised의 경우 클러스터링/차원 축소 알고리즘 선택
Reinforcement나 Deeplearning도 수행할 수 있음 (모델링에 시간이 오래 걸림)
4) 성능 평가(Evaluation)
머신러닝은 얼마나 잘 예측하는지가 중요하기 때문에, 성능 평가가 매우매우 중요함
분류 : Accuracy(머신러닝이 맞춘 데이터의 비율), Precision, Recall, F1-score, ROC-AUC 등
회귀 : MAE, RMSE, R2 등 (예측한 모델과 실제 결과가 얼마나 일치하는지 판별)
군집 : 실루엣 계수 등
'TIL' 카테고리의 다른 글
| 251203_BootCamp Day 33_머신러닝 기초 (2) (0) | 2025.12.03 |
|---|---|
| 251202_BootCamp Day 32_데이터프레임 구조 변형 (0) | 2025.12.02 |
| 251128_BootCamp Day 30_데이터 분석 기초 프로젝트 (完) (1) | 2025.11.28 |
| 251127_BootCamp Day 29_데이터 분석 기초 프로젝트 (6) (0) | 2025.11.27 |
| 251126_BootCamp Day 28_데이터 분석 기초 프로젝트 (5) (2) | 2025.11.26 |