특징 선택(Feature Selection)이란? AI에 필요한 입력 변수만 남기는 방법
특징 선택은 원래 입력 변수 가운데 예측에 도움이 될 후보만 남기는 전처리입니다. 필터·래퍼·내장 방식의 차이, 특성 중요도·차원 축소와의 구분, 훈련 데이터 분리·상관 특징·선택 안정성 점검법을 쉽게 설명합니다.
특징 선택은 원래 입력 변수 가운데 예측에 도움이 될 후보만 남기는 전처리입니다. 필터·래퍼·내장 방식의 차이, 특성 중요도·차원 축소와의 구분, 훈련 데이터 분리·상관 특징·선택 안정성 점검법을 쉽게 설명합니다.
라벨 스무딩은 분류 학습의 원-핫 정답을 정답 클래스와 나머지 클래스에 확률을 나눈 부드러운 분포로 바꾸는 규제 기법입니다. 스무딩 계수·교차 엔트로피·과신·캘리브레이션·지식 증류 점검법을 쉽게 설명합니다.
특징 이진화는 수치 특징을 하나의 임계값과 비교해 0과 1로 바꾸는 전처리입니다. 특징 이산화·원-핫 인코딩·예측 임계값과의 차이, 텍스트 존재 여부와 센서 상태 활용법, 경계값·희소 행렬·정보 손실 점검법을 쉽게 설명합니다.
특징 이산화는 연속형 숫자를 여러 구간으로 나누고 각 값을 구간 번호나 원-핫 벡터로 바꾸는 전처리입니다. 동일 너비·동일 빈도·K-means 구간의 차이, 분위수 변환·스케일링·이진화와의 구분, 경계값·데이터 누수 점검법을 쉽게 설명합니다.
라벨 인코딩은 분류 모델의 예측 대상인 클래스 이름을 0부터 시작하는 정수 코드로 바꾸는 작업입니다. 순서형·원-핫·타깃 인코딩과의 차이, 코드표 저장, 역변환과 새 클래스 처리법을 쉽게 설명합니다.
빈도 인코딩은 범주형 값을 훈련 데이터에서 관찰된 출현 횟수나 비율로 바꾸는 전처리입니다. 카운트·원-핫·순서형·타깃 인코딩과의 차이, 같은 빈도 충돌, 미지 범주와 데이터 분포 변화 점검법을 쉽게 설명합니다.
순서형 인코딩은 범주형 값을 한 열의 정수 코드로 바꾸는 전처리입니다. 자연스러운 순서가 있는 범주와 임의 코드의 차이, 원-핫·라벨·타깃 인코딩과의 구분, 미지 범주·결측값·모델 해석 점검법을 쉽게 설명합니다.
타깃 인코딩은 범주형 값을 그 범주에서 관찰된 정답의 평균이나 조건부 확률로 바꾸는 지도 전처리입니다. 원-핫·순서형·빈도 인코딩과의 차이, 평활화·교차 적합·데이터 누수·미지 범주 점검법을 쉽게 설명합니다.
특징 해싱은 범주명이나 단어에 해시 함수를 적용해 미리 정한 수의 벡터 칸으로 바꾸는 전처리입니다. 원-핫 인코딩·단어 사전·LSH와의 차이, 해시 충돌·차원 수·재현성 점검법을 쉽게 설명합니다.
데이터 백색화는 여러 특징의 공분산을 이용해 서로 상관없는 단위 분산 성분으로 바꾸는 선형 전처리입니다. 표준화·PCA·배치 정규화와의 차이, PCA·ZCA 백색화의 원리, 작은 고윳값·데이터 누수 점검법을 쉽게 설명합니다.