Skip to main content

분포

1. 변수와 분포

1.1 연속 변수와 불연속 변수는 값의 생성 규칙으로 구분한다

목적 : 통계 분석에서 변수의 종류를 먼저 판단해야 적절한 확률분포, 통계기법, 머신러닝 문제 유형을 선택할 수 있다.

상세 로직

  1. 판단 기준 및 적용 조건

    • 변수(Variable)는 관측 대상마다 값이 달라질 수 있는 속성이다. 키, 몸무게, 나이, 학생 수, 구매 금액, 클릭 수가 모두 변수에 해당한다.
    • 연속 변수(Continuous Variable)는 일정 범위 안에서 무한히 많은 값을 가질 수 있는 측정값이다. 키, 몸무게, 온도, 시간, 거리, 잔액, 구매 금액, 체류 시간이 대표 예시다.
    • 불연속 변수(Discrete Variable)는 정해진 값이나 셀 수 있는 값만 가질 수 있는 변수다. 학생 수, 자동차 수, 클릭 수, 주문 수, 불량품 개수, 자녀 수, 지역, 직업 분류, 연령대가 대표 예시다.
    • 변수의 종류는 데이터셋 저장 방식만으로 판단하지 않는다. 실제 세계의 본질, 값을 만든 규칙, 분석 의도를 함께 본다.
    • 나이는 실제로는 계속 증가하므로 연속 변수로 볼 수 있지만, 데이터가 20, 30, 40처럼 연령대로 반내림되어 만들어졌다면 불연속 변수로 처리한다.
  2. 실행 절차 및 구현 규칙

    • 값을 측정하고 중간값이 의미 있으면 연속 변수로 본다. 잔액이 센트 단위로 저장되어도 이론적으로 12258.487 같은 중간값을 상상할 수 있으면 연속값으로 다룬다.
    • 값을 세거나 사전에 정한 후보 중 하나를 고르면 불연속 변수로 본다. 지역이 Scotland, Northern Ireland, Wales, England 중 하나라면 숫자 코드로 바꿔도 불연속 변수다.
    • 측정값을 구간이나 등급으로 변환하면 새 변수는 불연속 변수다. 발 크기는 연속 변수지만 신발 크기는 8, 8.5, 9처럼 정해진 값만 쓰므로 불연속 변수다.
    • 머신러닝에서는 집값, 매출, 체류 시간처럼 연속값을 예측하면 회귀로 보고, 구매 여부처럼 범주를 예측하면 분류로 보며, 클릭 수나 불량품 개수처럼 개수를 예측하면 카운트 모델 또는 회귀를 검토한다.
    • 핵심 암기법은 연속 변수 = 측정하고 사이값이 의미 있다, 불연속 변수 = 세거나 정해진 후보에서 고른다이다.