선형 회귀: 더 스마트한 예측을 이끄는 단순한 모델
핵심 방정식부터 대표적인 모델 유형과 활용 분야까지, 선형 회귀의 기본 원리를 살펴봅니다.
선형 회귀의 정의
선형 회귀는 여러 입력 요인이 수치형 결과에 어떤 영향을 미치는지를, 관측된 데이터에 맞춰 보정된 하나의 직선 방정식으로 추정하는 기법입니다. 속도가 빠르고 설명이 쉬우며, 변수 간 관계가 대체로 비례적일 때 신뢰할 수 있다는 점에서 높은 평가를 받습니다.
선형 회귀는 독립 변수와 종속 변수 간의 관계를 모델링하는 기초적인 통계 방법입니다. 한 변수가 다른 변수에 미치는 영향을 파악하면 새로운 데이터가 등장했을 때 결과를 예측할 수 있습니다.
예를 들어 선형 회귀를 활용하면 주택의 면적이 부동산 가격에 미치는 영향이나, 기업의 광고 예산이 제품 판매에 미치는 영향을 파악할 수 있습니다. 어떤 경우든 선형 회귀는 과거에 관측된 패턴을 미래를 위한 실질적인 예측으로 전환합니다. 그 결과 선형 회귀는 핵심적인 머신러닝 모델로 자리 잡았으며, 예측 분석과 데이터 기반 의사 결정에서 중요한 역할을 담당합니다.
이 가이드에서는 선형 회귀의 핵심 원리와 이 통계 방법의 장점과 한계, 그리고 다양한 학술 및 비즈니스 분야에 적용하는 방법을 설명합니다.
선형 회귀란 무엇인가?
선형 회귀는 데이터 포인트를 관통하는 직선을 적합시켜 하나 이상의 독립 변수(예측 변수)와 종속 변수(결과) 간의 관계를 파악하는 통계 방법입니다. 직선과 모든 데이터 포인트 사이의 거리를 최소화하면 데이터의 패턴을 가장 잘 대표하는 직선을 얻을 수 있습니다. 이렇게 도출된 “최적 적합선”은 새로운 데이터가 유입될 때 미래 결과를 예측하는 데 활용됩니다. 선형 회귀는 가장 단순한 지도 학습 모델이자, 다른 회귀 접근 방식을 평가하는 기준점이 됩니다.
이름에서 알 수 있듯이 선형 회귀는 예측 변수와 결과 사이에 직선 관계가 있다고 가정합니다. 변수 간 관계가 선형에서 벗어나는 경우에는 다음과 같은 다른 형태의 회귀 분석을 사용합니다.
- 다항 회귀는 곡선을 사용해 변수 간의 더 복잡한 관계를 포착합니다. 예를 들어 주행 중인 차량의 연비가 중간 속도에서 최고치를 기록하고 그보다 낮거나 높은 속도에서는 떨어지는 현상을 모델링할 수 있습니다.
- 로지스틱 회귀는 결과가 이분법적인 경우의 예측에 사용됩니다. 예를 들어 환자가 당뇨병에 걸릴 것인지, 대출 신청자가 채무를 불이행할 것인지 등을 예측합니다.
- 비선형 회귀는 페트리 접시 속 박테리아의 기하급수적 증식이나 방사성 물질의 붕괴 속도처럼 직선으로는 근사할 수 없는 관계를 다룹니다.
이 모든 기법은 더 넓은 범주의 회귀 모델에 속하며, 선형 회귀는 그중 가장 기초가 되는 모델입니다.
선형 회귀는 해석이 쉽고 처리 성능을 거의 요구하지 않으면서도 매출 예측부터 위험 평가까지 다양한 실제 문제를 효과적으로 해결하기 때문에 학술 연구와 비즈니스 현장 모두에서 꾸준히 널리 사용되고 있습니다.
선형 회귀의 최적 적합선 이해하기
최적 적합선은 모든 데이터 포인트에 가장 가깝게 위치하는 직선입니다. 최적 적합선을 찾으면 데이터 변수 간의 관계를 가장 정확하게 나타내는 기울기(직선의 각도)와 절편 값(직선이 y축과 만나는 지점)을 얻을 수 있습니다.
최적 적합선은 “최소 제곱법”을 사용해 생성됩니다. 먼저 알고리즘이 후보 직선과 각 데이터 포인트 사이의 수직 거리를 측정합니다. 그런 다음 각 수치를 제곱하는데, 이는 결과를 왜곡할 수 있는 음수를 제거하고 직선에서 멀리 떨어진 데이터 포인트에 더 큰 가중치를 부여하기 위해서입니다. 마지막으로 이렇게 제곱한 값을 모두 더합니다.
알고리즘은 이러한 방식으로 여러 직선을 테스트하며, 제곱 합이 가장 낮은 직선, 즉 모델의 예측과 실제 값 사이의 차이를 최소화하는 “최적 적합선”을 찾아냅니다.
다만 실제로 소프트웨어가 후보 직선을 하나씩 평가하는 경우는 드뭅니다. 소규모 데이터 세트에서는 최적 계수를 한 번의 계산으로 직접 구할 수 있습니다. 대규모 데이터 세트에서는 경사 하강법이 탐색을 담당하는데, 이 방법은 직선을 무작위로 샘플링하는 대신 오차 표면의 기울기를 따라 합이 가장 낮은 지점으로 내려갑니다.
선형 회귀의 활용 분야
선형 회귀는 비즈니스 세계에서 수십 가지의 실용적인 용도로 활용됩니다. 가장 일반적인 사용 사례는 다음과 같습니다.
금융: 위험 평가
은행은 소득, 크레딧 이력, 소득 대비 부채 비율, 고용 안정성 등의 요인을 분석해 대출 채무 불이행 위험을 예측하는 데 선형 회귀를 활용합니다. 이를 통해 대출 기관은 적절한 금리를 산정하고 충분한 정보에 기반한 승인 결정을 내릴 수 있습니다.
헬스케어: 환자 결과 예측
병원은 연령, 기저 질환, 약물 투여량 등의 변수를 기반으로 환자의 회복 기간이나 치료 효과를 예측하는 데 선형 회귀를 활용합니다. 이를 통해 개인 맞춤형 치료 계획을 수립하고 환자 치료를 위한 리소스 할당을 더욱 정확하게 수행할 수 있습니다.
마케팅: 매출 예측
기업은 과거 데이터를 광고 지출, 계절성, 가격 변동, 경제 상황 등의 요인과 함께 분석해 미래 매출을 예측합니다. 이러한 예측은 분기별 재고 관리, 예산 배분, 전략 수립의 기준이 됩니다.
운영: 공급망 최적화
제조업체는 과거 판매 패턴, 계절적 트렌드, 경제 지표를 기반으로 수요를 예측하는 데 선형 회귀를 활용합니다. 이를 통해 재고를 최적 수준으로 유지하여 재고 유지 비용을 줄이는 동시에 품절 상황을 방지할 수 있습니다.
부동산: 자산 가치 산정
부동산 플랫폼은 면적, 침실 및 욕실 수, 위치, 건축 연도, 지역 시장 상황을 반영한 선형 회귀 모델로 주택 가격을 예측합니다. 이를 통해 구매자, 판매자, 대출 기관에 데이터 기반의 가격 가이드를 제공합니다.
인적 자원: 급여 벤치마킹
조직은 급여와 경력 연수, 학력, 직무 역할, 근무 지역, 회사 규모 등의 요인 간 관계를 모델링하여 경쟁력 있는 보상 수준을 결정합니다. 이를 통해 예산 제약을 관리하면서도 인재를 유치하고 유지할 수 있는 공정한 급여 체계를 구축할 수 있습니다.
머신러닝에서 선형 회귀가 중요한 이유
선형 회귀는 머신러닝에서 독보적인 전략적 위치를 차지합니다. 일상적인 문제를 해결하는 실용적인 도구인 동시에, 더 정교한 알고리즘을 이해하기 위한 개념적 토대이기 때문입니다.
이 방법의 가장 큰 전략적 강점 중 하나는 데이터 내의 관계를 정량화하여 각 변수가 결과에 어떤 영향을 미치는지 정확히 보여준다는 점입니다. 이러한 특성 덕분에 선형 회귀는 확신을 갖고 데이터 기반 의사 결정을 내려야 하거나 투명성에 관한 규제 요건을 충족해야 하는 조직에 필수적인 도구입니다.
선형 회귀는 예측에 탁월하며, 예측값뿐 아니라 각 예측에 대한 신뢰도 수준까지 제공합니다. 이는 리스크 관리와 전략 수립에 필수적인 요소입니다. 이를 통해 조직은 최상 및 최악의 시나리오를 모델링하고, 현실적인 목표를 설정하며, 비상 계획을 수립할 수 있습니다.
선형 회귀는 단순성에도 불구하고 많은 실제 문제에서 뛰어난 예측 성능을 발휘하며, 계산 효율성이 높고 구현하기도 쉽습니다. 또한 정규화 회귀나 신경망과 같은 고급 기법의 개념적 토대가 되므로, 머신러닝 전문성을 쌓는 데 반드시 익혀야 할 기법입니다.
선형 회귀 방정식과 가설 함수
모든 선형 회귀 방정식은 예측하려는 결과와 그 결과에 도달하는 데 도움이 될 변수에 대한 가설에서 출발합니다. 그런 다음 알고리즘이 관측된 데이터에 부합하는 예측을 생성하기 위해 각 변수에 부여할 최적의 가중치(계수)를 결정합니다. 이 과정을 통해 예측 오차를 최소화하고 각 변수가 결과에 얼마나 기여하는지 파악할 수 있습니다.
예를 들어 주택 판매 가격을 예측하는 방정식을 만든다면 면적, 침실 수, 위치 등이 변수가 될 수 있습니다. 알고리즘은 과거 판매 데이터를 분석하여 각 변수가 주택 가격에 미친 영향의 크기를 산출합니다.
그러나 모델이 정확한 예측을 내놓지 못한다면 가설을 수정하고 재산세나 지역 범죄율과 같은 추가 변수를 사용해 다시 학습시켜야 할 수 있습니다. 또는 변수 간 관계가 선형이 아니어서 다른 형태의 회귀 분석을 적용해야 한다는 사실을 발견할 수도 있습니다.
선형 회귀 모델의 핵심 가정
모든 선형 회귀 모델은 다음과 같은 몇 가지 기본 가정에서 출발합니다.
선형성: 독립 변수와 종속 변수 간의 관계는 선형(직선)이어야 합니다. 실제 관계가 곡선형이거나 비선형인 경우, 모델은 부정확한 예측을 내놓고 데이터의 실제 패턴을 포착하지 못합니다.
관측치의 독립성: 각 데이터 포인트는 독립적이어야 합니다. 즉, 하나의 관측치가 다른 관측치에 영향을 주어서는 안 됩니다. 데이터 샘플이 군집화되어 있는 경우, 예를 들어 환자들이 모두 같은 병원에서 치료를 받았거나 가족들이 같은 지역에 거주하는 경우에는 공통된 영향 요인이 결과를 편향시켜 모델이 실제보다 더 정확해 보일 수 있습니다.
등분산성(일관된 분산): 모델의 정확도는 모든 예측에서 균일해야 합니다. 특정 값에서는 잘 작동하고 다른 값에서는 성능이 떨어져서는 안 됩니다. 예를 들어 모델이 저가 주택의 판매 가격은 정확히 예측하지만 고가 주택에서는 크게 빗나간다면, 예측에 대한 신뢰 수준을 판단하는 데 사용되는 통계 검정을 신뢰할 수 없게 됩니다.
잔차의 정규성: 예측 오차(잔차)는 정규분포를 따라야 합니다. 즉, 오차가 때로는 크고 때로는 작더라도 대부분은 미미한 수준이어야 합니다. 모델의 잔차가 이러한 패턴을 따르지 않는 경우, 예를 들어 예측값이 범위의 한쪽 끝에서는 지속적으로 낮고 다른 쪽 끝에서는 지속적으로 높다면 모델의 통계적 검정과 신뢰 구간을 신뢰할 수 없게 됩니다. 이 문제는 데이터 샘플이 적을 때 특히 두드러지는 경우가 많습니다.
다중공선성 없음: 독립 변수들은 서로 지나치게 겹치거나 사실상 같은 것을 측정해서는 안 됩니다. 주택 가격 모델에 면적과 방 개수를 모두 포함하면 모델이 어느 변수가 가격에 더 큰 영향을 미치는지 구분하지 못해 계수가 불안정해지고 해석의 신뢰성이 떨어질 수 있습니다.
누락 변수 편향 없음: 결과에 영향을 미치는 모든 관련 변수가 모델에 포함되어야 합니다. 주택 가격을 예측하면서 위치 변수를 빠뜨리면 모델은 면적이나 침실 수 같은 다른 변수의 영향을 실제보다 과대평가하게 됩니다. 사실은 높은 가격을 이끈 요인이 위치였음에도, 마치 크기가 실제보다 더 중요한 것처럼 보이게 되는 것입니다.
이러한 가정을 확인하는 작업은 모델 평가의 일부입니다. 잔차 플롯, 분산 검토, 상관 행렬은 적합된 모델이 겉으로 제공하는 것처럼 보이는 통계적 보장을 실제로 충족하는지 확인하는 표준 도구입니다.
선형 회귀 모델의 주요 유형
선형 회귀 기법을 사용할 때 발생하는 다양한 문제를 해결하기 위해 오랜 기간에 걸쳐 여러 유형의 회귀 모델이 발전해 왔습니다. 가장 널리 사용되는 유형은 다음과 같습니다.
단순 선형 회귀
가장 기본적인 형태의 회귀로, 하나의 독립 변수를 사용해 하나의 종속 변수를 예측합니다. 단순한 관계를 파악하고 기준 모델을 수립하는 데 이상적이지만, 여러 요인이 얽힌 복잡한 실제 패턴은 포착하지 못하는 경우가 많습니다.
다중 선형 회귀
여러 독립 변수를 활용해 하나의 결과를 예측하는 모델로, 여러 요인을 동시에 고려할 수 있습니다. 단순 회귀보다 유연하지만, 예측 변수 간 상관관계가 높으면 다중공선성에 취약해집니다.
릿지 회귀
릿지 회귀는 계수 값을 축소하는 페널티를 추가해 모델이 더 보수적으로 예측하도록 함으로써 다중공선성과 과적합 문제를 해결합니다. 이를 통해 특정 변수가 지배적인 영향력을 갖는 것을 방지하고, 원래 모델의 모든 변수를 유지하면서도 새로운 데이터에 대한 일반화 성능을 높일 수 있습니다.
라쏘 회귀
라쏘(Least Absolute Shrinkage and Selection Operator)는 일부 계수를 0까지 축소할 수 있는 페널티를 추가해 덜 중요한 변수를 모델에서 사실상 제거함으로써 과적합과 희소(관련성이 낮은) 특성 문제를 해결합니다. 라쏘는 특성이 많고 그중 일부만 예측에 실제로 중요하다고 판단될 때 특히 유용합니다.
엘라스틱 넷 회귀
엘라스틱 넷은 두 가지 페널티를 동시에 적용해 릿지와 라쏘의 강점을 결합한 방식으로, 계수 축소와 불필요한 변수 제거 사이에서 균형을 잡습니다. 이 하이브리드 접근 방식은 다중공선성을 효과적으로 처리하는 동시에 특성 선택도 수행하므로, 어떤 변수가 가장 중요한지 확실하지 않은 복잡한 데이터 세트에 유연하게 적용할 수 있습니다.
선형 회귀의 주요 장점
적합한 유형의 문제에 적용하면 선형 회귀는 비교적 쉽고 저렴하게 데이터를 분석하고 예측할 수 있는 방법이 됩니다. 주요 이점은 다음과 같습니다.
손쉬운 구현과 해석
선형 회귀는 구축하고 이해하기가 쉽습니다. “광고비를 1,000달러 늘릴 때마다 매출이 50,000달러 증가한다”와 같은 간단한 문장으로 비기술 이해관계자에게도 결과를 설명할 수 있습니다. 이러한 투명성 덕분에 의사 결정권자가 모델의 논리를 이해하고 신뢰해야 하는 규제 산업과 비즈니스 환경에서 매우 유용합니다.
선형 상관관계가 있는 데이터에 효과적
매출 예측, 가격 최적화, 리소스 할당처럼 변수 간 관계가 비교적 단순한 실제 비즈니스 문제에서는 선형 회귀가 현실을 충분히 근사해 신뢰할 수 있는 예측을 제공합니다.
빠른 학습과 낮은 컴퓨팅 비용
선형 회귀는 최소한의 처리 성능만 필요하며, 대규모 데이터 세트에서도 거의 즉시 학습됩니다. 따라서 실시간 애플리케이션, 신속한 프로토타입 제작, 컴퓨팅 리소스가 제한적이거나 비용이 큰 상황에 실용적입니다.
예측과 트렌드 분석에 유용
이 모델은 과거 데이터를 기반으로 트렌드를 식별하고 전망하는 데 뛰어나 수요 계획, 용량 예측 같은 작업에 이상적입니다. 예측을 미래로 손쉽게 확장하고, 주요 변수의 변화가 결과에 어떤 영향을 미치는지 파악할 수 있습니다.
통계적 추론과 가설 검정 지원
선형 회귀는 변수 간 관계가 통계적으로 유의한지, 아니면 단순한 우연인지 판단하는 데 도움이 되는 풍부한 통계 정보를 제공합니다. 이러한 역량은 연구와 검증, 그리고 정량화된 신뢰 수준에 기반한 데이터 중심 의사 결정에 필수적입니다.
고급 기법의 토대
선형 회귀를 숙달하면 정규화 회귀, 일반화 선형 모델, 신경망 등 더 복잡한 머신러닝 알고리즘을 이해하는 데 필요한 개념적, 수학적 토대를 갖추게 됩니다. 따라서 다양한 분석 영역에 두루 활용할 수 있는 전문성을 쌓게 해 주는 필수 학습 도구입니다.
선형 회귀의 주요 한계
앞서 언급했듯이 선형 회귀가 모든 예측 모델에 항상 적합한 것은 아닙니다. 주요 한계와 이를 보완하는 방법은 다음과 같습니다.
선형 관계 가정
선형 회귀는 직선 관계만 모델링할 수 있습니다. 즉, 실제 데이터에 존재하는 곡선, 정점, 지수적 증가를 놓칠 수 있습니다. 데이터가 비선형 패턴을 보인다면 다항 회귀나, 더 복잡한 관계를 포착하도록 설계된 의사 결정 트리, 신경망 같은 비선형 모델로 전환할 수 있습니다.
이상치와 노이즈에 민감
극단값이나 잘못된 데이터 포인트가 최적적합선에 과도한 영향을 미쳐 실제 패턴에서 벗어나게 하고 계수와 예측을 왜곡할 수 있습니다. 데이터를 정제해 이상치를 수정하거나, 릿지 회귀나 라쏘 회귀처럼 비정상적인 관측치의 영향을 줄이는 정규화 기법을 적용해 이 문제를 해결할 수 있습니다.
정규분포 잔차 필요
예측 오차가 정규분포 곡선을 따르지 않으면 통계적 검정과 신뢰 구간을 신뢰할 수 없게 되어 모델의 신뢰성과 유의성을 평가하기 어려워집니다. 오차가 정규분포를 따르지 않는 경우 로그 변환이나 제곱근 변환을 사용해 큰 데이터 값을 작은 수로 압축함으로써 통계 계산에 미치는 영향을 줄일 수 있습니다. 또는 의사 결정 트리나 서포트 벡터 머신처럼 정규분포를 요구하지 않는 유형의 모델로 전환할 수도 있습니다.
복잡하거나 비선형적인 데이터에서 성능 저하 가능
선형 회귀는 관계가 복잡할 때, 예를 들어 두 변수가 예상치 못한 방식으로 상호 작용하거나 특정 임계값을 넘어야만 변수가 영향을 미치는 경우에 한계를 드러냅니다. 복잡한 데이터에는 이러한 패턴을 자연스럽게 처리하는 랜덤 포레스트나 신경망 같은 더 정교한 모델을 사용하거나, 기존 변수를 결합하거나 제곱하는 등 새로운 변수를 직접 만들어 선형 회귀가 복잡성을 포착하도록 도울 수 있습니다.
예측 변수 간 다중공선성
예측 변수들이 서로 지나치게 비슷하면 모델이 어느 변수가 실제로 중요한지 판별하지 못해 신뢰할 수 없는 결과를 냅니다. 중복 변수를 제거하거나 유사한 변수를 병합하거나, 릿지나 엘라스틱 넷처럼 상관관계가 있는 변수를 더 잘 처리하는 특화된 회귀 기법을 사용해 이를 해결할 수 있습니다.
선형 회귀는 언제 사용해야 할까요?
선형 회귀는 그 단순성이 시사하는 것보다 훨씬 자주 적합한 도구가 되지만, 선택 여부는 모델을 적합하기 전에 확인할 수 있는 몇 가지 사항에 달려 있습니다.
모델링하려는 관계가 직선일 가능성이 높고, 결과를 도출하는 것만큼 그 결과를 설명하는 일이 중요할 때 선형 회귀를 고려하세요. 선형 회귀의 투명성은 의사 결정권자가 모델의 논리를 이해하고 신뢰해야 하는 규제 산업과 비즈니스 환경에서 특히 큰 가치를 발휘합니다. 아무도 해석할 수 없는 더 정확한 모델이 오히려 더 나쁜 선택이 되는 경우가 많기 때문입니다.
단순한 예측을 넘어 통계적 추론이 필요할 때도 선형 회귀가 좋은 선택입니다. 변수 간 관계가 유의한지, 아니면 단순한 우연인지 알려주기 때문입니다. 또한 대규모 데이터 세트에서도 거의 즉시 학습되므로 속도가 중요할 때도 유용합니다.
다만 패턴이 곡선 형태이거나 임계값에 따라 달라지거나, 두 변수가 예상치 못한 방식으로 상호 작용하는 경우에는 다른 방법을 고려해야 합니다. 이런 경우에는 랜덤 포레스트나 신경망이 데이터를 더 자연스럽게 처리합니다.
이상치가 지배적이고 정제할 수 없는 경우, 잔차가 정규분포를 따르지 않는 경우, 예측 변수들이 사실상 같은 것을 측정하는 경우도 마찬가지입니다. 그중 일부는 모델을 완전히 바꾸지 않고도 절충안으로 해결할 수 있습니다. 릿지와 엘라스틱 넷은 상관관계가 있는 예측 변수를 처리하고, 로그 변환이나 제곱근 변환은 정규분포를 따르지 않는 오차를 보완할 수 있습니다.
선형 회귀가 데이터 사이언스에서 여전히 필수적인 이유
선형 회귀는 다른 회귀 접근 방식을 평가하는 기준선이므로, 더 강력한 모델이 필요할 것으로 예상되는 경우에도 구축해 볼 가치가 있습니다. 데이터 신호 중 얼마나 많은 부분이 단순히 선형적인지, 그리고 더 복잡한 모델이 실제로 얼마나 많은 추가 정확도를 가져다주는지 알려주기 때문입니다.
선형 회귀가 데이터 사이언스에서 가장 필수적인 도구 중 하나로 남아 있는 이유는 단순성과 강력함의 균형에 있습니다. 이해하고 구현하기 쉬우면서도 다양한 산업의 실제 문제를 해결할 수 있기 때문입니다. 그 투명성 덕분에 설명 가능한 의사 결정에 매우 유용하며, 이해관계자가 예측의 근거를 이해해야 하는 규제 분야에서 특히 그렇습니다.
성공적인 조직은 자사의 데이터와 비즈니스 목표에 맞는 선형 회귀 모델을 선택해 전략적으로 활용합니다.
핵심 요약
선형 회귀는 다른 모든 회귀 모델을 평가하는 빠르고 투명한 기준선으로, 데이터 신호 중 얼마나 많은 부분이 단순히 선형적인지, 그리고 더 복잡한 모델이 실제로 얼마나 더 나은 결과를 가져다줄지를 보여줍니다. 관계가 대체로 직선 형태이고 해석 가능성이 중요할 때는 선형 회귀를 사용하고, 패턴이 곡선이거나 임계값에 따라 달라지거나 변수 간에 상호 의존적일 때는 랜덤 포레스트나 신경망 같은 방법으로 전환하세요.
자주 묻는 질문
선형 회귀에 관한 주요 질문에 Snowflake 전문가가 답합니다.
상관관계와 회귀의 차이는 무엇인가요?
상관관계는 두 변수 간 관계의 강도와 방향을 측정해 두 변수가 같은 방향으로 움직이는지 반대 방향으로 움직이는지를 알려주지만, 인과관계를 설명하거나 예측을 수행하지는 못합니다. 반면 회귀는 한 걸음 더 나아가 변수 간의 구체적인 관계를 모델링하고 이를 활용해 미래의 결과를 예측합니다. 선형 회귀는 한 변수가 변할 때 다른 변수가 얼마나 변하는지를 다루며, 단순히 연관성을 기술하는 데 그치지 않고 예측을 위한 수학적 프레임워크를 제시합니다.
선형 회귀와 회귀 분석의 차이는 무엇인가요?
선형 회귀는 변수 간에 직선 관계를 가정하는 특정한 회귀 기법인 반면, 회귀 분석은 다항, 로지스틱, 비선형 등 변수 간 관계를 모델링하는 다양한 기법을 아우르는 더 넓은 통계 분야입니다. 즉, 모든 선형 회귀는 회귀 분석이지만, 모든 회귀 분석이 선형 회귀인 것은 아닙니다.
내 데이터가 선형 회귀에 적합한지 어떻게 알 수 있나요?
독립 변수와 종속 변수 사이에 직선 관계가 존재한다면 선형 회귀에 적합한 데이터이며, 이는 산점도나 상관관계 분석을 통해 확인할 수 있습니다. 아울러 데이터가 다음의 핵심 가정을 충족하는지 점검해야 합니다. 관측치가 서로 독립적이고, 오차가 대체로 정규분포를 따르며, 예측 범위 전반에서 분산이 일정하고, 예측 변수 간 상관관계가 높지 않아야 합니다.
선형 회귀와 머신러닝 파이프라인의 차이는 무엇인가요?
선형 회귀는 하나의 모델링 기법입니다. 머신러닝 파이프라인은 가공 전 데이터를 준비, 피처 생성, 학습, 평가, 배포로 이어지게 하는 일련의 단계를 의미합니다. 선형 회귀는 이 파이프라인 안에 포함될 수 있는 모델 중 하나이며, 그 단순성 덕분에 팀이 가장 먼저 적용하는 모델이 되는 경우가 많습니다.
AI 리소스 살펴보기
AI 주제 탐색
인공지능의 모든 영역을 깊이 있게 살펴보세요
