반응형

 

최소제곱법

자료를 잘 표현할 수 있는 다항식을 예측

이 다항식과 실제 샘플간의 차이를 제곱해서 더한 다음 이값이 최소가 되도록 하는 방법

$y_i$는 Sample 또는 Observation 또는 정답

• 정답이라고 했지만 True Value는 아닐 수 있음에 주의

• True Value는 관찰되지 않지만 존재할 수 있으며 이경우 yi는 error(오차)가 아닌 residual(잔차)이라고 부름

$ax_i + b$는 모델이자 예측

제곱안하면 안되나

절대값을 써도 상관은 없지만 미분 불가능 한 점 때문에 에러를 줄여가면서 정답 찾기가 힘들어짐

회귀분석 할때 쓰임

딥러닝에서도 쓰임

확률변수

어떤 값 X가 정해진게 아니라 (물리적 랜덤성, 조사대상 등에 의해서) 확률적인 값을 가질 때, X를 확률변수라고 한다.

• 예를 들어 X := 주사위를 굴려서 나온 숫자 라고 정의해보자.

• X는 정해진게 아니라 확률에 따라서 1이상 6이하의 값을 가지게 된다.

• 따라서 X는 (상수가 아니라) 확률변수라고 말할 수 있다.

• 샘플이라고 생각해도 된다.

확률질량함수

이산 확률 변수에서 특정 값에 대한 확률을 나타내는 함수

확률변수를 X축에 그 확률을 Y축에 놓고 Plot하면 알기 쉬움

그 합은 1이 되어야 함

> 확률변수 X = '주사위 2개를 던졌을때 나오는 눈의 합' 으로 정의했을때 확률질량함수

확률밀도함수

확률변수가 연속적인 값을 가질때 확률 변수의 분포를 나타내는 함수

정규분포

확률밀도함수 중의 하나

확률변수 x의 확률밀도 함수가 다음과 같을 때 정규분포를 이룬다고 표현한다.

복잡해 보이지만, 사실 가우시안 함수 $ y = e^{-x^2}의 변형$

수집된 자료의 분포를 근사하는 데에 자주 사용되며,

이것은 중심극한정리에 의하여 독립적인 확률변수들의 평균은 정규분포에 가까워지는 성질이 있기 때문이다.

중심극한정리(中心極限定理, 영어: central limit theorem, 약자 CLT)는 동일한 확률분포를 가진 독립 확률 변수 n개의 평균의 분포는 n이 적당히 크다면 정규분포에 가까워진다는 정리

정규분포는 2개의 매개 변수 평균 $\mu$ 과 표준편차 $\sigma$ 에 대해 모양이 결정되고,

이때의 분포를 ${\mathrm {N}}(\mu ,\sigma ^{2})$로 표기한다.

특히, 평균이 0이고 표준편차가 1인 정규분포 ${\mathrm {N}}(0,1)$을 표준정규분포라고 한다.

> 주의할점

확률변수들이 주어질때

항상 평균, 분산, 표준편차를 계산할 수 있지만

반드시 모든 확률변수들이 정규분포를 따르는 것은 아니다.

기대값

확률이 균등한 경우는 단순 평균

• 예를 들어 주사위 한개 눈의 기대값은 $ E(X) = (1 + 2 + 3 + 4 + 5 + 6) / 6 = 3.5$

확률이 균등하지 않은 경우 weighted average

• 예를 들어 주사위 두 개 눈의 합에 대한 기대값은

*

*

분산

확률이 균등한 경우는 각 샘플(확률변수)과 평균의 차이를 제곱한 것에 대한 평균

${{(1-3.5)^2 + (2 - 3.5)^2 + (3 - 3.5)^2 + (4 - 3.5)^2 + (5 - 3.5)^2 + (6 - 3.5)^2} \over 6} = 2.917$

확률이 균등하지 않은 경우, 차이의 제곱에 대한 기대값

분산과 최소제곱법의 차이

분산은 평균과 샘플(확률변수)의 차이에 대한 산포도

최소제곱법에서는 모델과 샘플(확률변수)간의 차이에 대한 산포도

평균은 상수이지만 모델은 다항식등 상수가 아니라는 차이점.

표본조사

http://blog.naver.com/PostView.nhn?blogId=dalsapcho&logNo=20147545698&categoryNo=11&viewDate=

전수 조사가 불가능한 경우가 있으며 이경우는 표본조사가 필수적

> 예를들어 자동차 파괴검사, 전화 여론 조사등

회귀분석

Test Functions

https://en.wikipedia.org/wiki/Test_functions_for_optimization

반응형

+ Recent posts