Fitting Statistical Models to Data with Python - WEEK 2 - Part 2
probability, odds, logodds. 이제, binary outcome을 예측하는 모델을 만든다. 여기서는 라고 하는, '흡연 유무(정확히는, "인생에서 최소 100개의 담배를 피웠는가"라는 질문에 대한 응답)'을 response v...
Python, Java, AI/ML, Vim, Web, CS 이론 등 소프트웨어 개발 및 엔지니어링 기록
probability, odds, logodds. 이제, binary outcome을 예측하는 모델을 만든다. 여기서는 라고 하는, '흡연 유무(정확히는, "인생에서 최소 100개의 담배를 피웠는가"라는 질문에 대한 응답)'을 response v...
우리가 이미 를 사용해서 필요한 데이터를 엑셀처럼 깔끔하게 구축해두었다고 합시다. 그런데, 이 데이터들을 혼합해서 간단한 cross-table을 만들고 싶을 때가 있죠. cross-table은 가령, 우리에게 , , 이라는 세 가지의 칼럼이 있다...
순서를 유지한 채 crosstab을 만들기. CrossTable은 복잡한 데이터세트로부터, 다양한 그룹별로 데이터들이 어떻게 분포되어 있는지 row, column으로 분리하여 봄으로써, 데이터의 특징에 대한 직관적인 해석을 지원합니다. 그리고, ...
Difference with Probability and Odds. 사실, 통계학적으로 보는 것이 아니라, 영어 단어로서 보면 이 둘이 가지는 의미는 비슷해 보입니다. 둘다 '가능성'을 의미하니까요. 기본적인 개념은 비슷하지만 이 둘의 개념은 조...
intro: back to the basic. 최근에 기본적인 통계들과 선형방정식을 활용한 다양한 기법들을 정리하고 있습니다. 사실, 뉴럴 넷이 나온 다음부터는 거의 사람들이 언급하지 않는 것이기는 하죠. 뉴럴넷은 어쩌면, 좀 그냥 '돌려보니까 ...
link function은 Generalized linear model(GLM)에서 사용되는 함수로, linear model에서 만들어진 결과를 우리가 필요한 response로 변경해주는 것을 말합니다. 네, 이렇게 마ㅏㄹ하니까 무슨 말인지 모르...
check your encoding file. 보통 로 csv 파일들을 읽을 때 가장 흔히 발생하는 에러로 다음의 것이 있죠. 길게 되어 있지만, 그저 "원래 파일이 utf-8로 인코딩되어 있지 않은데, utf-8로 인코딩하려고 해서 발생하는 문...
WEEK 3 - Statistical Inference with Confidence Intervals 2주차에서는 주로 Confidence interval을 배웠으며, 어떻게 계산하고 해석하는지, 그리고 Confidence라는 것이 의미하는 것은...
WEEK 3 - HYPOTHESIS TESTING 이 단계에서는 가설 검정에 대한 부분을 배웁니다. 즉, WEEK 2에 배웠던 5가지 기법을 사용하여, hypothesis testing에 대해서 배우고, 이를 해석합니다. Introduction ...
두 집단이 있다고 합시다. 남성과 여성이라는 두 집단이 있습니다. 가령 이 두 집단이 같은 성질을 가지는지, 다른 성질을 가지는지 비교를 해보고 싶을 때가 있겠죠. 예를 들어, 이 두 집단의 키 평균은 같다고 할 수 있는지 혹은 다른지 등에 대해...
normal dist.를 따르는 proportion에 대한 test. 우리가 표본 집단으로부터 라는 비율을 측정했습니다. 충분히 많은 에 대해서 측정했고, 따라서, 또한, normal distribution을 따르겠죠. 그리고, 우리가 랜덤변수 ...
서로 다른 두 집단의 평균이 같은지를 테스트하자. 두 집단(남성과 여성, 흑인과 백인, 청소년과 노인 등등등) 에 대해서 이 두 집단의 평균이 같은지를 테스트 해봅니다. 를 사용해도 되지만, 에도 같은 방식이 있어서, 이 값을 이용해서 정리를 해...
흔히 를 사용하다고, 이 적합하지 않다거나, unicode error라거나 하는 문제들이 발생하고는 합니다. 이는 csv 파일의 인코딩 방식과 읽어들일 대 해석하는 decoding 방식이 다르기 때문이죠. 하지만, 제가 직접 csv 파일을 만든 ...
statsmodel로 binomial proportion에 대한 신뢰구간 구하기. binomial proportion에 대해서 신뢰 구간을 계산하기 위하여, python의 통계 패키지인 을 사용합니다. 예를 들어, 대한민국 남성들의 흡연율(pro...
intro. coursera의 수업 중에 Understanding visualization data 코스를 공부하고 내용을 정리하였습니다. 사실 이 수업보다는 이 다음 수업인 Inferential Statistical Analysis with P...
Repeated Measures Data: Wide and Long wide format 가령, 의 경우는 측정 회수와 상관없이, 같은 사람(subject)이라면, row에 고정하고, column을 늘리는 식으로 데이터를 저장하는 것을 말한다. ...