▣ 목 차 ▣Ⅰ. 서론Ⅱ.본론Ⅱ-1.Data Mining의 정의..........2pⅡ-2.Data Mining의 출현배경..3pⅡ-3.Data Mining이 적용되는 프로세스 과정..........3p①문제 정의 단계................3p② 데이터베이스 구축 단계....... 3p③ Data Mining 과정 단계 ........3p④ 보고서작성 단계 .............4p⑤ 의사 결정 단계 ............. 4p⑥ 피드백(Feedback) 단계 ...... 4pⅡ-4.Data Mining의 접근 방법................4p① Supervised data Prediction 4p② Unsupervised data Prediction..4pⅡ-5.로짓 분석을 통한 자료분석.............5p① 분석의 전반적 과정(자료설명, 분석흐름도)... 9p② 자료탐색.....정보는 주요 비즈니스 프로세스 개선의 가장 원초적인 단계에서 사용될 수 있다.2) 출현 배경기업 운영상 생성, 수집, 관리되는 데이타 양의 증가에도 불구하고 유용한 정보의 부족으로 인한 의사결정의 어려움을 해결하고, 급변하고 세분화되는 시장의 변화 속에서 소비자의 구매 패턴 및 욕구를 분석하고 예측할 정보, 즉 데이타 웨어하우스 활성화에 따른 데이타 마이닝 구축 필요성에 대한 인식의 확산이 출현 배경이라 할 수 있다. 더욱이 대규모 트랜잭션 시스템의 폭 넓은 활용으로 인하여 대용량 데이터를 다루는데 있어서 시간과 노력을 절약 할 수 있는 것도 데이터 마이닝의 출현 배경에 한 몫을 한다고 할 수 있다. 위와 같은 내용을 다음과 같이 6가지로 요약해서 살펴 볼 수 있다.■ 운영계에 축적된 과거자료로부터 비계획적으로 수집된 대용량의 데이터를 다룬다.■ 컴퓨터의 강력한 처리능력을 이용하여 실용화되고 있다.■ 대다수의 Data Mining 기법들은 수학적으로 증명되고 발전된 것이 아니라 경험적으로 개발된 것이다.■ Data Mining의 주요 관심은 통계적 추론과 검정보다는 예측모형의 일반화에 있다.■ 기업의 다양한 의사결정 활동에 활용하기 위해서 사용된다.■ Data Mining은 통계학, 전산과학, 인공지능, 공학 분야에서 개발되기 시작하였다.3) Data Mining이 적용되는 프로세스 단계① 문제 정의 단계- 적용하고자 하는 문제 정의 및 목표를 결정, Data Mining의 결과로 얻어진 정보를 어 떻게 활용할 것인가 하는 실제 업무와의 연계성도 충분히 고려② 데이터베이스 구축 단계- 정의된 문제에 따라 필요한 데이터를 선택하고 데이터웨어하우스를 구축함으로써 데이 터를 준비③ Data Mining 과정 단계ⅰ) Sampling / Selectionⅱ) 데이터 정제 및 전처리 (Data Cleansing / Preprocessing)ⅲ) 탐색 및 변형 (Transfromation / Exploration)ⅳ) 모형화(Modeling)ⅴ) 보고 및 가시화 (Repg샘플링을 랜덤하게 뽑는 것으로 하고 seed를 정했다.▶transfer variable변수들의 그래프를 먼저 살펴보고 한쪽으로 치우친 변수들이 있을 경우 변수 변환을 통해서 바꿔주었다. 첫 번째 시도에서는 되도록 이면 많은 변수들을 바꾸지 않는 상태에서 시도하려 노력하였으며, 따라서 한쪽으로 치우친 정도가 심한 변수 avggift, firsit를 log로 , age를 10구간으로 나눠서 변수변환을 하였다.▶data partition70%로 모델을 세우고, 30%는 varidation하는 것으로 정하였다.▶filter outlier되도록 이상치를 제거하지 않으려고 노력하였다.(이상치를 무작정 제거하면 설명력은 올라가나 우리가 이상치라 판단했던 값들이 의미 있는 이상치가 있을 경우를 대비해서) 따라서 mds를 20으로 비교적 큰 값을 주고 분석하였다.▶replacement이상치 제거에서 mds 값을 크게 주었으므로 이상치가 거의 제거가 되지 않았 다. 따라서 이상치에 대한 대체는 하지 않았고, 결측치에 대한 대체에 신경을 썼다. 결측치 대체는 변수의 분포를 보고 결정했으며 분포가 정규분포가 될 경우는 평균으로 치우침의 정도가 있을 때는 중위수로, 완전 대칭을 이루면서 끝 값들이 매우 작을 때는 midrange로 두었다.▶variabel selectiontarget 변수가 binary이므로 카이 제곱 방법을 선택했다. 그 외에 대한 사항은 디폴트로 두었다.▶association자료 변수들이 시간에 대한 값들도 있고 해서 연관성 분석을 실시하였으나 연관성이 없다는 결과가 나왔으므로 앞으로 연관성 분석은 제외시키기로 결정했다.▶regression교호작용을 생각하지 않고 기존의 변수들 자체만으로 회귀분석을 하였다.▶assesment위와 같은 방법으로 분석한 뒤 평가를 했으나 모델의 설명력이 높지 않았으며 특히 교차표 분석에서 1일 때 1로 판단하는 비율이 매우 작았다. 따라서 두 번째 시도에서는 모형의 대대적인 변화를 가져와야 한다는 사실을 깨닫고 다시 변수변환에서부터과는 다음과 같다.이젠 각 결과에 내용 설명과 output 분석을 실시하겠다.▣ 분석흐름도 ▣1. 자료 탐색====================================================================관측 값이 이항형으로 나타난 TARGET_B를 목표변수로 선정하여 LOGIT 변환으로 분석하도록 하겠다. 위의 표를 보면 PETS와 PCOWNERS와 INCOME 그리고 HOMEOWNR은 MISSING VALUE 비율(84, 89, 24, 24(%))이 높게 나타난다. 그 중 가장 높은 MISSING 비율을 갖고 있는 두 변수를 'rejected' 한다. TARGET_B는 내림차순(descending)으로 자동 정렬됨을 볼 수 있다. 따라서 TARGET_B값이 0 인 경우는 우편발송을 통한 기부에 응답한 사람을 의미하고, TARGET_B값이 1인 경우는 기부에 응답하지 않은 사람을 뜻한다.===================================================================2. 변수변환====================================================================로지스틱 회귀분석을 하는데 있어서 각 변수들은 정규분포를 따른다는 가정을 한다. 그러나 아래의 자료의 분포를 보면 대부분이 왼쪽으로 많이 치우쳐 있는 것을 볼 수 있다. 따라서 이러한 변수들을 적절한 변환을 통해 정규분포 가깝도록 변환을 시켰다. 변수에 따라서는 변환을 시켰음에도 불구하고 여전히 왼쪽으로 치우쳐 있거나 분포가 고르지 못한 것도 있으나 변수 변환 전 보다는 비교적 정규분포에 가깝다고 판단하여 변환을 시켰다.====================================================================(1) Interval variable인 AGE를 Class variable로 변환시켰다. 이 때 4개의 bucket으로 나누었으며 맨 왼쪽의 '.'는 missing어려움이 따른다. 따라서 효과적인 모형을 구축하기 위하여 다음과 같은 방법으로 변수선택을 한다.====================================================================================================================================================종속변수 Y가 binary-type이므로 Chi-square에 의한 변수선택 방법을 택한다. 이와 같은 방법에 의해 선택된 변수는 다음과 같다.output을 보면 Chi-square 통계량에 근거하여 목표변수에 대하여 가장 많은 영향을 미치는 변수를 선택하는 과정을 보여준다.==========================================================================Effect SummaryEffectNode 1stSplitTotal TimesSplitAVGG_WDILAST_LGC CARD_U19MALEVETCARDPROMLOCA_BJ1INCOMEFEDG_RO5AGE_Q4PFTIME_F21FIRS_QFRMALEMILI12**************************11==========================================================================node 번호는 위로 갈수록 영향력이 더 큼을 나타내며 위의 결과에서 보는 것과 같이 총 16개의 변수 중에서 12개의 변수가 선택되었음을 알 수 있다.그리고 변수선택 과정에서 탈락된 변수는 다음과 같다. interval variable에서는 LOG(STSTGOV), LOG(NUMPROM)이 탈락되었고, class variable에서는 HOMEOWNR, GENDER가 탈락되었다.==========================================================================7. 회귀분석과 로지스틱 판별분석→교호작용을 고려하지 않은 모델== .