Knowledge Industry Center Analysis and Machine Learning Recommendation Model Development Project
지식산업센터에 입주하고자 하는 기업에게 최적의 매물을 추천하는 머신러닝 기반 의사결정 지원 시스템
-
기간: ‘25년 4월 ~ ‘25년 6월(3개월)
-
건국대학교 산업공학과 데이터애널리틱스(윤장혁 교수님)
-
기술 스택
| 파트 | 사용 도구 |
|---|---|
| 데이터 수집 | Selenium, Requests |
| 전처리 | pandas, numpy |
| 머신러닝 | scikit-learn, KMeans, Gensim |
| 자연어처리 | KoNLPy, Transformers, SBERT |
| 시각화 | matplotlib, seaborn, plotly |
- 기업의 재무구조와 유사한 기업들이 선택한 부동산 데이터를 기반으로 매물 추천
- 재무 정보만으로 실제 입주 여부를 예측하여 효율적이고 정량적인 추천 시스템 제공
- 추천 후보군 수, 각 평가 지표의 가중치를 데이터 기반으로 최적화
- 입주 기업들의 특성을 분석하여 비즈니스 인사이트 도출
- 입주 기업 데이터
- 출처: 중소기업현황정보시스템
- 주요 변수: 총자산, 자본금, 순이익, 종업원수 등
- 매물 데이터
- 출처: 네이버 부동산 API
- 주요 변수: 전용면적, 평당 예상 매매가, Infra Score 등
- 인프라 스코어 산정 방식
- 지하철, 도로, 은행 접근성 종합 평가
- 거리 기반 점수화 + 조화평균 사용
-
핵심 로직
- 입력기업의 재무정보로 유사 기업 Top K 추출
- 이들의 부동산 매물 중 유사 매물 K개 추천
- 유클리드 거리 기반 추천, Optuna로 파라미터 최적화
-
적용 모델
- 협업 필터링 기반 매물 추천 알고리즘
- PCA 활용 차원 축소
- Logistic Regression (L1/L2), RandomForest로 성능 평가
-
파라미터 튜닝
- Optuna를 이용해 w1~w5 (가중치), k (추천 개수) 최적화
- 추천 정확도(Precision@K)를 기준으로 평가
- Precision@K
- 최적 추천 개수:
k=13 - 최종 CV Score:
0.3778 ± 0.0831 - 실전 테스트 성공률:
34.0%
- 최적 추천 개수:
- 회귀 분석
- 영향력 가장 큰 요인:
기업 규모,평당 매매가 - AUC:
0.824
- 영향력 가장 큰 요인:
-
기업 규모가 유사할수록 매물 선택도 유사
→ 매출이나 자산보다는 규모가 부동산 결정에 더 직접적 영향을 미침 -
면적보다 가격이 결정적인 변수
→ 넓은 공간보다 ‘적절한 가격’이 선택에 큰 영향을 줌 -
수도권-비수도권 간 인프라 격차 큼
→ 지하철 접근성은 수도권 중심으로 편중
| 구분 | 설명 |
|---|---|
| 데이터 | 재무 정보 부정확성, 일부 산업 데이터 부재 |
| 모델 성능 | 변동성 있음, 평균 정확도 낮음 (37.8%) |
| 추천 전략 | 추천 개수 많아 오히려 선택 부담, 추천 수 축소 필요 |
- 추천 매물 수 축소 (
k = 13 → 6) - 산업별 맞춤형 추천 모델 도입
- 실시간 피드백 시스템으로 유동적 가중치 조정
- 이상치/결측치 정제 및 모델 앙상블 강화
본 프로젝트는 실제 부동산 시장에서 사용 가능한 모델을 지향하며, 정량적 분석을 기반으로 효율적인 의사결정을 지원합니다.
향후 산업군별 정교화, 실시간 업데이트 및 피드백 시스템을 추가함으로써 더 나은 성능을 기대할 수 있습니다.
