빅데이터 이해 & 데이터 리터러시 함양하기
박서희 강사님
왜 데이터 드리븐이 중요한가
각종 디지털 기기를 통한 아날로그에서 디지털로의 전환, 디지털 트랜스포메이션. 이로 인해 사업 관련 기업/기술로부터 나오는 데이터에 기반한 가치 창출이 서비스 사업 경쟁력의 원천이 됨.
데이터를 기반으로 의사결정을 하는 데이터 드리븐 경영이 중요해짐.
실제 비즈니스 적용 사례
마켓컬리
- 고객 맞춤형 상품 추천: 구매/검색 이력, 페이지 뷰 등 분석하여 선호에 따른 상품을 더 쉽게 찾아볼 수 있음
- 재고 관리 및 수요 예측: 구매패턴, 계절성, 트렌드 등 분석하여 재고비용, 품절 최소화
- 마케팅 전략 개발: 인기 상품 및 카테고리, 시간대별 트래픽 등 고객행동 데이터 분석하여 타겟팅 광고/프로모션 진행
무신사
- 인기 상품, 선호 디자인 등 데이터 수집하여 상품에 반영 및 개선하여 자체 브랜드 무신사 스텐다드 출시
언제부터 데이터 드리븐이 중요했고, 언제까지 갈 것인가
빅데이터로부터 actionalble insight 발굴하는 것 가치 창출의 핵심
빅데이터 분석: 통계/기술/비즈니스 관점
데이터-인공지능: 상호보완, 공생관계
generative AI(생성형 ai) - chat gpt, midjourney, 코벡스
> CS, 고객 맞춤 서비스 추천
> openAI의 챗gpt ai 플러그인 생태계
> 멀티모달 AI: 음성/텍스트 동시 수집&출력 제미나이
ai 리스크 관리도 필요함
데이터 관련 직무



필요한 역량과 준비할 사항
필요 역량

채용공고에서 가장 자주 등장하는 데이터 분석 툴
- Python, R, EXCEL, SQL
- Tableau, Power BI, Google Analytics: 프로덕트 분석가, 비즈니스 분석가, 퍼포먼스 마케터에게 특히 더 요구됨
박서희 강사님 추천 자료
** 기획자를 위해 쉽게 설명된 IT 서적 추천 !!!
1/ 비전공자를 위한 이해할 수 있는 IT 지식
https://product.kyobobook.co.kr/detail/S000001981866?utm_source=google&utm_medium=cpc&utm_campaign=googleSearch&gad_source=1&gclid=CjwKCAiAlcyuBhBnEiwAOGZ2S1BkU2OluMY-OaB7UqZP8kPLJ6DpGN0CfpVST80-GtIdoXAyXb2j7xoCOUwQAvD_BwE
2/ 오늘도 개발자가 안 된다고 말했다
https://product.kyobobook.co.kr/detail/S000000938510
오늘도 개발자가 안 된다고 말했다 | 김중철 - 교보문고
오늘도 개발자가 안 된다고 말했다 | 개발하기 싫어서 안 된다고 말하는 게 아니다 개발 언어를 잘 몰라도 협업을 잘할 수 있다많은 IT 종사자들이 안 된다고 말하는 개발자로 인해 협업에 어려
product.kyobobook.co.kr
💡툴 공부 source
파이썬 기초 문법: 코딩도장(연습 문제 제공)
데이터 분석 기초: 이수안 컴퓨터 연구소
파이썬 머신러닝 완벽 가이드
💡자주 사용하는 데이터 시각화 패키지 (python 기반 패키지들)
기본 : matplotlib, seaborn
심화 : plotly
💡Auto ML 패키지 : Pycaret
Pycaret 예제 - https://dacon.io/codeshare/5161
[MAT 6편] 실전 AutoML 1탄: PyCaret
dacon.io
친근한 엑셀로 실무 엑셀 데이터 분석 시작하기
이동훈 강사님
Background
4차 산업혁명 시대의 오프라인과 온라인 세계를 넘나드는 세상, "디지털 트윈(Digigtal Twin)"의 핵심 가치 데이터
Soft Skill 데이터 리터러시
- 구조/상황 등 다양한 관점에서 이해하여 활용할 수 있는 역량
- 데이터 범람의 시대, 필요한 데이터를 선별할 수 있는 역량이 필요함

Hard Skill 데이터 분석
- 의사결정 지원을 목표로 과학적 의사결정, 효율적 비즈니스 운영을 도움
- 다양한 데이터 분석 기법 활용 인사이트 도출
- 목적: insight = long-term lessons. 단순 문제 해결만이 아닌 문제가 반복되지 않도록 하기 위해, 장기적 목표를 위해 활용
"내가 생각하는 나만의 데이터 분석에 대한 정의는?"
이 질문에 대한 나만의 답을 내릴 수 있다면 전문가가 되었다고 할 수 있다
Tool 엑셀
"엑셀을 잘한다는 것은 사용자의 입장에서 목적에 부합하도록 자료를 구성하는 것"
엑셀의 기본 원리
- 데이터의 종류: 값, 수식, 서식. ctrl+V Ctrl+C로 복붙을 하면 서식까지 적용되니 수식/값/서식을 따로 붙여 넣어야 함
- 엑셀의 참조: 기본값은 복붙할 때마다 참조된 셀이 함께 이동하는 상대참조. 셀을 참조할 때 상황에 따라 행과 열 중 둘 다(절대참조) 참조하거나 행이나 열만(혼합참조) 참조. (F4키 사용)

탐색적 데이터 분석(EDA)
엑셀 데이터 분석 도구
- 추가: [파일] 탭 -> 옵션 -> 추가 기능 -> 이동 -> 분석 도구 or 분석 도구 팩 체크 -> 확인
- 데이터 선택 시 열 이름 포함, 첫째 행 이름표 사용 필수



- 중앙값: 데이터의 중앙에 있는 값. 중앙값을 사용하는 이유 - 이상치에 강건하다
- 최빈값: 가장 빈번한 값
- 분산: 데이터들이 평균값을 기준으로 얼마나 퍼져 있는지 알려주는 지표
피벗 테이블을 활용한 EDA
- 피벗 테이블: 엑셀에서 데이터를 요약하는 통계표
- 가장 먼저 데이터의 특성을 확인할 수 있는 열(feature/attribute) 확인
결측치와 이상치 탐색
결측치: 데이터에 값이 없는 것
- 처리방법: 제거 / 치환 / 모델 기반 처리
이상치: 정상군의 상한과 하한의 범위를 벗어나 있거나 패턴에서 벗어난 수
- Z-Score: 자료가 평균으로부터 표준편차의 몇 배만큼 떨어져 있는지를 나타내는 지표

- 4분위수: 데이터를 4등분하는 값
> IQR = 3사분위-1사분위수(두 값의 거리)
> IQR 활용 이상치 범위: 이상치 < 1Q - 1.5 X IQR , 3Q + 1.5 X IQR <이상치
- Box Plot(상자 도표)

상관 분석과 산점도
- 상관계수가 1에 가까울 수록 양의 상관 관계(정비례), -1에 가까울 수록 음의 상관관계(반비례)
- +0.7 이상일 경우 강한 양의 상관 관계, -0.7 이하일 경우 강한 음의 상관관계
- 일반적으로 -0.3 < r < 0.3일 경우 상관관계 없음
- 상관관계가 강하다고 해서 두 변수 간의 인과관계를 설명할 수 있는 것은 아니지만, 인과관계를 가진 두 변수는 반드시 강한 상관관계를 가지고 있음
- 인과관계는 경험적으로 파악할 수 밖에 없음. 변수를 상관 분석을 통해 강한 상관 관계를 가지고 있는 변수를 선택해 인과관계 실험/분석
산점도 데이터를 점으로 표현해 흩어져 있는 정도 파악
*분산형, 거품형은 데이터 선택 후 차트 삽입 X(데이터 순서 조건 존재)

강의 외 학습 목표로 잡으면 좋을 것들
자격증 빅데이터 분석기사(R / Python 중 선택하여 응시)
케글, 각 지자체 데이터 분석 공모전
'학습기록' 카테고리의 다른 글
| SQL(My SQL) 1주차 (0) | 2024.04.04 |
|---|---|
| 4주차 학습 메모_파이썬 (0) | 2024.03.11 |
| 3주차 학습 메모_파이썬 (0) | 2024.03.08 |
| 2주차 강의메모 (4) | 2024.02.29 |
| 패스트캠퍼스 데이터 분석 부트캠프 13기 OT (0) | 2024.02.19 |