27일차 멋사 AI스쿨 main lecture by 박조은 강사님 오전/오후엔 미드프로젝트 발표 및 회고로 2시간 정도 수업 진행하였다. 머신러닝 입문 머신러닝 프레임워크 캐글 설문조사 결과(2020) - Scikit-learn (가장 많이쓰임 / 주로 정형데이터에 많이 쓰임) - Tensor Flow - Keras - xgboost - Pytorch - Caret 등등 캐글 설문조사 리포트는 트렌드를 파악하기 좋으므로 최신 것도 한번 읽어보기 프레임워크, 도구, 에디터, 알고리즘, Automated ML 등 2022 결과보기: https://www.kaggle.com/competitions/kaggle-survey-2022 프레임워크, 라이브러리 등 용어 참고: https://www.castingn.c..
221019 수요일 (첫날) 서울시 상권 분석이라는 주제를 정하고 본격적으로 전처리 하기 시작했다. 머릿속에 그리는 것을 시각화하기 위해 오랜만에 피그마를 다시 사용했다. 확실히 시각적인 결과물을 팀원들과 공유하고 소통하니, 각자 좀 더 어떤 과업을 수행해야하는지 명확하게 보였다. 전처리 과정에서 막연했던 것을 화면 공유를 통해 라이브 코딩을 하니까 비교적 빠르게 해결되었다! 역시 시각화가 어려웠는데 다양한 사례를 참고해봐야겠다 #데이터_전처리 #데이터_시각화 #데이터_EDA 221020 목요일 (둘째날) 수업을 들을때와 실제로 무언가를 만들때의 커다란 차이를 느꼈다. 프로젝트 시간의 50%는 구글링하느라 시간 다쓰고, 직접 코드 짜는 거 10%, 복붙 10초, 다듬는데 50000만초, 머리싸매기 30%..
오늘의 회고 사실(Fact) : GitHub활용법, Streamlit Dashboard 만들기 느낌(Feeling) : 에디터를 VScode로 사용하고, Github와 Streamlit 등 새로운 방법을 많이 접하다보니 새삼 어려웠다. 교훈(Finding) : 깃허브가 아직 많이 생소한데, 평소에 잔디심기를 하려고 노력하면서 익숙해져야겠다 데이터센터나 클라우드서버를 사용하는 이유는? 서버관리가 불편한 이유 - 3년에 한 번씩 교체해줘야한다고 들었는데 교체과정이 복잡하다 - 24시간 가동되어야함, 온습도 유지 (발열이 매우 심하다) - 다량의 트래픽으로 대용량 서버 필요 리눅스계열 터미널창 명령어 터미널 cmd ** 리눅스 계열 명령어 ** ls : 현재 디렉토리 폴더 내부 확인 (윈도우 dir) ls -..
22일차 멋사 AI스쿨 main lecture by 박조은 강사님 오늘의 키워드는 절약 1) 메모리절약 => downcast, 2) 스토리지 절약(디스크공간) => parquet Downcast 실습 먼저 자료형에 대해 자세히 알아보았다. int64와 int32의 차이, uint, float 등 같은 숫자 자료형 안에서도 정수형인지 실수형인지만 구분할 뿐만 아니라, 표현할 수 있는 범위가 다르다. 예를 들어 어떤 일련번호의 원래 데이터형은 int64이고, 최소값은 666668, 최대값은 999987 이고 앞으로 음수는 사용하지 않는다고 가정할 때 어떤 데이터 타입을 사용하면 적절할까? -> unit32가 적절하다. 데이터의 범위(int64, uint32 등)에 따라 메모리에서 차지하는 용량이 다르다. 현..
SQL JOIN 정리 실제 업무 환경에서는 데이터의 중복 저장을 방지하기 위해 DB를 분리해서 사용하고, JOIN을 사용할 일이 매우 많다. 그래서 관계형 데이터베이스를 관리하기위해 RDBMS (Relation Database management system) 사용하는 것이다. DB간의 관계를 ERD(Entity-Relation Diagram)으로 표현하는데, 알고 있으면 SQL을 작성하기 훨씬 용이해진다. (문헌정보학 전공에서 수도 없이 배웠던 ERD… 다시보니 반갑다. 이번 기회에 복습해서 정리해야겠다) INNER JOIN /* 지금은 잘 안쓰는 방식 SELECT * FROM users, orders where users.Id = orders.userId */ SELECT * FROM users IN..
21일차 멋사 AI스쿨 special lecture by 데이터리안 인프런 SQL 중급 강의 (JOIN, UNION) 중급 문제 풀이 (solveSQL, 해커링크, 리트코드) -> SQL 공부방 매출 분석 ARPU = 매출 / 전체 유저 수 (Average Revenue Per User) ARPPU = 매출 / 결제 유저 수 (Average Revenue Per Paying User) 매출 = 결제 유저 수 X ARPPU 매출 = 유저 수 X 결제자 비율 X ARPPU 전체유저수 / 결제 유저의 비율 / 인당 결제액 등 어떤 변수가 전체 매출 변화에 영향을 미치는 지 파악해야한다. AARRR 서비스 성장 분석 방법론 A(Acquisition, 획득): 광고 등의 방법으로 새로운 사용자를 얻어오는 단계 A..
20일차 멋사 AI스쿨 main lecture by 박조은 강사님 Seaborn 복습 https://seaborn.pydata.org/tutorial.html relplot, displot, catplot 큰 범주는 외우기! 한글폰트 적용 설정 import koreanize_matplotlib # 그래프에 retina display 적용 %config InlineBackend.figure_format = 'retina' # 제대로 적용 되었는지 확인해보기 pd.Series([1,-1]).plot(title="한글") 의약품 처방데이터 분석 (100만명의 데이터 중 33만명 파일 활용) csv 파일 위치 찾아서 불러오기 (glob) from glob import glob # glob("data/HP_*.c..
19일차 멋사 AI스쿨 main lecture by 박조은 강사님 EDA 실습 전국 신규 민간 아파트 분양가 데이터 분석 (전혀 다른 형태의 데이터 합치기) 통계청 KOSIS 데이터 분석 (깔끔한 데이터의 이해와 국가통계포털 이용법) 전국 신규 민간 아파트 분양가 데이터 분석 melt (열에 있는 데이터를 행으로 녹이기) id_vars = 에 지정하는 값은 녹이지 않고 남길 컬럼 지정 https://pandas.pydata.org/docs/user_guide/reshaping.html#reshaping-by-melt # 아래 두 개는 같은 결과 # df.melt(id_vars="지역") df_melt = pd.melt(df, id_vars="지역") 데이터를 녹인 다음엔 variable, value 컬럼..
18일차 멋사 AI스쿨 main lecture by 박조은 강사님 - 서울시 코로나 확진자 데이터 분석 실습 마무리 - 분석하기 좋은 데이터란 (Tidy Data) - 아파트 분양가 데이터 분석 실습 시작 describe(include = ‘object’) count 결측치를 제거한 빈도수 unique 중복값을 제거한 유일값 top 최빈값 freq 최빈값의 빈도수 replace 메서드 - 데이터 프레임, 시리즈에 모두 사용 - replace는 완전히 일치해야 적용 → regex=True를 통해 일부만 가능하게 바꿀 수 있다. str.replace - 시리즈에만 사용가능 - str.replace는 해당 텍스트만 포함되면 바뀌게 된다 - str.contains도 시리즈에만 사용가능 (str이 series a..