Scikit-Learn 패키지의 소개

Scikit-Learn 패키지는 머신 러닝 교육 및 실무를 위한 파이썬 패키지로 다음과 같은 구성 요소들을 갖추고 있다.

  • 벤치마크용 샘플 데이터 세트
  • 데이터 전처리(preprocessing) 기능
  • Supervised learning
  • Unsupervised learning
  • 모형 평가 및 선택

자세한 내용은 다음 웹사이트를 참조한다.

scikit-learn 패키지에서 제공하는 머신 러닝 모형

scikit-learn 패키지의 장점은 다양한 머신 러닝 모형 즉, 알고리즘을 하나의 패키지에서 모두 제공하고 있다는 점이다. 다음은 scikit-learn 패키지에서 제공하는 머신 러닝 모형의 목록이다. 이 목록은 대표적인 것들만을 나열한 것이며 지속적으로 모형들이 추가되고 있다.

Supervised learning

  • http://scikit-learn.org/stable/supervised_learning.html

  • Generalized Linear Models

    경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
    어린이용이며, 설치가 필요없는 브라우저 게임입니다.
    https://s1004games.com

    • Ordinary Least Squares
    • Ridge/Lasso/Elastic Net Regression
    • Logistic regression
    • Polynomial regression
    • Perceptron
  • Linear and Quadratic Discriminant Analysis
  • Support Vector Machines
  • Stochastic Gradient Descent
  • Nearest Neighbor Algorithms
  • Gaussian Processes
  • Naive Bayes
  • Decision Trees
  • Ensemble methods
    • Random Forests
    • AdaBoost

Unsupervised learning

  • Gaussian mixture models
  • Manifold learning
  • Clustering
    • K-means
    • DBSCAN
  • Biclustering
  • Decomposing
    • Principal component analysis (PCA)
    • Factor Analysis
    • Independent component analysis (ICA)
    • Latent Dirichlet Allocation (LDA)
  • Covariance estimation
  • Novelty and Outlier Detection
  • Density Estimation

scikit-learn의 서브 패키지

scikit-learn 은 서브 패키지 단위로 별도의 기능을 제공하고 있다. 대표적인 서브 패키지와 기능을 나열하면 다음과 같다.

  • 자료 제공:
    • sklearn.datasets: 샘플 데이터 세트 제공
  • 자료 전처리:
    • sklearn.preprocessing: imputation, encoding 등 단순 전처리
    • sklearn.feature_extraction: Feature Extraction
  • 모형:
    • sklearn.base: Base classes and utility functions
    • sklearn.pipeline: Pipeline
    • sklearn.linear_model: Generalized Linear Models
    • sklearn.naive_bayes: Naive Bayes
    • sklearn.discriminant_analysis: Discriminant Analysis
    • sklearn.neighbors: Nearest Neighbors
    • sklearn.mixture: Gaussian Mixture Models
    • sklearn.svm: Support Vector Machines
    • sklearn.tree: Decision Trees
    • sklearn.ensemble: Ensemble Methods
    • sklearn.cluster: Clustering
  • 모형 평가:
    • sklearn.metrics: Metrics
    • sklearn.cross_validation: Cross Validation
    • sklearn.grid_search: Grid Search

scikit-learn의 Class

scikit-learn을 사용하기 위해서는 원하는 기능을 가지고 있는 클래스 객체를 생성해야 한다. scikit-learn은 다양한 클래스를 제공하지만 대부분의 클래스는 다음과 같이 세가지 그룹으로 나눌수 있다.

  • 전처리용 클래스
    • Transformer 클래스
      • 자료 변환
    • 공통 메서드
      • fit(): 모형 계수 추정, 트레이닝(training)
      • transform() : 자료 처리
      • fit_transform() : 모형 계수 추정 및 자료 처리 동시 수행
  • 머신러닝 모형 클래스 그룹
    • Regressor 클래스
      • 회귀분석
    • Classifier 클래스
      • 분류
    • Cluster 클래스
      • 클러스터링
    • 공통 메서드
      • fit(): 모형 계수 추정, 트레이닝(training)
      • predict(): 주어진 x값에 대해 y 예측
      • score(): 성과 분석
  • Pipeline 클래스
    • 복수의 Preprocessor와 Model을 연결하여 하나의 Model처럼 행동
    • Model 클래스가 제공하는 공통 메서드를 모두 제공
    • pipeline 내부에서 Preprocessor에서 자료를 계속 변형한 후 마지막으로 Model에 입력

[출처] https://datascienceschool.net/view-notebook/293ece8b0d124fbaa4d4d52bb8f1cb42/

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
15 [python 데이터분석] [jupyter] 주피터 노트북에 이미지 삽입 file 졸리운_곰 2025.09.06 526
14 [python 데이터분석] [Python] Streamlit 사용법 (python 데이터분석 웹 만들기) file 졸리운_곰 2024.12.22 462
13 [python 데이터분석] Anaconda : Error while loading conda entry point: conda-libmamba-solver (libarchive.so.19: cannot open shared object file: No such file or directory) 졸리운_곰 2024.12.14 520
12 [python 데이터분석] Anaconda | Conda update 반영 안됨(update 후에도 버전 변경 없음) file 졸리운_곰 2024.11.18 431
11 [python 데이터분석] Keeping Anaconda Up To Date 졸리운_곰 2024.05.30 552
10 [python 데이터 분석] 국내 경제 100대 통계지표 졸리운_곰 2024.02.18 672
9 [python 데이터 분석] Python 에서 R언어 패키지 호출 : Calling R From Python With rpy2 file 졸리운_곰 2024.01.28 676
8 [python 데이터 분석] 파이썬을 활용한 코스피, 달러 환율정보 수집부터 차트 시각화까지 file 졸리운_곰 2023.12.11 735
7 [Python 데이터분석][pandas] [Python pandas] DataFrame의 문자열 칼럼을 숫자형으로 바꾸기 : pd.to_numeric(), DataFrame.astype() file 졸리운_곰 2023.12.09 357
6 [Python 데이터분석] [Python 환경설정] VS code 설치 및 Anaconda와 연동하기 file 졸리운_곰 2023.03.17 527
5 [Python 데이터분석][python 데이터분석 프로덕션] [Python] Docker를 사용한 Dash 웹앱 생성 file 졸리운_곰 2021.12.10 403
4 [Python 데이터분석] [pandas] 공공데이터(csv) 활용시 한글 깨짐 현상 해결 file 졸리운_곰 2021.09.30 592
3 [Python 데이터분석] 공공데이터포털::공휴일 데이터 조회 (REST API) file 졸리운_곰 2021.09.30 358
2 [Python 데이터 분석] pandas의 to_csv()를 사용해서 csv 파일로 저장하기(save 하기) 졸리운_곰 2021.09.29 603
1 [Python 데이터 분석] 데이터 과학을 단순하게 만드는 3가지 Python 패키지 file 졸리운_곰 2021.09.24 513
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED