[python][spark] pyspark 설치하기 (windows 10)

 

스파크를 연습해야 하는데 환경설정부터가 만만치가 않다.

HDFS, 아나콘다 가상 환경이 아닌 로컬 환경에서 손쉽게 pyspark를 설치하고 연습해보자

 


0. 설치환경

- OS: windows 10

- version: python3

- editor: pycharm (에디터는 크게 상관없음)

 

 

 


1. 설치

 

 

파이참을 실행하고 터미널을 열어준다. 파이썬 환경변수가 지정되어 있다면 명령프롬트에서 실행해도 상관없다. *실행할 워킹디렉토리를 만들고 해당 경로에서 설치한다.

 

pip install pyspark

 

위 명령어로 pyspark 를 설치한다.

 

 


2. spark 실행하기

 

 

터미널에서 pyspark를 실행한다 

 

 

 

 

위 화면과 같이 실행이 되면 성공이다.  단 하둡 환경이 아니기 때문에 경고 메세지가 출력된다. 

 

 

 


3. 예제 실행을 위한 준비

https://spark.apache.org/downloads.html

 

 

pip를 이용해서 pyspark를 설치하면 샘플 예제에 필요한 README.md 파일이 없다. 따라서 공식 도큐먼트에 있는 샘플 예제를 확인해 보기 위해서 스파크를 추가로 다운로드한다. 단 스파크 사용법을 이미 알고있다면 굳이 진행할 필요가 없다.

 

귀찮다면 그냥 아무 text 파일이나 읽어서 진행해도 무방하다.

 

 

 

 


 

 

 

 

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

 

버전은 상관없고 3번 링크를 클릭해서 이동한다.

 

 

 

 

 

 

아무 링크나 눌러서 다운로드 한다.

 

 

 

 

 

 

 

 

 

다운로드한 압축 파일에서 README.md 파일만 압축을 풀고, 현재 작업 중인 워킹 디렉토리로 해당 파일을 이동시킨다.

 


4. 샘플 예제 실행

 

textFile = spark.read.text("README.md")

textFile.count()  # Number of rows in this DataFrame

 

 

 

텍스트 파일의 전체 행 개수는 108개라고 출력한다.

 

 

 

textFile.first()  # First row in this DataFrame

 

 

텍스트 파일의 첫 번째 행의 값은 # Apache Spark 라고 출력한다.

 

 

 

 

 

 

 

 

 

이상없이 작동하는 것을 확인할 수 있다.

[출처] https://jinyes-tistory.tistory.com/171

 

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
공지 오라클 기본 샘플 데이터베이스 졸리운_곰 2014.01.02 86571
공지 [SQL컨셉] 서적 "SQL컨셉"의 샘플 데이타 베이스 SAMPLE DATABASE of ORACLE 가을의 곰을... 2013.02.10 78978
공지 [G_SQL] Sample Database 가을의 곰을... 2012.05.20 95729
46 [데이터분석 & 데이터 사이언스] 수많은 데이터 사이언티스트들이 직장을 떠나는 이유는 무엇인가? file 졸리운_곰 2025.03.09 904
45 [데이터분석][파이썬][python] 한글 글꼴 사용 (matplotlib) 졸리운_곰 2024.04.18 1360
44 [데이터분석 & 데이터 사이언스] 데이터에 관한 꼭 알아야 할 오해와 진실 12가지 졸리운_곰 2024.01.17 1317
43 [데이터분석][파이썬][python] Awesome Dash Awesome file 졸리운_곰 2021.07.10 2340
42 [데이터분석][파이썬][python] ???? Introducing Dash ???? file 졸리운_곰 2021.07.10 1608
41 [dataset] (한글) 욕설 감지 데이터셋 file 졸리운_곰 2021.05.12 1559
40 [데이터분석][python] Dash를 사용하는 초보자 및 기타 모든 사용자를위한 Python의 대시 보드 file 졸리운_곰 2021.04.14 1763
39 [데이터분석][python] Dash를 사용하는 초보자 및 기타 모든 사용자를위한 Python의 대시 보드 file 졸리운_곰 2021.04.14 1605
38 [데이터분석][데이터 사이언스][python][Dash] Python, Dash 및 Plotly를 사용하여 COVID-19 사례 데이터 시각화 file 졸리운_곰 2021.03.28 1501
37 [데이터분석][머신러닝] When not to use machine learning or AI Adventures in wishful thinking, nonstationarity, and pattern-finding / 기계 학습 또는 AI를 사용하지 않아야하는 경우 희망찬 사고, 비정상 성, 패턴 찾기의 모험 file 졸리운_곰 2021.03.28 21623
36 [MSA][머신러닝] 쿠버네티스 기반의 End2End 머신러닝 플랫폼 Kubeflow #1 - 소개 file 졸리운_곰 2021.03.21 1136
35 [데이터사이언스] 데이터 과학자를위한 3 가지 훌륭한 디자인 패턴, 3 Great Design Patterns for Data Scientists file 졸리운_곰 2021.03.04 782
34 [데이터분석] 시계열 데이터에 AI를 사용하는 이유는 무엇입니까? file 졸리운_곰 2021.02.28 1193
33 [데이터분석] AI 예측 및 이상 탐지를위한 시계열 데이터 전처리 file 졸리운_곰 2021.02.28 1032
32 [데이터분석] bitcoin analysis 비트 코인 시계열 데이터에 대한 AI 이상 탐지 file 졸리운_곰 2021.02.27 1592
31 [데이터분석 & 데이터 사이언스] How To Create a Data Science Portfolio Website file 졸리운_곰 2021.02.14 1824
30 [데이터수집4] 오픈 API 데이터 수집 (소셜미디어 데이터 수집) file 졸리운_곰 2020.06.12 1951
29 [데이터수집3] 관계형 데이터베이스 데이터 수집 file 졸리운_곰 2020.06.12 1319
28 [데이터수집2] 분산시스템 로그 수집 (빅데이터 수집) file 졸리운_곰 2020.06.12 1494
27 [데이터수집1] 웹 크롤링, 웹 스크래핑 file 졸리운_곰 2020.06.12 1804
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED