[python][spark] pyspark 설치하기 (windows 10)

 

스파크를 연습해야 하는데 환경설정부터가 만만치가 않다.

HDFS, 아나콘다 가상 환경이 아닌 로컬 환경에서 손쉽게 pyspark를 설치하고 연습해보자

 


0. 설치환경

- OS: windows 10

- version: python3

- editor: pycharm (에디터는 크게 상관없음)

 

 

 


1. 설치

 

 

파이참을 실행하고 터미널을 열어준다. 파이썬 환경변수가 지정되어 있다면 명령프롬트에서 실행해도 상관없다. *실행할 워킹디렉토리를 만들고 해당 경로에서 설치한다.

 

pip install pyspark

 

위 명령어로 pyspark 를 설치한다.

 

 


2. spark 실행하기

 

 

터미널에서 pyspark를 실행한다 

 

 

 

 

위 화면과 같이 실행이 되면 성공이다.  단 하둡 환경이 아니기 때문에 경고 메세지가 출력된다. 

 

 

 


3. 예제 실행을 위한 준비

https://spark.apache.org/downloads.html

 

 

pip를 이용해서 pyspark를 설치하면 샘플 예제에 필요한 README.md 파일이 없다. 따라서 공식 도큐먼트에 있는 샘플 예제를 확인해 보기 위해서 스파크를 추가로 다운로드한다. 단 스파크 사용법을 이미 알고있다면 굳이 진행할 필요가 없다.

 

귀찮다면 그냥 아무 text 파일이나 읽어서 진행해도 무방하다.

 

 

 

 


 

 

 

 

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

 

버전은 상관없고 3번 링크를 클릭해서 이동한다.

 

 

 

 

 

 

아무 링크나 눌러서 다운로드 한다.

 

 

 

 

 

 

 

 

 

다운로드한 압축 파일에서 README.md 파일만 압축을 풀고, 현재 작업 중인 워킹 디렉토리로 해당 파일을 이동시킨다.

 


4. 샘플 예제 실행

 

textFile = spark.read.text("README.md")

textFile.count()  # Number of rows in this DataFrame

 

 

 

텍스트 파일의 전체 행 개수는 108개라고 출력한다.

 

 

 

textFile.first()  # First row in this DataFrame

 

 

텍스트 파일의 첫 번째 행의 값은 # Apache Spark 라고 출력한다.

 

 

 

 

 

 

 

 

 

이상없이 작동하는 것을 확인할 수 있다.

[출처] https://jinyes-tistory.tistory.com/171

 

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
공지 오라클 기본 샘플 데이터베이스 졸리운_곰 2014.01.02 86307
공지 [SQL컨셉] 서적 "SQL컨셉"의 샘플 데이타 베이스 SAMPLE DATABASE of ORACLE 가을의 곰을... 2013.02.10 78758
공지 [G_SQL] Sample Database 가을의 곰을... 2012.05.20 95506
904 [spark] Spark 튜닝하기 file 졸리운_곰 2021.03.06 1292
903 [spark] PySpark와 pandas 데이터 프레임 간의 변환 최적화 file 졸리운_곰 2021.03.04 1677
902 [데이터사이언스] 데이터 과학자를위한 3 가지 훌륭한 디자인 패턴, 3 Great Design Patterns for Data Scientists file 졸리운_곰 2021.03.04 780
901 [hadoop] Python으로 Hive 연결하기 졸리운_곰 2021.03.04 1502
900 Data Engineering - Apache Spark Dataframe 10분만에 훑어보기 졸리운_곰 2021.03.04 1868
899 [데이터분석] 시계열 데이터에 AI를 사용하는 이유는 무엇입니까? file 졸리운_곰 2021.02.28 1193
898 [데이터분석] AI 예측 및 이상 탐지를위한 시계열 데이터 전처리 file 졸리운_곰 2021.02.28 1031
897 [hadoop][java][MapReduce] 맵리듀스 원리와 그 과정 졸리운_곰 2021.02.28 1657
896 [데이터분석] bitcoin analysis 비트 코인 시계열 데이터에 대한 AI 이상 탐지 file 졸리운_곰 2021.02.27 1592
» [spark] pyspark 설치하기 (windows 10) file 졸리운_곰 2021.02.26 1661
894 [hadoop][mapreduce][csv file] [Reference] : Hadoop MapReduce Join & Counter with Example file 졸리운_곰 2021.02.23 1535
893 [hadoop][mapreduce][csv file] Hadoop & Mapreduce Examples: Create First Program in Java file 졸리운_곰 2021.02.23 1855
892 [mongodb , 몽고디비] How to Use MongoDB Comparison Query Operators in Java 졸리운_곰 2021.02.19 1508
891 Apache Spark란? 졸리운_곰 2021.02.19 1512
890 [apache spark] [Spark Programming]1. Apache Spark 개요 및 설치 file 졸리운_곰 2021.02.19 19628
889 [Oracle, 오라클 데이터베이스] java.sql.SQLException: ORA-00911: 문자가 부적합합니다. file 졸리운_곰 2021.02.19 1064
888 [mongodb, 몽고디비] How do you query for “is not null” in Mongo? 졸리운_곰 2021.02.19 1269
887 스파크 Spark - 윈도우10에서 빅데이터 실습 세팅 및 시작하기 file 졸리운_곰 2021.02.17 1313
886 스파크(Spark) 3.0.0 설치 on Windows 10 file 졸리운_곰 2021.02.17 1600
885 [oracle, 오라클] 오라클 MERGE INTO 문으로 있으면 UPDATE 없으면 INSERT 한번에 수행하기 졸리운_곰 2021.02.16 1044
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED