- 전체
- Sample DB
- database modeling
- [표준 SQL] Standard SQL
- G-SQL
- 10-Min
- ORACLE
- MS SQLserver
- MySQL
- SQLite
- postgreSQL
- 데이터아키텍처전문가 - 국가공인자격
- 데이터 분석 전문가 [ADP]
- [국가공인] SQL 개발자/전문가
- NoSQL
- hadoop
- hadoop eco system
- big data (빅데이터)
- stat(통계) R 언어
- XML DB & XQuery
- spark
- DataBase Tool
- 데이터분석 & 데이터사이언스
- Engineer Quality Management
- [기계학습] machine learning
- 데이터 수집 및 전처리
- 국가기술자격 빅데이터분석기사
- 암호화폐 (비트코인, cryptocurrency, bitcoin)
spark [spark] pyspark 설치하기 (windows 10)
2021.02.26 23:08
[python][spark] pyspark 설치하기 (windows 10)
스파크를 연습해야 하는데 환경설정부터가 만만치가 않다.
HDFS, 아나콘다 가상 환경이 아닌 로컬 환경에서 손쉽게 pyspark를 설치하고 연습해보자
0. 설치환경
- OS: windows 10
- version: python3
- editor: pycharm (에디터는 크게 상관없음)
1. 설치

파이참을 실행하고 터미널을 열어준다. 파이썬 환경변수가 지정되어 있다면 명령프롬트에서 실행해도 상관없다. *실행할 워킹디렉토리를 만들고 해당 경로에서 설치한다.
pip install pyspark
위 명령어로 pyspark 를 설치한다.
2. spark 실행하기

터미널에서 pyspark를 실행한다

위 화면과 같이 실행이 되면 성공이다. 단 하둡 환경이 아니기 때문에 경고 메세지가 출력된다.
3. 예제 실행을 위한 준비
https://spark.apache.org/downloads.html
pip를 이용해서 pyspark를 설치하면 샘플 예제에 필요한 README.md 파일이 없다. 따라서 공식 도큐먼트에 있는 샘플 예제를 확인해 보기 위해서 스파크를 추가로 다운로드한다. 단 스파크 사용법을 이미 알고있다면 굳이 진행할 필요가 없다.
귀찮다면 그냥 아무 text 파일이나 읽어서 진행해도 무방하다.

버전은 상관없고 3번 링크를 클릭해서 이동한다.

아무 링크나 눌러서 다운로드 한다.

다운로드한 압축 파일에서 README.md 파일만 압축을 풀고, 현재 작업 중인 워킹 디렉토리로 해당 파일을 이동시킨다.
4. 샘플 예제 실행
textFile = spark.read.text("README.md")
textFile.count() # Number of rows in this DataFrame

텍스트 파일의 전체 행 개수는 108개라고 출력한다.
textFile.first() # First row in this DataFrame

텍스트 파일의 첫 번째 행의 값은 # Apache Spark 라고 출력한다.

이상없이 작동하는 것을 확인할 수 있다.
[출처] https://jinyes-tistory.tistory.com/171
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.

