스파크 Spark - 윈도우10에서 빅데이터 실습 세팅 및 시작하기

해당 게시글은 BetterThanWholwas 블로그를 참조해서 다시 정리한 게시글입니다.

스파크와 스칼라에 관심이 있다면, 메뉴얼 등을 업데이트 중인 저의 사이트를 참조해주세요

윈도우에서 빅데이터 실습을 해야하는 이유는 다음과같습니다.

1. 하둡을 세팅하기엔 너무 어렵습니다.

2. 리눅스도 마찬가지입니다.

빅데이터는 뭔지 해보고싶은데, 설치나 플랫폼에 따라 에러 등에 이리 치이고 저리 치여서 실습조차 못하게될수있습니다.

스칼라나 파이썬 자바 등을 이용해서, 윈도우 싱글 클러스터 환경으로 재밌게 실습을 해봅시다.

스파크(SPark)란?

클러스터용 연산플랫폼이다.
맵리듀스 모델을 대화형 명령어 쿼리와 스트리밍 처리 등이 가능하도록 확장한것이다 연산은 메모리에서 수행하기떄문에,
속도가 빠르며,
하둡 클러스터 위에서도 실행가능하다 카산드라를 포함한 어떤 하둡데이터 소스에도 접근이가능하다. -
Source from, O'REILLY, Learning Spark -

Window Spark 실습환경

실습환경
1. OS Window 10
2. Other java 1.8.0_201 spark-2.4.6 hadoop 2.6
3. 환경변수(시스템 변수)
SPARK_HOME (C:\spark-2.4\bin)
SCALA_HOME (C:\scala\bin)
JAVA_HOME (C:\Progra~1\java\jdk1.8.0_144)
HADOOP_HOME (C:\hadoop)
JAVA_OPTIONS (-Xmx512M -Xmx512M)

Window Spark 세팅(자바, 스칼라, 스파크, 하둡 등)

1. java 설치 1.8 이상 버전 JDK 설치 (왜냐하면 람다식을 지원해야된다. 그래서 무조건 1.8이상)
(https://www.oracle.com/technetwork/java/javase/downloads/jdk8-downloads-2133151.html)
2. Scala 설치 c:\scala 로 경로설정해서 설치하기 (중간에 경로 띄어쓰기 있으면 에러남)
(https://www.scala-lang.org/download/)
3. Spark 설치
3.1. hadoop 2.6에 맞춰서 download
(http://spark.apache.org/downloads.html) 3.2. c:\spark-2.4 (중간에 경로 띄어쓰기 있으면 에러남)
4. Hadoop (하둡을 사용안하기때문에, 이 작업이 필요함)
4.1. 해당 사이트를 방문 (https://github.com/steveloughran/winutils)
4.2. 원하는폴더
  (: 다운로드)에 가서 git clone https://github.com/steveloughran/winutils.git
*** git 설치가 안되있으면 수동으로 사이트에서 압축파일 다운 후 해제 ***
4.3. 다운받거나 압축해제 후 winutils\hadoop-2.6.4\bin 폴더에 있는 winutils.exe 복사하기
4.4. C:\hadoop\bin 폴더만들고, 위에 복사한 winutils.exe 붙여넣기
5. 환경변수 설정 (시스템 변수 클릭 후 추가)
SPARK_HOME C:\spark-2.4\bin
SCALA_HOME C:\scala\bin
JAVA_HOME C:\Progra~1\java\jdk1.8.0_144
(스파크는 중간에 띄어쓰기경로 있으면 에러남, 본인 버전에 맞게)
HADOOP_HOME C:\hadoop
JAVA_OPTIONS -Xmx512M -Xmx512M
6. spark-shell
6.1 cmd(명령프롬프트)창을 연다
6.2 c:\로 이동한뒤, spark-2.4\bin\spark-shell 기입후 Enter
(또는 c:\spark-2.4\bin\로 이동한뒤, spark-shell 기입후 Enter)
(에러 발생시 100% 경로문제) 4.5으로 돌아가서
SPARK_HOME, SCALA_HOME 경로에 bin을 제거 혹은 추가(C:\scala, C:\spark-2.4 변경)
기존 자바 사용자는 시스템 변수가 아닌 사용자 변수에 등록된 path 경로 확인후 bin 추가 혹은 제거
(: C:\Progra~1\java\jdk1.8.0_144, C:\Progra~1\java\jdk1.8.0_144\bin)

설치완료시 폴더 구성

c:\scala

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

c:\spark-2.4

c:\hadoop\bin

설정완료 후 환경변수 화면

*** 초기설정 후 spark-shell이 안되면, 재부팅해보고 안되는경우, 경로에 bin을 제거하거나 추가하고 cmd창을 껐다키면됨

*** spark-shell이 잘되다가 컴퓨터를 재부팅했는대 안되는경우, 경로에 bin을 제거하거나 추가하고 cmd창을 껐다키면됨

*** 그래도 잘 안되는경우, 사용자변수 Path에 등록된 자바도 하단의 JAVA_HOME과 동일하게 해주던지, 삭제

스파크 Spark 실행 (spark-shell)

아래 세팅이 완료되면 명령프롬프트로 c:\spark-2.4\bin\로 이동한뒤, spark-shell 로 진행하면됩니다.

웹브라우저(localhost:4040) 확인가능

 

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
공지 오라클 기본 샘플 데이터베이스 졸리운_곰 2014.01.02 86097
공지 [SQL컨셉] 서적 "SQL컨셉"의 샘플 데이타 베이스 SAMPLE DATABASE of ORACLE 가을의 곰을... 2013.02.10 78617
공지 [G_SQL] Sample Database 가을의 곰을... 2012.05.20 95332
904 [spark] Spark 튜닝하기 file 졸리운_곰 2021.03.06 1291
903 [spark] PySpark와 pandas 데이터 프레임 간의 변환 최적화 file 졸리운_곰 2021.03.04 1673
902 [데이터사이언스] 데이터 과학자를위한 3 가지 훌륭한 디자인 패턴, 3 Great Design Patterns for Data Scientists file 졸리운_곰 2021.03.04 779
901 [hadoop] Python으로 Hive 연결하기 졸리운_곰 2021.03.04 1502
900 Data Engineering - Apache Spark Dataframe 10분만에 훑어보기 졸리운_곰 2021.03.04 1867
899 [데이터분석] 시계열 데이터에 AI를 사용하는 이유는 무엇입니까? file 졸리운_곰 2021.02.28 1191
898 [데이터분석] AI 예측 및 이상 탐지를위한 시계열 데이터 전처리 file 졸리운_곰 2021.02.28 1031
897 [hadoop][java][MapReduce] 맵리듀스 원리와 그 과정 졸리운_곰 2021.02.28 1652
896 [데이터분석] bitcoin analysis 비트 코인 시계열 데이터에 대한 AI 이상 탐지 file 졸리운_곰 2021.02.27 1588
895 [spark] pyspark 설치하기 (windows 10) file 졸리운_곰 2021.02.26 1659
894 [hadoop][mapreduce][csv file] [Reference] : Hadoop MapReduce Join & Counter with Example file 졸리운_곰 2021.02.23 1534
893 [hadoop][mapreduce][csv file] Hadoop & Mapreduce Examples: Create First Program in Java file 졸리운_곰 2021.02.23 1855
892 [mongodb , 몽고디비] How to Use MongoDB Comparison Query Operators in Java 졸리운_곰 2021.02.19 1508
891 Apache Spark란? 졸리운_곰 2021.02.19 1508
890 [apache spark] [Spark Programming]1. Apache Spark 개요 및 설치 file 졸리운_곰 2021.02.19 19627
889 [Oracle, 오라클 데이터베이스] java.sql.SQLException: ORA-00911: 문자가 부적합합니다. file 졸리운_곰 2021.02.19 1063
888 [mongodb, 몽고디비] How do you query for “is not null” in Mongo? 졸리운_곰 2021.02.19 1268
» 스파크 Spark - 윈도우10에서 빅데이터 실습 세팅 및 시작하기 file 졸리운_곰 2021.02.17 1313
886 스파크(Spark) 3.0.0 설치 on Windows 10 file 졸리운_곰 2021.02.17 1597
885 [oracle, 오라클] 오라클 MERGE INTO 문으로 있으면 UPDATE 없으면 INSERT 한번에 수행하기 졸리운_곰 2021.02.16 1044
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED