Spark를 설치해서 무작정 돌려보자.

 

일단 Spark 다운로드... 현재 최신 버전은 1.2.1이다.(2015/02/26 기준)
 
https://spark.apache.org/downloads.html 에 접속해서 spark 다운로드를 받는다. 
hadoop을 포함한 pre-built 버전으로 설치해 본다. (추후 소스코드 받아서 compile해보자.)
 

 
위 처럼 지정하고 Download 받아 압축을 해제하면 된다.
 

 
편의상 심볼릭 링크를 생성해 두었다.
 

설치 끝? Spark-Shell을 이용하여 Spark를 간단히 돌려보자.
 
./bin/spark-shell 을 수행하면 아래처럼 확인할 수 있다.
({SPARK_HOME} 설치 디렉토리에서 위처럼 수행하자. 테스트 샘플 데이터 파일이 Spark 설치 디렉토리에 존재하니.)
 

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

 
# README.md 파일을 읽어서 count()와 first()를 돌려보자.
 
var textFile = sc.textFile("README.md")
textFile.count()
textFile.first()
 
 

 
라인수와 첫 라인 정보를 확인할 수 있다.(아직까진 어려운게 없다)
 
# filter() 를 통해 변환을 해보자.
# Spark 단어를 포함한 라인만 추출하기.
 
var textFile = sc.textFile("README.md")
var linesWithSpark = textFile.filter(line => line.contains("Spark"))
linesWithSpark.count()
linesWithSpark.first()
 

 
Spark라는 단어를 포함한 라인은 19줄이며, 첫번째 라인은 "# Apache Spark" 임을 확인할 수 있다.
 
이외에도 spark-shell을 이용하여 여러 가지를 수행해 볼 수 있다.
좀 더 많은 샘플을 보고 싶으면 https://spark.apache.org/docs/latest/quick-start.html 에 참조하길 바란다.
 
  • 샘플을 보면 scala 언어를 사용하고 있는데, spark-shell은 scala 언어를 사용한다.
  • python도 사용이 가능한데, ./bin/pyspark를 이용하면 된다.
  • java는 interactive shell을 지원하지 않는다.
 

 
 
 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
공지 오라클 기본 샘플 데이터베이스 졸리운_곰 2014.01.02 86123
공지 [SQL컨셉] 서적 "SQL컨셉"의 샘플 데이타 베이스 SAMPLE DATABASE of ORACLE 가을의 곰을... 2013.02.10 78628
공지 [G_SQL] Sample Database 가을의 곰을... 2012.05.20 95342
58 Tutorial: Using Apache Zeppelin with MySQL file 졸리운_곰 2017.02.03 1789
57 VCNC가 Hadoop대신 Spark를 선택한 이유 file 졸리운_곰 2017.02.03 1298
56 2017년에 버려질 빅데이터 도구 7가지 file 졸리운_곰 2017.01.30 1356
55 Real-time stream processing: The next step for Apache Flink file 졸리운_곰 2016.08.10 1479
54 Stream Processing with Apache Flink file 졸리운_곰 2016.08.10 1502
53 실시간 빅 데이터(Real-time Big Data) 프로세싱 맛보기 졸리운_곰 2016.07.18 1490
52 실시간 빅데이터는 어떻게 분석할까 file 졸리운_곰 2016.07.18 1457
51 ZooKeeper란 무엇인가? file 졸리운_곰 2016.07.16 1570
50 대충보는 Storm #6-Apache Storm 그룹핑 개념 이해하기 file 졸리운_곰 2016.06.19 1316
49 대충보는 Storm #5-Apache Storm 병렬 분산 처리 이해하기 file 졸리운_곰 2016.06.19 1483
48 대충보는 Storm #4-Apache Storm 특징과 기본 개념 file 졸리운_곰 2016.06.19 1600
47 대충보는 Storm #3-Storm 싱글 클러스터 노드 설치 및 배포 file 졸리운_곰 2016.06.19 1329
46 대충보는 Storm #2-Storm 설치와 HelloStorm 작성하기 file 졸리운_곰 2016.06.19 1400
45 Storm을 이용한 실시간 데이타 처리 #1-데이타 스트림 개념 이해하기 file 졸리운_곰 2016.06.19 1106
» Spark를 설치해서 무작정 돌려보자. file 졸리운_곰 2016.06.12 1920
43 빅데이터 분석에 스파크를 이용해야 하는 5가지 이유 file 졸리운_곰 2016.06.12 1371
42 실시간 'BI'를 실행하라, 스톰과 스파크 설명과 그 선택 방법 file 졸리운_곰 2016.06.12 1371
41 [Cloudera 블로그 번역] Spark 활용하기 : 빅데이터 어플리케이션용 고속 인메모리 컴퓨팅 file 졸리운_곰 2016.06.12 1797
40 [kafka] Producer 구현하기 졸리운_곰 2016.06.05 1524
39 [kafka] Consumer Group Example 졸리운_곰 2016.06.05 1837
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED