- 전체
- Sample DB
- database modeling
- [표준 SQL] Standard SQL
- G-SQL
- 10-Min
- ORACLE
- MS SQLserver
- MySQL
- SQLite
- postgreSQL
- 데이터아키텍처전문가 - 국가공인자격
- 데이터 분석 전문가 [ADP]
- [국가공인] SQL 개발자/전문가
- NoSQL
- hadoop
- hadoop eco system
- big data (빅데이터)
- stat(통계) R 언어
- XML DB & XQuery
- spark
- DataBase Tool
- 데이터분석 & 데이터사이언스
- Engineer Quality Management
- [기계학습] machine learning
- 데이터 수집 및 전처리
- 국가기술자격 빅데이터분석기사
- 암호화폐 (비트코인, cryptocurrency, bitcoin)
big data (빅데이터) Spark를 설치해서 무작정 돌려보자.
2016.06.12 20:19
Spark를 설치해서 무작정 돌려보자.
일단 Spark 다운로드... 현재 최신 버전은 1.2.1이다.(2015/02/26 기준)
https://spark.apache.org/downloads.html 에 접속해서 spark 다운로드를 받는다.
hadoop을 포함한 pre-built 버전으로 설치해 본다. (추후 소스코드 받아서 compile해보자.)

위 처럼 지정하고 Download 받아 압축을 해제하면 된다.
![]()
편의상 심볼릭 링크를 생성해 두었다.
설치 끝? Spark-Shell을 이용하여 Spark를 간단히 돌려보자.
./bin/spark-shell 을 수행하면 아래처럼 확인할 수 있다.
({SPARK_HOME} 설치 디렉토리에서 위처럼 수행하자. 테스트 샘플 데이터 파일이 Spark 설치 디렉토리에 존재하니.)

# README.md 파일을 읽어서 count()와 first()를 돌려보자.
| var textFile = sc.textFile("README.md") textFile.count() textFile.first() |

라인수와 첫 라인 정보를 확인할 수 있다.(아직까진 어려운게 없다)
# filter() 를 통해 변환을 해보자.
# Spark 단어를 포함한 라인만 추출하기.
|
var textFile = sc.textFile("README.md")
var linesWithSpark = textFile.filter(line => line.contains("Spark"))linesWithSpark.count() linesWithSpark.first() |

Spark라는 단어를 포함한 라인은 19줄이며, 첫번째 라인은 "# Apache Spark" 임을 확인할 수 있다.
이외에도 spark-shell을 이용하여 여러 가지를 수행해 볼 수 있다.
좀 더 많은 샘플을 보고 싶으면 https://spark.apache.org/docs/latest/quick-start.html 에 참조하길 바란다.
|
본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
댓글 0
| 번호 | 제목 | 글쓴이 | 날짜 | 조회 수 |
|---|---|---|---|---|
| 공지 | 오라클 기본 샘플 데이터베이스 | 졸리운_곰 | 2014.01.02 | 86186 |
| 공지 | [SQL컨셉] 서적 "SQL컨셉"의 샘플 데이타 베이스 SAMPLE DATABASE of ORACLE | 가을의 곰을... | 2013.02.10 | 78668 |
| 공지 | [G_SQL] Sample Database | 가을의 곰을... | 2012.05.20 | 95402 |
| 1 | 빅데이터분석기사 필기 1과목 요약 - 빅데이터 분석 기획 ① | 졸리운_곰 | 2021.01.07 | 2316 |

