하둡 맵리듀스(MapReduce) 알아보자

 

 

지식백과에 의하면 맵리듀스(MapReduce)는 구글에서 대용량 데이터 처리를 분산 병렬 컴퓨터에서 처리하기 위한 목적으로

 

제작하였다. (2004년 발표한 소프트웨어 프레임워크)

 

함수형 프로그래밍에서 일반적으로 사용되는 Map과 Reduce라는 함수 기반으로 구성이 된다.

 

Java와 C++그리고 기타언어에서 적용이 가능하도록 작성이되있고 대표적으로는 하둡에서 오픈소스 소프트웨어로 적용되었다.

 

 

 

하둡에서 가장 많이 사용되는 맵리듀스는 데이터마이닝과 웹 인덱싱과 같은 대규모 또는 데이터 집약적인 애플리케이션에 매우

 

중요한 병렬처리 모델이다. 하둡은 맵리듀스의 오픈소스 구현체이며 빠른 응답시간이 요구되는 클러스터 컴퓨팅 작업에 많이

 

활용 되고 있다. 대부분의 맵리듀스 프로그램은 데이터 분석을 위해 작성이 되며 작어 완료까지 오랜 시간이 걸린다.

 

많은 업체에서 요구된 시간안에 완료가 가능한 대규모 데이터 심화 분석 작업으로 활용이 되고 있다.

 

 

* 성공적인 활용을 위해 맵리듀스의 I/O 효율성은 아직 많은 개선이 필요하다. 경험에 의하면 미숙하게 구성된 하둡 글러스트는

 

맵리듀스 작업 성능을 크게 저하시킨다.

 

 

 

 

 

 

맵리듀스와 같은 데이터 집약적인 분산 처리 모델은 웹-인덱스, 데이터마이닝, 과학적 시뮬레이션과 같은 대규모 병렬처리

 

애플리케이션을 위한 중요한 프로그램 모델로 떠오르고 있다.

 

하둡은 구글의 맵리듀스 프로그램 모델을 구현한 매우 유명한 오픈소스 자바구현체이다.

 

이미 다양한 기업에서 대규모 데이터 처리에 사용하고 있으며 빠른 응답시간이 요구되는 환경에서도 사용된다.

 

 

맵리듀스의 개념

 

 

맵리듀스는 맵 단계와 리듀스의 단계로 처리 과정을 나누어 작업한다.

 

맵(Map)은 흩어져 있는 데이터를 관련있는 데이터끼리 묶는 작업을 통해 임시 데이터 집합으로 변형이 되며

 

리듀스(Reduce)는 앱 작업에서 생성된 임시 데이터 집합에서 중복 데이터를 제거하고 원하는 데이터를 추출하는 작업을 진행한다.

 

 

 

 

 

맵리듀스 처리 순서

 

 

 

 

맵리듀스가 분산,병렬 처리하기 좋은 이유는 입력데이터에 대한 맵 함수는 동시에 독립적으로 병렬 처리할수 있는 구조이기 때문이다.

 

 

1. 분할(Splitting)

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

 

~ 입력한 파일 값을 라인 단위로 분할한다.

 

 

 

2. 매핑(Mapping)

 

~ 분할된 라인 단위 문장을 맵(Map)함수로 전달하면 맵함수는 공백을 기준으로 문자를 분리, 단어의 개수를 확인한다.

 

맵함수를 거치면서 임시 데이터 결과가 메모리에 저장된다.

 

 

3. 셔플링(Shuffling)

 

~ 메모리에 저장되어 있는 맵 함수의 출력 데이터를 파티셔닝과 정렬하여 로컬 디스크에 저장, 네트워크를 통해 리듀서의

 

입력 데이터로 전달한다.

 

 

4. 리듀싱(Reducing)

 

~ 단어 목록들을 반복적으로 수행하고 합을 계산하여 표시한다.

 

 

 

 

 

맵리듀스의 장점과 단점

 

 

맵리듀스 장점

 

~ 단순하고 사용이 편리

 

~ 특정 데이터모델이나 스키마, 질의에 의존적이지 않은 유연성

 

~ 저장 구조의 독립성

 

~ 데이터복제에 가반한 내구성과 재수행을 통한 내고장성 확보

 

~ 높은 확장성

 

 

 

맵리듀스 단점

 

~ 고정된 단일 데이터 흐름

 

~ 기존 DBMS보다 불편한 스키마, 질의

 

~ 단순한 스케줄링

 

~ DBMS와 비교하여 상대적으로 낮은 성능

 

~ 개발도구의 불편함과 기술지원의 어려움

 

~ 확장성의 문제와 처리속도가 느리다는 점

 

 [출처] https://jayzzz.tistory.com/44

 

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
공지 오라클 기본 샘플 데이터베이스 졸리운_곰 2014.01.02 86058
공지 [SQL컨셉] 서적 "SQL컨셉"의 샘플 데이타 베이스 SAMPLE DATABASE of ORACLE 가을의 곰을... 2013.02.10 78583
공지 [G_SQL] Sample Database 가을의 곰을... 2012.05.20 95310
15 [hadoop] Cloudera Quick Start VM in Hyper-V file 졸리운_곰 2022.11.14 3816
14 [hadoop][java][MapReduce] 맵리듀스 원리와 그 과정 졸리운_곰 2021.02.28 1651
13 [hadoop][mapreduce][csv file] [Reference] : Hadoop MapReduce Join & Counter with Example file 졸리운_곰 2021.02.23 1534
12 [hadoop][mapreduce][csv file] Hadoop & Mapreduce Examples: Create First Program in Java file 졸리운_곰 2021.02.23 1855
» 하둡 맵리듀스(MapReduce) 알아보자 file 졸리운_곰 2019.04.22 2558
10 [하둡] 맵리듀스(MapReduce) 이해하기 file 졸리운_곰 2019.04.22 1981
9 맵/리듀스 (Map/Reduce) 이해하기 file 졸리운_곰 2019.04.22 2648
8 아파치 하둡 HDFS 사용법(Cloudera 사용) file 졸리운_곰 2017.04.19 1595
7 클라우데라 배포판을 이용한 하둡 및 빅데이터 오픈소스 설치하기 file 졸리운_곰 2017.02.14 2023
6 빅데이터 플랫폼 아키텍처의 두 가지 file 졸리운_곰 2016.05.29 1684
5 Hadoop 적용 사례 기사 정리 졸리운_곰 2016.05.29 1996
4 빅데이터 잡설 , 하둡은 어디로 갈꺼나 … file 졸리운_곰 2016.05.29 1738
3 하둡, 데이터 분석에 활용하기까지 file 졸리운_곰 2016.05.29 2135
2 A Guide to Python Frameworks for Hadoop file 졸리운_곰 2016.04.30 3074
1 Writing an Hadoop MapReduce Program in Python file 졸리운_곰 2016.04.30 2189
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED