[hadoop] Python으로 Hive 연결하기

Python으로 Hive 연결하기

 

·       Version : Python 2.7.5, pip, Hive, CDH 6.3.0, Centos7

 

Hive는 하둡 에코시스템 중에서 데이터를 모델링하고 프로세싱할때 가장 많이 사용되는 데이터 웨어하징 솔루션이다. RDB의 데이터베이스, 테이블과 같은 형태로 HDFS에 저장된 데이터의 구조를 정의하는 방법을 제공하여 SQL과 유사한 HiveQL쿼리를 사용하여 데이터를 조작할수 있다.

·       Hive Architecture : https://en.wikipedia.org/wiki/Apache_Hive

 

필자의 경우, 배치잡 성격의 데이터 처리나 하이브 쿼리 조회등의 자동화 작업을 대부분 파이썬 스크립트로 개발하고, 해당 파이썬을 Cron 으로 실행하는 방식으로 운영하고 있다. (물론 에코시스템중에 좋은 ETL 툴이 많지만, 관리 및 유지보수 차원에서 파이썬을 선택하였다.) 오픈소스 프로젝트로 작업을 진행하면서 자주 느끼는 부분인데, 오픈소스는 궁합이 매우 중요하다. 특히 파이썬의 경우 버전에 따라 지원되는 기능 및 패키지 모듈이 다르기 때문에 버전 문제로 인한 스트레스가 좀 있는 편이다. 이번 포스팅은 pyhive 패키지를 이용해서 파이썬에서 Hive로 커넥트할 수 있는 방법에 대해서 알아본다.

 

필자의 하둡 환경은 Cloudera Hadoop 6.3.0, Centos7, Python 2.7.5 환경이다. 첨부된 requirement.txt 를 사용하여, 필요한 pip 패키지를 설치한다. 해당 파일에는 hive 커텍트에 필요한 패키지 외에, 필자가 필요한 pip 패키지가 일부 포함되어 있다.

pip install -r /path/to/requirements.txt

 

아래 내용은 설치되어 있는 pip 패키지 리스트이다.

backports.ssl-match-hostname==3.5.0.1

certifi==2019.9.11

chardet==3.0.4

configobj==4.7.2

decorator==3.4.0

docopt==0.6.2

future==0.18.2

futures==3.1.1

hdfs==2.5.8

hdfs3==0.3.1

idna==2.8

iniparse==0.4

ipaddress==1.0.16

IPy==0.75

javapackages==1.0.0

kitchen==1.1.1

langtable==0.0.31

LinkChecker==9.3

lxml==3.2.1

MySQL-python==1.2.5

numpy==1.16.5

pandas==0.24.2

perf==0.1

pexpect==4.7.0

policycoreutils-default-encoding==0.1

psycopg2==2.5.1

ptyprocess==0.6.0

pycurl==7.19.0

pygobject==3.22.0

pygpgme==0.3

PyHive==0.6.1

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

pyliblzma==0.5.3

pysasl==0.4.1

python-augeas==0.5.0

python-dateutil==2.8.1

python-linux-procfs==0.4.9

pytz==2019.3

pyudev==0.15

pyxattr==0.5.1

PyYAML==3.10

requests==2.22.0

sasl==0.2.1

schedutils==0.4

seobject==0.1

sepolicy==1.1

six==1.9.0

slip==0.4.0

slip.dbus==0.4.0

SSSDConfig==1.16.4

thrift==0.13.0

thrift-sasl==0.3.0

urlgrabber==3.10

urllib3==1.25.7

virtualenv==15.1.0

yum-langpacks==0.4.2

yum-metadata-parser==1.1.4

 

패키지 설치가 완료되었으면, 파이썬에서 필요한 패키지를 import 하여 Hive에 커넥트 한다. 아래 스크립트는 파이썬에서 hive에 연결하거 tbl이라는 테이블의 내용을 조회하는 예제이다.

from pyhive import hive

 

conn = hive.Connection(host='hd-master', port=10000, username='ID', password='PASSWORD', database='default', auth='CUSTOM')

cur = conn.cursor()

cur.execute('select 1 from tbl')

result = cur.fetchall()

 

 

 

2019-12-03 / Sungwook Kang / http://sungwookkang.com

 

Hadoop, hive, 파이썬으로 hive 연결하기, python connect to hive, hive connection, pyhive

 

[출처] https://sungwookkang.com/m/1367?category=618951

 

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
공지 오라클 기본 샘플 데이터베이스 졸리운_곰 2014.01.02 86134
공지 [SQL컨셉] 서적 "SQL컨셉"의 샘플 데이타 베이스 SAMPLE DATABASE of ORACLE 가을의 곰을... 2013.02.10 78636
공지 [G_SQL] Sample Database 가을의 곰을... 2012.05.20 95362
904 [spark] Spark 튜닝하기 file 졸리운_곰 2021.03.06 1291
903 [spark] PySpark와 pandas 데이터 프레임 간의 변환 최적화 file 졸리운_곰 2021.03.04 1673
902 [데이터사이언스] 데이터 과학자를위한 3 가지 훌륭한 디자인 패턴, 3 Great Design Patterns for Data Scientists file 졸리운_곰 2021.03.04 779
» [hadoop] Python으로 Hive 연결하기 졸리운_곰 2021.03.04 1502
900 Data Engineering - Apache Spark Dataframe 10분만에 훑어보기 졸리운_곰 2021.03.04 1867
899 [데이터분석] 시계열 데이터에 AI를 사용하는 이유는 무엇입니까? file 졸리운_곰 2021.02.28 1191
898 [데이터분석] AI 예측 및 이상 탐지를위한 시계열 데이터 전처리 file 졸리운_곰 2021.02.28 1031
897 [hadoop][java][MapReduce] 맵리듀스 원리와 그 과정 졸리운_곰 2021.02.28 1652
896 [데이터분석] bitcoin analysis 비트 코인 시계열 데이터에 대한 AI 이상 탐지 file 졸리운_곰 2021.02.27 1588
895 [spark] pyspark 설치하기 (windows 10) file 졸리운_곰 2021.02.26 1661
894 [hadoop][mapreduce][csv file] [Reference] : Hadoop MapReduce Join & Counter with Example file 졸리운_곰 2021.02.23 1534
893 [hadoop][mapreduce][csv file] Hadoop & Mapreduce Examples: Create First Program in Java file 졸리운_곰 2021.02.23 1855
892 [mongodb , 몽고디비] How to Use MongoDB Comparison Query Operators in Java 졸리운_곰 2021.02.19 1508
891 Apache Spark란? 졸리운_곰 2021.02.19 1508
890 [apache spark] [Spark Programming]1. Apache Spark 개요 및 설치 file 졸리운_곰 2021.02.19 19627
889 [Oracle, 오라클 데이터베이스] java.sql.SQLException: ORA-00911: 문자가 부적합합니다. file 졸리운_곰 2021.02.19 1063
888 [mongodb, 몽고디비] How do you query for “is not null” in Mongo? 졸리운_곰 2021.02.19 1268
887 스파크 Spark - 윈도우10에서 빅데이터 실습 세팅 및 시작하기 file 졸리운_곰 2021.02.17 1313
886 스파크(Spark) 3.0.0 설치 on Windows 10 file 졸리운_곰 2021.02.17 1597
885 [oracle, 오라클] 오라클 MERGE INTO 문으로 있으면 UPDATE 없으면 INSERT 한번에 수행하기 졸리운_곰 2021.02.16 1044
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED