[MySQL] 피벗 - 로우 데이터를 컬럼으로 옮기기

날마다 로그에서 데이터를 가져와서 DB에 넣어야 하는 배치성 쿼리를 짜고 있었다.

group by를 하는 쿼리가 있다보니 데이터가 row 단위로 나오는데, 문제는 일자별 조회를 하려면 row별로 있는 데이터가 컬럼으로 가야 하는 문제가 발생했다.

 

문제를 쉽게 하기 위해 예를 들면,

+------------+-----------+---------+

| baseDt     | page      | value   |

+------------+-----------+---------+

| 2017-04-13 |    A      |  10     |

+------------+-----------+---------+

| 2017-04-13 |    B      |  20     |

+------------+-----------+---------+

| 2017-04-13 |    C      |  30     |

+------------+-----------+---------+

같은 형태를

+------------+-----------+------------+-----------+

| baseDt     |    A          B      |     C     |

+------------+-----------+------------+-----------+

| 2017-04-13 |    10     |     20          30     |

+------------+-----------+------------+-----------+

로 바꾸는 것이 목표였다.

 

검색을 해보니 이런 유형을 '피벗'이라고 부르며 특정 벤더의 DB(예, MS-SQL)에서는 PIVOT이라는 키워드가 존재했다.

 

마야님의 도움을 받아 정리를 한다.

 

가상의 테이블을 만들기 위해 다음과 같은 쿼리를 이용한다.

SELECT '2017-01-01' AS `date`, 'A' AS page, 10 AS `value`

UNION ALL

SELECT '2017-01-01' AS `date`, 'B' AS page, 20 AS `value`

UNION ALL

SELECT '2017-01-01' AS `date`, 'C' AS page, 30 AS `value`

 

쿼리를 실행해보면 위에서 예로 든 테이블이 조회된다.

 

보통 대각선으로 만든다음 합치는 과정을 하는데 UNION ALL이나 GROUP BY를 이용해서 할 수 있다.

 

대각선으로 만드는 쿼리는 아래와 같다.

SELECT     `date`

, CASE WHEN page = 'A' THEN `value` ELSE 0 END AS A

, CASE WHEN page = 'B' THEN `value` ELSE 0 END AS B

, CASE WHEN page = 'C' THEN `value` ELSE 0 END AS C

FROM     (

SELECT '2017-01-01' AS `date`, 'A' AS page, 10 AS `value`

UNION ALL

SELECT '2017-01-01' AS `date`, 'B' AS page, 20 AS `value`

UNION ALL

SELECT '2017-01-01' AS `date`, 'C' AS page, 30 AS `value`

) z

 

실행을 해보면 아래와 같이 조회가 된다.

 

추가적으로 CASE WHEN THEN ELSE END를 IF() 함수로 대체가 가능하다.

SELECT     `date`

IF(page = 'A', `value`, 0) AS A

IF(page = 'B', `value`, 0) AS B

IF(page = 'C', `value`, 0) AS C

FROM     (

SELECT '2017-01-01' AS `date`, 'A' AS page, 10 AS `value`

UNION ALL

SELECT '2017-01-01' AS `date`, 'B' AS page, 20 AS `value`

UNION ALL

SELECT '2017-01-01' AS `date`, 'C' AS page, 30 AS `value`

) z

결과는 동일하다.

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

 

이제 group by를 하면 되는데 그냥 적용하면 이상하게 나온다.

SELECT     `date`

, IF(page = 'A', `value`, 0) AS A

, IF(page = 'B', `value`, 0) AS B

, IF(page = 'C', `value`, 0) AS C

FROM     (

SELECT '2017-01-01' AS `date`, 'A' AS page, 10 AS `value`

UNION ALL

SELECT '2017-01-01' AS `date`, 'B' AS page, 20 AS `value`

UNION ALL

SELECT '2017-01-01' AS `date`, 'C' AS page, 30 AS `value`

) z

GROUP BY `date`

결과

 

제일 위의 열만 나온 것이다. group by는 집계함수(aggregate function)1랑 같이 써야 하는데, A, B, C열은 집계함수가 적용되지 않았다.

 

여기서는 가장 만만한 MAX 집계함수를 써서 제일 큰 값으로 이용한다. 혹시 값 중에 음수가0이 필요하다고 하면 무조건 0이 반환될테니 IF의 3번째 인자를 그 값보다 작게 만들면 된다.

SELECT     `date`

MAX(IF(page = 'A', `value`, 0)) AS A

MAX(IF(page = 'B', `value`, 0)) AS B

MAX(IF(page = 'C', `value`, 0)) AS C

FROM     (

SELECT '2017-01-01' AS `date`, 'A' AS page, 10 AS `value`

UNION ALL

SELECT '2017-01-01' AS `date`, 'B' AS page, 20 AS `value`

UNION ALL

SELECT '2017-01-01' AS `date`, 'C' AS page, 30 AS `value`

) z

GROUP BY `date`

 

결과: 

 

나중에 확인해보니 GROUP BY 는 필요없었다. (전제 조건은 데이터가 date가 하나만 있을 때이다. 나의 경우는 batch 성으로 하루치 데이터만 이미 filtering되고 있기 때문에 하나의 날짜라는 것이 보장되었기 때문이다.)

SELECT     `date`

, MAX(IF(page = 'A', `value`, 0)) AS A

, MAX(IF(page = 'B', `value`, 0)) AS B

, MAX(IF(page = 'C', `value`, 0)) AS C

FROM     (

SELECT '2017-01-01' AS `date`, 'A' AS page, 10 AS `value`

UNION ALL

SELECT '2017-01-01' AS `date`, 'B' AS page, 20 AS `value`

UNION ALL

SELECT '2017-01-01' AS `date`, 'C' AS page, 30 AS `value`

) z;

 

추가 팁.

배치로 데이터를 계속 넣는다고 했다.

이럴 때 유용한 쿼리가 INSERT INTO 테이블 SELECT ... 이다.

INSERT INTO target (date, A, B, C) SELECT     `date`

, MAX(IF(page = 'A', `value`, 0)) AS A

MAX(IF(page = 'B', `value`, 0)) AS B

MAX(IF(page = 'C', `value`, 0)) AS C

FROM     (

SELECT '2017-01-01' AS `date`, 'A' AS page, 10 AS `value`

UNION ALL

SELECT '2017-01-01' AS `date`, 'B' AS page, 20 AS `value`

UNION ALL

SELECT '2017-01-01' AS `date`, 'C' AS page, 30 AS `value`

) z

GROUP BY `date`

 

  1. 집계 함수(aggregate function)는 하나의 칼럼의 여러 값을 읽어 하나의 값을 반환한다.



출처: https://namocom.tistory.com/491#footnote_link_491_1 [나모의 노트]

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
공지 오라클 기본 샘플 데이터베이스 졸리운_곰 2014.01.02 86544
공지 [SQL컨셉] 서적 "SQL컨셉"의 샘플 데이타 베이스 SAMPLE DATABASE of ORACLE 가을의 곰을... 2013.02.10 78957
공지 [G_SQL] Sample Database 가을의 곰을... 2012.05.20 95707
15 [hadoop] Cloudera Quick Start VM in Hyper-V file 졸리운_곰 2022.11.14 3818
14 [hadoop][java][MapReduce] 맵리듀스 원리와 그 과정 졸리운_곰 2021.02.28 1660
13 [hadoop][mapreduce][csv file] [Reference] : Hadoop MapReduce Join & Counter with Example file 졸리운_곰 2021.02.23 1536
12 [hadoop][mapreduce][csv file] Hadoop & Mapreduce Examples: Create First Program in Java file 졸리운_곰 2021.02.23 1856
11 하둡 맵리듀스(MapReduce) 알아보자 file 졸리운_곰 2019.04.22 2559
10 [하둡] 맵리듀스(MapReduce) 이해하기 file 졸리운_곰 2019.04.22 1982
9 맵/리듀스 (Map/Reduce) 이해하기 file 졸리운_곰 2019.04.22 2651
8 아파치 하둡 HDFS 사용법(Cloudera 사용) file 졸리운_곰 2017.04.19 1599
7 클라우데라 배포판을 이용한 하둡 및 빅데이터 오픈소스 설치하기 file 졸리운_곰 2017.02.14 2029
6 빅데이터 플랫폼 아키텍처의 두 가지 file 졸리운_곰 2016.05.29 1686
5 Hadoop 적용 사례 기사 정리 졸리운_곰 2016.05.29 2004
4 빅데이터 잡설 , 하둡은 어디로 갈꺼나 … file 졸리운_곰 2016.05.29 1741
3 하둡, 데이터 분석에 활용하기까지 file 졸리운_곰 2016.05.29 2141
2 A Guide to Python Frameworks for Hadoop file 졸리운_곰 2016.04.30 3074
1 Writing an Hadoop MapReduce Program in Python file 졸리운_곰 2016.04.30 2191
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED