PySpark와 pandas 데이터 프레임 간의 변환 최적화

Apache 화살표 는 JVM과 Python 프로세스 간에 데이터를 효율적으로 전송 하기 위해 Apache Spark에 사용 되는 메모리 내 칼럼 형식 데이터 형식입니다. 이는 pandas 및 NumPy 데이터를 사용 하는 Python 개발자에 게 유용 합니다. 그러나이는 자동으로 수행 되지 않으며, 모든 이점을 활용 하 고 호환성을 보장 하기 위해 구성 또는 코드를 약간 변경 해야 합니다.

PyArrow 버전

PyArrow는 Databricks Runtime에 설치 됩니다. 각 Databricks Runtime 버전에서 사용할 수 있는 PyArrow 버전에 대 한 자세한 내용은 Databricks Runtime 릴리스 정보를 참조 하세요.

지원 되는 SQL 형식

모든 Spark SQL 데이터 형식은 MapType , 및 중첩 된를 제외 하 고 화살표 기반 변환에서 지원 됩니다 ArrayType TimestampType StructType . StructType 는 대신로 표시 됩니다 pandas.DataFrame pandas.Series . BinaryType PyArrow가 0.10.0 보다 크거나 같은 경우에만 지원 됩니다.

PySpark 데이터 프레임를 pandas 데이터 프레임로 변환

PySpark 데이터 프레임를로 변환 하 고 PySpark 데이터 프레임에서 pandas 데이터 프레임을로 변환 하는 경우에는 최적화로 화살표를 사용할 수 있습니다 toPandas() createDataFrame(pandas_df) . 이러한 메서드에 대 한 화살표를 사용 하려면 Spark 구성을 spark.sql.execution.arrow.enabled 로 설정 합니다 true . 이 구성은 기본적으로 사용 되지 않습니다.

또한 spark.sql.execution.arrow.enabled Spark 내에서 계산 전에 오류가 발생 하는 경우에서 사용 하는 최적화가 비 화살표 구현으로 대체 될 수 있습니다. Spark 구성을 사용 하 여이 동작을 제어할 수 있습니다 spark.sql.execution.arrow.fallback.enabled .

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

예제

Python
import numpy as np
import pandas as pd

# Enable Arrow-based columnar data transfers
spark.conf.set("spark.sql.execution.arrow.enabled", "true")

# Generate a pandas DataFrame
pdf = pd.DataFrame(np.random.rand(100, 3))

# Create a Spark DataFrame from a pandas DataFrame using Arrow
df = spark.createDataFrame(pdf)

# Convert the Spark DataFrame back to a pandas DataFrame using Arrow
result_pdf = df.select("*").toPandas()

화살표 최적화를 사용 하면 화살표가 설정 되지 않은 경우와 동일한 결과가 생성 됩니다. 화살표가 있는 경우에도 toPandas() 데이터 프레임의 모든 레코드를 드라이버 프로그램으로 수집 하 고 작은 데이터 하위 집합에 대해 수행 해야 합니다.

또한 모든 Spark 데이터 형식이 지원 되는 것은 아니므로 열에 지원 되지 않는 형식이 있으면 오류가 발생할 수 있습니다. 중에 오류가 발생 하면 createDataFrame() Spark는 화살표 없이 데이터 프레임를 만들도록 대체 합니다.

 

[출처] https://docs.microsoft.com/ko-kr/azure/databricks/spark/latest/spark-sql/spark-pandas

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
공지 오라클 기본 샘플 데이터베이스 졸리운_곰 2014.01.02 86284
공지 [SQL컨셉] 서적 "SQL컨셉"의 샘플 데이타 베이스 SAMPLE DATABASE of ORACLE 가을의 곰을... 2013.02.10 78742
공지 [G_SQL] Sample Database 가을의 곰을... 2012.05.20 95484
78 [Kafka] Kafka 한번 살펴보자... Quickstart file 졸리운_곰 2021.06.18 1309
77 Java Kafka Producer, Consumer 예제 구현 Java를 이용하여 Kafka Producer와 Kakfa Consumer를 구현해보자. file 졸리운_곰 2021.06.18 1170
76 Beginner’s Guide to Understand Kafka file 졸리운_곰 2021.06.18 1571
75 [Kafka] Kafka 설치/실행 및 테스트 file 졸리운_곰 2021.06.18 1065
74 [java] [kafka] [Kafka] 개념 및 기본예제 file 졸리운_곰 2021.06.16 2170
73 Getting started with Apache Kafka in Python file 졸리운_곰 2020.09.10 2256
72 [Kafka] 다운로드 및 Quick Start file 졸리운_곰 2020.09.07 1893
71 [Kafka] 기본 개념잡기 file 졸리운_곰 2020.09.07 1704
70 Flume Integration with Kafka file 졸리운_곰 2019.04.16 2081
69 빅데이터: 플럼(Flume) 토폴로지 설계 file 졸리운_곰 2019.04.16 1600
68 실시간 처리를 위한 분산 메시징 시스템 카프카(Kafka) file 졸리운_곰 2018.05.12 1410
67 Flume과 Kafka를 사용한 초당 100만개 로그 수집 테스트 file 졸리운_곰 2018.05.12 1376
66 웹 크롤링 / web crwaling / web scraping / 웹 스크래핑 file 졸리운_곰 2017.07.09 1848
65 빅데이터 단지 몇퍼센트의 예측 정확성을 위하여 장애로 가득찬 빅데이터 시스템을 도입하여야 하는가에 대한 의문! file 졸리운_곰 2017.03.20 1605
64 빅데이터: 플럼(Flume) 토폴로지 설계 file 졸리운_곰 2017.03.20 1416
63 [실시간 분석 시스템] Apache Flume를 활용한 데이터 수집(1) file 졸리운_곰 2017.03.06 1316
62 [실시간 분석 시스템] 데이터 수집 #2 Apache Sqoop을 활용하여 RDBMS 데이터 수집(2) file 졸리운_곰 2017.03.06 1385
61 [실시간 분석 시스템] 데이터 수집 #2 Apache Sqoop을 활용하여 RDBMS 데이터 수집(1) file 졸리운_곰 2017.03.06 1104
60 [실시간 분석 시스템] 데이터 수집 #1 오픈 소스 수집기 비교 file 졸리운_곰 2017.03.06 1745
59 [실시간 분석 시스템] 일단 데이터 들여다 보기 file 졸리운_곰 2017.03.06 1935
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED