PySpark와 pandas 데이터 프레임 간의 변환 최적화

Apache 화살표 는 JVM과 Python 프로세스 간에 데이터를 효율적으로 전송 하기 위해 Apache Spark에 사용 되는 메모리 내 칼럼 형식 데이터 형식입니다. 이는 pandas 및 NumPy 데이터를 사용 하는 Python 개발자에 게 유용 합니다. 그러나이는 자동으로 수행 되지 않으며, 모든 이점을 활용 하 고 호환성을 보장 하기 위해 구성 또는 코드를 약간 변경 해야 합니다.

PyArrow 버전

PyArrow는 Databricks Runtime에 설치 됩니다. 각 Databricks Runtime 버전에서 사용할 수 있는 PyArrow 버전에 대 한 자세한 내용은 Databricks Runtime 릴리스 정보를 참조 하세요.

지원 되는 SQL 형식

모든 Spark SQL 데이터 형식은 MapType , 및 중첩 된를 제외 하 고 화살표 기반 변환에서 지원 됩니다 ArrayType TimestampType StructType . StructType 는 대신로 표시 됩니다 pandas.DataFrame pandas.Series . BinaryType PyArrow가 0.10.0 보다 크거나 같은 경우에만 지원 됩니다.

PySpark 데이터 프레임를 pandas 데이터 프레임로 변환

PySpark 데이터 프레임를로 변환 하 고 PySpark 데이터 프레임에서 pandas 데이터 프레임을로 변환 하는 경우에는 최적화로 화살표를 사용할 수 있습니다 toPandas() createDataFrame(pandas_df) . 이러한 메서드에 대 한 화살표를 사용 하려면 Spark 구성을 spark.sql.execution.arrow.enabled 로 설정 합니다 true . 이 구성은 기본적으로 사용 되지 않습니다.

또한 spark.sql.execution.arrow.enabled Spark 내에서 계산 전에 오류가 발생 하는 경우에서 사용 하는 최적화가 비 화살표 구현으로 대체 될 수 있습니다. Spark 구성을 사용 하 여이 동작을 제어할 수 있습니다 spark.sql.execution.arrow.fallback.enabled .

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

예제

Python
import numpy as np
import pandas as pd

# Enable Arrow-based columnar data transfers
spark.conf.set("spark.sql.execution.arrow.enabled", "true")

# Generate a pandas DataFrame
pdf = pd.DataFrame(np.random.rand(100, 3))

# Create a Spark DataFrame from a pandas DataFrame using Arrow
df = spark.createDataFrame(pdf)

# Convert the Spark DataFrame back to a pandas DataFrame using Arrow
result_pdf = df.select("*").toPandas()

화살표 최적화를 사용 하면 화살표가 설정 되지 않은 경우와 동일한 결과가 생성 됩니다. 화살표가 있는 경우에도 toPandas() 데이터 프레임의 모든 레코드를 드라이버 프로그램으로 수집 하 고 작은 데이터 하위 집합에 대해 수행 해야 합니다.

또한 모든 Spark 데이터 형식이 지원 되는 것은 아니므로 열에 지원 되지 않는 형식이 있으면 오류가 발생할 수 있습니다. 중에 오류가 발생 하면 createDataFrame() Spark는 화살표 없이 데이터 프레임를 만들도록 대체 합니다.

 

[출처] https://docs.microsoft.com/ko-kr/azure/databricks/spark/latest/spark-sql/spark-pandas

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
공지 오라클 기본 샘플 데이터베이스 졸리운_곰 2014.01.02 86153
공지 [SQL컨셉] 서적 "SQL컨셉"의 샘플 데이타 베이스 SAMPLE DATABASE of ORACLE 가을의 곰을... 2013.02.10 78648
공지 [G_SQL] Sample Database 가을의 곰을... 2012.05.20 95383
904 [spark] Spark 튜닝하기 file 졸리운_곰 2021.03.06 1291
» [spark] PySpark와 pandas 데이터 프레임 간의 변환 최적화 file 졸리운_곰 2021.03.04 1674
902 [데이터사이언스] 데이터 과학자를위한 3 가지 훌륭한 디자인 패턴, 3 Great Design Patterns for Data Scientists file 졸리운_곰 2021.03.04 779
901 [hadoop] Python으로 Hive 연결하기 졸리운_곰 2021.03.04 1502
900 Data Engineering - Apache Spark Dataframe 10분만에 훑어보기 졸리운_곰 2021.03.04 1868
899 [데이터분석] 시계열 데이터에 AI를 사용하는 이유는 무엇입니까? file 졸리운_곰 2021.02.28 1191
898 [데이터분석] AI 예측 및 이상 탐지를위한 시계열 데이터 전처리 file 졸리운_곰 2021.02.28 1031
897 [hadoop][java][MapReduce] 맵리듀스 원리와 그 과정 졸리운_곰 2021.02.28 1653
896 [데이터분석] bitcoin analysis 비트 코인 시계열 데이터에 대한 AI 이상 탐지 file 졸리운_곰 2021.02.27 1588
895 [spark] pyspark 설치하기 (windows 10) file 졸리운_곰 2021.02.26 1661
894 [hadoop][mapreduce][csv file] [Reference] : Hadoop MapReduce Join & Counter with Example file 졸리운_곰 2021.02.23 1534
893 [hadoop][mapreduce][csv file] Hadoop & Mapreduce Examples: Create First Program in Java file 졸리운_곰 2021.02.23 1855
892 [mongodb , 몽고디비] How to Use MongoDB Comparison Query Operators in Java 졸리운_곰 2021.02.19 1508
891 Apache Spark란? 졸리운_곰 2021.02.19 1508
890 [apache spark] [Spark Programming]1. Apache Spark 개요 및 설치 file 졸리운_곰 2021.02.19 19627
889 [Oracle, 오라클 데이터베이스] java.sql.SQLException: ORA-00911: 문자가 부적합합니다. file 졸리운_곰 2021.02.19 1063
888 [mongodb, 몽고디비] How do you query for “is not null” in Mongo? 졸리운_곰 2021.02.19 1268
887 스파크 Spark - 윈도우10에서 빅데이터 실습 세팅 및 시작하기 file 졸리운_곰 2021.02.17 1313
886 스파크(Spark) 3.0.0 설치 on Windows 10 file 졸리운_곰 2021.02.17 1598
885 [oracle, 오라클] 오라클 MERGE INTO 문으로 있으면 UPDATE 없으면 INSERT 한번에 수행하기 졸리운_곰 2021.02.16 1044
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED