- 전체
- Sample DB
- database modeling
- [표준 SQL] Standard SQL
- G-SQL
- 10-Min
- ORACLE
- MS SQLserver
- MySQL
- SQLite
- postgreSQL
- 데이터아키텍처전문가 - 국가공인자격
- 데이터 분석 전문가 [ADP]
- [국가공인] SQL 개발자/전문가
- NoSQL
- hadoop
- hadoop eco system
- big data (빅데이터)
- stat(통계) R 언어
- XML DB & XQuery
- spark
- DataBase Tool
- 데이터분석 & 데이터사이언스
- Engineer Quality Management
- [기계학습] machine learning
- 데이터 수집 및 전처리
- 국가기술자격 빅데이터분석기사
- 암호화폐 (비트코인, cryptocurrency, bitcoin)
spark [spark] PySpark와 pandas 데이터 프레임 간의 변환 최적화
2021.03.04 22:52
PySpark와 pandas 데이터 프레임 간의 변환 최적화
Apache 화살표 는 JVM과 Python 프로세스 간에 데이터를 효율적으로 전송 하기 위해 Apache Spark에 사용 되는 메모리 내 칼럼 형식 데이터 형식입니다. 이는 pandas 및 NumPy 데이터를 사용 하는 Python 개발자에 게 유용 합니다. 그러나이는 자동으로 수행 되지 않으며, 모든 이점을 활용 하 고 호환성을 보장 하기 위해 구성 또는 코드를 약간 변경 해야 합니다.
PyArrow 버전
PyArrow는 Databricks Runtime에 설치 됩니다. 각 Databricks Runtime 버전에서 사용할 수 있는 PyArrow 버전에 대 한 자세한 내용은 Databricks Runtime 릴리스 정보를 참조 하세요.
지원 되는 SQL 형식
모든 Spark SQL 데이터 형식은 MapType , 및 중첩 된를 제외 하 고 화살표 기반 변환에서 지원 됩니다 ArrayType TimestampType StructType . StructType 는 대신로 표시 됩니다 pandas.DataFrame pandas.Series . BinaryType PyArrow가 0.10.0 보다 크거나 같은 경우에만 지원 됩니다.
PySpark 데이터 프레임를 pandas 데이터 프레임로 변환
PySpark 데이터 프레임를로 변환 하 고 PySpark 데이터 프레임에서 pandas 데이터 프레임을로 변환 하는 경우에는 최적화로 화살표를 사용할 수 있습니다 toPandas() createDataFrame(pandas_df) . 이러한 메서드에 대 한 화살표를 사용 하려면 Spark 구성을 spark.sql.execution.arrow.enabled 로 설정 합니다 true . 이 구성은 기본적으로 사용 되지 않습니다.
또한 spark.sql.execution.arrow.enabled Spark 내에서 계산 전에 오류가 발생 하는 경우에서 사용 하는 최적화가 비 화살표 구현으로 대체 될 수 있습니다. Spark 구성을 사용 하 여이 동작을 제어할 수 있습니다 spark.sql.execution.arrow.fallback.enabled .
예제
import numpy as np
import pandas as pd
# Enable Arrow-based columnar data transfers
spark.conf.set("spark.sql.execution.arrow.enabled", "true")
# Generate a pandas DataFrame
pdf = pd.DataFrame(np.random.rand(100, 3))
# Create a Spark DataFrame from a pandas DataFrame using Arrow
df = spark.createDataFrame(pdf)
# Convert the Spark DataFrame back to a pandas DataFrame using Arrow
result_pdf = df.select("*").toPandas()
화살표 최적화를 사용 하면 화살표가 설정 되지 않은 경우와 동일한 결과가 생성 됩니다. 화살표가 있는 경우에도 toPandas() 데이터 프레임의 모든 레코드를 드라이버 프로그램으로 수집 하 고 작은 데이터 하위 집합에 대해 수행 해야 합니다.
또한 모든 Spark 데이터 형식이 지원 되는 것은 아니므로 열에 지원 되지 않는 형식이 있으면 오류가 발생할 수 있습니다. 중에 오류가 발생 하면 createDataFrame() Spark는 화살표 없이 데이터 프레임를 만들도록 대체 합니다.
[출처] https://docs.microsoft.com/ko-kr/azure/databricks/spark/latest/spark-sql/spark-pandas
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
댓글 0
| 번호 | 제목 | 글쓴이 | 날짜 | 조회 수 |
|---|---|---|---|---|
| 공지 | 오라클 기본 샘플 데이터베이스 | 졸리운_곰 | 2014.01.02 | 86317 |
| 공지 | [SQL컨셉] 서적 "SQL컨셉"의 샘플 데이타 베이스 SAMPLE DATABASE of ORACLE | 가을의 곰을... | 2013.02.10 | 78773 |
| 공지 | [G_SQL] Sample Database | 가을의 곰을... | 2012.05.20 | 95528 |



