[python][자료구조] [인코딩] 유니코드 인코딩 처리 (특히 json 입출력 시)

 

파이썬에서 데이터를 json으로 저장하면 유니코드 16진수로 저장된다.

딕셔너리를 json.dump() 메소드로 저장하면

import json 

before = {"테스트1": "test1", "테스트2": "test2", "테스트3": ["테스트3-1", "테스트3-2", "테스트3-3"], "테스트4": {"테스트4-1": "테스트4-1-1"}}

with open('sample.json', 'a+') as fp:
    json.dump(before, fp)

아래처럼 유니코드 16진수로 표현된다.

# sample.json
{"\ud14c\uc2a4\ud2b81": "test1", "\ud14c\uc2a4\ud2b82": "test2", "\ud14c\uc2a4\ud2b83": ["\ud14c\uc2a4\ud2b83-1", "\ud14c\uc2a4\ud2b83-2", "\ud14c\uc2a4\ud2b83-3"], "\ud14c\uc2a4\ud2b84": {"\ud14c\uc2a4\ud2b84-1": "\ud14c\uc2a4\ud2b84-1-1"}}

이대로 json.load() 메소드로 읽어오면 문제없이 저장한대로 출력된다.

with open('sample.json', 'r') as fp:
    after = json.load(fp)

print(after)
# {'테스트1': 'test1', '테스트2': 'test2', '테스트3': ['테스트3-1', '테스트3-2', '테스트3-3'], '테스트4': {'테스트4-
1': '테스트4-1-1'}}

데이터를 한글로 저장하고 싶다면, 저장시에 ensure_ascii=False 옵션을 넣어주면 된다.

[참조] 파이썬 JSON 저장시 유니코드 문자열 표시하기

import json 

before = {"테스트1": "test1", "테스트2": "test2", "테스트3": ["테스트3-1", "테스트3-2", "테스트3-3"], "테스트4": {"테스트4-1": "테스트4-1-1"}}

with open('sample2.json', 'a+', encoding="UTF-8") as fp:
    json.dump(before, fp, ensure_ascii=False)

저장시에 한글로 저장된 것을 확인할 수 있다.

# sample2.json
{"테스트1": "test1", "테스트2": "test2", "테스트3": ["테스트3-1", "테스트3-2", "테스트3-3"], "테스트4": {"테스트4-1": "테스트4-1-1"}}

 

 

만약 json 데이터를 dictonary가 아니라 str 타입으로 가져와야 하는데, 인코딩을 바꿔야 한다면

일단 json.load()로 받고 json.dumps()로 변환하는 게 이상적이다.

물론 ensure_ascii=False 옵션을 넣어줘야 한다. 생략할 경우 유니코드 문자열로 저장된다.

with open('sample.json', 'r', encoding="UTF-8") as fp:
    after = json.load(fp)

print(type(json.dumps(after, ensure_ascii=False))) # <class 'str'>
print(json.dumps(after, ensure_ascii=False)) # ensure_ascii 옵션을 잊지 말자
'''{"테스트1": "test1", "테스트2": "test2", "테스트3": ["테스트3-1", "테스트3-2", "테스트3-3"], "테스트4": {"테스트4-
1": "테스트4-1-1"}}'''

print(type(json.dumps(after))) # <class 'str'>
print(json.dumps(after))
'''{"\ud14c\uc2a4\ud2b81": "test1", "\ud14c\uc2a4\ud2b82": "test2", "\ud14c\uc2a4\ud2b83": ["\ud14c\uc2a4\ud2b83-1",
"\ud14c\uc2a4\ud2b83-2", "\ud14c\uc2a4\ud2b83-3"], "\ud14c\uc2a4\ud2b84": {"\ud14c\uc2a4\ud2b84-1": "\ud14c\uc2a4\
ud2b84-1-1"}}'''

 

그런데 어떤 이유로 인해 json.load()로 읽을 수가 없고 다른 기호들과 유니코드가 섞여버린 경우,

유니코드 16진수로 저장된 데이터를 그냥 인코딩 옵션만 주고 read()로 읽는 건 소용이 없기 때문에

경축! 아무것도 안하여 에스천사게임즈가 새로운 모습으로 재오픈 하였습니다.
어린이용이며, 설치가 필요없는 브라우저 게임입니다.
https://s1004games.com

with open('sample.json', 'r', encoding="ascii") as fp:
    noJson = fp.read()

print(noJson)
'''
{"\ud14c\uc2a4\ud2b81": "test1", "\ud14c\uc2a4\ud2b82": "test2", "\ud14c\uc2a4\ud2b83": ["\ud14c\uc2a4\ud2b83-1",
"\ud14c\uc2a4\ud2b83-2", "\ud14c\uc2a4\ud2b83-3"], "\ud14c\uc2a4\ud2b84": {"\ud14c\uc2a4\ud2b84-1": "\ud14c\uc2a4\
ud2b84-1-1"}}
'''

 

decode('unicode-escape') 메소드를 이용해야한다.

[참조] Convert a Unicode string to a string in Python (containing extra symbols)

with open('sample.json', 'r', encoding="UTF-8") as fp:
    noJson = fp.read()

print(noJson.encode().decode('unicode-escape'))

'''
{"테스트1": "test1", "테스트2": "test2", "테스트3": ["테스트3-1", "테스트3-2", "테스트3-3"], "테스트4": {"테스트4-
1": "테스트4-1-1"}}
'''

이 경우 encoding 설정은 유니코드 텍스트에 섞여있는 다른 기호들 기준으로 따라가면 된다.

나머지 기호에 인코딩 이슈가 없는 경우, 유니코드 문자열은 텍스트파일 출력시의 인코딩에 영향을 받지 않는다.

(latin1 이런 걸로 해도 잘 읽힌다. 어차피 유니코드기 때문에 상관없는듯하다.)

 

위의 'unicode-escape'는 str을 bytes로 인코딩할 때나, bytes-like object를 str으로 디코딩할 때 쓰인다. [공식문서는 이쪽]

데이터를 데이터.encode('unicode-escape').decode() 처리하면

json.dump(ensure_ascii=True)로 저장한 파일과 같은 결과를 얻을 수 있다.

beforeSTR = '{"테스트1": "test1", "테스트2": "test2", "테스트3": ["테스트3-1", "테스트3-2", "테스트3-3"], "테스트4": {"테스트4-1": "테스트4-1-1"}}'
print(beforeSTR.encode('unicode-escape'))
'''
b'{"\ud14c\uc2a4\ud2b81": "test1", "\ud14c\uc2a4\ud2b82": "test2", "\ud14c\uc2a4\ud2b83": ["\ud14c\uc2a
4\ud2b83-1", "\ud14c\uc2a4\ud2b83-2", "\ud14c\uc2a4\ud2b83-3"], "\ud14c\uc2a4\ud2b84": {"\ud14c\uc2a4\
\ud2b84-1": "\ud14c\uc2a4\ud2b84-1-1"}}'
'''

print(beforeSTR.encode('unicode-escape').decode())
'''
'{"\ud14c\uc2a4\ud2b81": "test1", "\ud14c\uc2a4\ud2b82": "test2", "\ud14c\uc2a4\ud2b83": ["\ud14c\uc2a4\ud2b83-1",
"\ud14c\uc2a4\ud2b83-2", "\ud14c\uc2a4\ud2b83-3"], "\ud14c\uc2a4\ud2b84": {"\ud14c\uc2a4\ud2b84-1": "\ud14c\uc2a4\
ud2b84-1-1"}}'
'''

 [출처] https://hayjo.tistory.com/75

 

 

 

 

본 웹사이트는 광고를 포함하고 있습니다.
광고 클릭에서 발생하는 수익금은 모두 웹사이트 서버의 유지 및 관리, 그리고 기술 콘텐츠 향상을 위해 쓰여집니다.
번호 제목 글쓴이 날짜 조회 수
57 [python 인공지능] Deploy ML models with FastAPI, Docker, and Heroku | Tutorial 졸리운_곰 2025.07.08 467
56 [python 인공지능] [VSCode] VSCode에서 ipynb 파일을 HTML(PDF 등..)로 졸리운_곰 2025.05.27 289
55 [Python 인공지능] [파이썬을 이용한 한글 NLP] 03. 간단한 키워드 추출기 졸리운_곰 2025.01.29 459
54 [Python 인공지능] [ 한글 키워드 시각화 ] 파이썬 python 텍스트 마이닝 한글 ( 워드 클라우드 WordCloud, squrify 트리맵으로 빅데이터 마스터) file 졸리운_곰 2025.01.29 398
53 [Python 인공지능] 기계 학습의 A to Z : IPython notebook과 scikit-learn을 활용한 기계 학습 file 졸리운_곰 2024.08.10 523
52 [python] 인공지능 python : 한글 문서 자동 요약 - lexrank 졸리운_곰 2023.07.06 404
51 [python] 인공지능 katiehouse / django-scikit-learn-tutorial file 졸리운_곰 2023.06.03 664
50 [python] [Anaconda]가상환경 설치,삭제 file 졸리운_곰 2022.12.03 405
49 [python][머신러닝] Scikit-learn Tutorial: Machine Learning in Python file 졸리운_곰 2022.11.29 497
48 [python] 파이썬(sklearn) 사이킷런(sklearn) 기초 졸리운_곰 2022.08.20 321
47 [python] scikit-learn이란 file 졸리운_곰 2022.08.20 455
46 [anaconde3][python] Create environment for tensorflow 1.4 in Anaconda 3 졸리운_곰 2022.07.02 563
45 [python][인공지능] [TensorFlow] Anaconda 가상환경 이용하여 TensorFlow GPU 설치 졸리운_곰 2022.01.20 438
44 [Python 인공지능] TextRank 를 이용한 키워드 추출과 핵심 문장 추출 (구현과 실험) file 졸리운_곰 2021.11.22 597
43 [python][인공지능] FLASK를 이용하여 PYTHON에서 PYTORCH를 REST API로 배포하기 졸리운_곰 2021.03.20 364
42 [python 파이썬] Creating REST API for TensorFlow models file 졸리운_곰 2021.02.01 488
41 [python 파이썬 인공지능] Keras 모델을 REST API로 배포해보기 file 졸리운_곰 2021.02.01 411
40 [파이썬 머신러닝] Scikit-learn 기초 졸리운_곰 2020.01.31 579
39 파이썬으로 간단한 뉴럴 네트워크 만들기 How to Create a Simple Neural Network in Python file 졸리운_곰 2020.01.29 22636
38 Keras를 활용한 주식 가격 예측 file 졸리운_곰 2019.02.25 983
대표 김성준 주소 : 경기 용인 분당수지 U타워 등록번호 : 142-07-27414
통신판매업 신고 : 제2012-용인수지-0185호 출판업 신고 : 수지구청 제 123호 개인정보보호최고책임자 : 김성준 sjkim70@stechstar.com
대표전화 : 010-4589-2193 [fax] 02-6280-1294 COPYRIGHT(C) stechstar.com ALL RIGHTS RESERVED