서비스

Chat GPT로 하는 데이터 분석 가이드_초심자도 할 수 있는 공공데이터 분석

박정근
2023-07-11
9분 읽기
#ChatGPT

ChatGPT를 활용하여 초심자도 쉽게 할 수 있는 공공데이터 분석 방법을 제시하고, 실제 데이터 분석 사례를 통해 실무 적용 방법을 알아봅니다.

Chat GPT로 하는 데이터 분석 가이드_초심자도 할 수 있는 공공데이터 분석
혼자서 MVP/서비스 만들기, 왜 이렇게 어려울까요? 2025년 6월 16일 데이터 분석이 중요하다는 것은 당연하게도 여러 매체에서 들으실 수 있을 것 같습니다. 이번에 저희가 분석을 해야되는 이유는 여러분들이 Product를 만들 때, 근거를 만들어서, 데이터 분석을 진행하게 됩니다. Product를 만들다보면 스스로의 제품과 기능에 대해서 의구심이 생길 수 있고, 계획한 목표(KPI 등)를 이루지 못한다면 팀원들의 사기와 믿음 또한 꺾일 수 있기에, 초기 외부 변수들을 최대한 줄이기 위함이 큽니다 물론 80% 이상의 첫 Product들은 실패로 마무리가 되고, 그 과정에서 사용자들의 의견을 기반으로 Develop하는게 더 중요함을 강조드리고 싶습니다. 데이터를 찾고, 처리하고 분석하는 방법을 간단하게 볼 예정입니다 우선 데이터를 분석하기 전에 세팅을 해야할 요소들이 있는데, 이에 대한 내용은 추후에 다루도록 하겠습니다. (혹시 급하신 분들은 ChatGPT에게 아래 2가지 요소를 추천받기를 권장드립니다) 지금은 ChatGPT를 통해서, 직접 코드를 짜지 않아도, 데이터 분석을 할 수 있다는 내용을 중심으로 진행할 예정입니다. 이에 대한 내용도 당연히 GPT를 이용하시면 편하게 확인하실 수 있습니다. 먼저 저는 여러 공공데이터들을 찾아보면서, 연계성이 있는지 데이터들을 분석해보려 했으나, 데이터 간 공통적으로 연계하기에는 "년도", "지역" 등이 대부분 상이하였고, 이에 따라 분석하기가 어려웠습니다. 이외로도 많은 데이터들이 있으니, 꼭 활용해보시면 좋을 것 같습니다 위 서울 열린 데이터 광장에서 다운로드를 받은 데이터를 기반으로, 데이터를 분석하기 위해 위와 같이 요청을 했습니다. 그러나 아쉽게도 에러코드가 나왔기에, 이 또한 ChatGPT에게 물어봤으며, 정말 친절하게 왜 그런지와 수정된 코드도 전달해주었습니다. 저는 이제 과연 데이터들이 잘 합쳐졌는지가 궁금하기에, 이에 대해서 확인할 수 있는 코드를 요청했고, 다행히도 데이터들이 잘 나와있음을 확인하였습니다. 여기서 데이터를 보니, 2016년도의 데이터에 "건 수 차이"가 NaN 값으로 되어 있어서, 2016년도의 데이터는 제외를 시키는게 낮다고 판단하여, 이에 대해서 수정을 진행하였습니다. 근데 이 때에도 또 에러가 나오기에, GPT에게 수정해달라고 요청했습니다. "건수 차이"(에코마일리지 가입 건수 상승량)에 따른 "건수당 현년탄소 차이"(개인의 탄소배출량의 증가량)의 연관관계"를 보고 싶었기에, 아래와 같이 질문을 하였습니다. 상관 계수가 "-0.38"이 나왔기에, 약하지만 상관관계가 있다고 판단하였으며(상관 계수가 -1 ~ 1 사이에서 나오며, -1과 1에 근접할 수록 강한 상관관계입니다) 여기서 더 나아가 그래프로도 보고 싶었기에, 아래와 같은 결과를 얻을 수 있었습니다. 제가 지금 작성한 내용들은 아예 데이터 분석을 처음하시는 분들은 어려울 수 있을 것 같습니다. 혹시 궁금하신 점이 있다면 언제든 댓글로 말씀해주세요:)

어떤 업무를 AI에 맡길 수 있을지 궁금하시다면,
2분 진단으로 지금 가장 먼저 구조화할 지점을 확인해보실 수 있습니다. 편하신 만큼만 답하셔도 괜찮습니다.

STAR-T AI 사업 운영 진단 →

Engagement

조회와 반응은 내부 콘텐츠 운영 지표로 저장됩니다.

1,035 views

핵심 요약

  • 제품을 만들 때 데이터 분석이 필요한 이유를, 기능에 대한 의구심과 목표 미달로 흔들리는 상황에서 초기 외부 변수를 줄이기 위함이라고 설명합니다.
  • 여러 공공데이터를 살펴본 결과 "년도"·"지역" 등 기준이 서로 달라 연계 분석이 어려웠고, 결국 기준이 맞는 데이터를 골라 진행했습니다.
  • 데이터 병합 과정에서 에러가 발생할 때마다 ChatGPT에 원인과 수정 코드를 요청해 해결했고, 병합 결과가 제대로 나왔는지 확인하는 코드도 함께 요청했습니다.
  • 2016년도 데이터의 "건 수 차이" 항목이 NaN으로 비어 있어 해당 연도를 분석에서 제외하는 방식으로 정리했습니다.
  • 에코마일리지 가입 건수 상승량과 건수당 탄소 배출 증가량의 상관계수가 -0.38로 나와, 상관계수가 -1~1 범위임을 근거로 약한 상관관계로 판단하고 그래프로도 확인했습니다.

자주 묻는 질문

코딩을 모르는데 ChatGPT로 데이터 분석을 할 수 있나요?

글쓴이는 직접 코드를 짜지 않고 ChatGPT에 요청하는 방식으로 데이터 병합과 분석을 진행했습니다. 에러가 나면 에러 내용을 그대로 물어보아 원인 설명과 수정된 코드를 받아 이어서 진행했습니다. 다만 데이터 분석을 처음 접하시는 분께는 일부 내용이 어려울 수 있다고 글에서도 덧붙이고 있습니다.

공공데이터를 분석할 때 가장 먼저 막히는 지점은 무엇인가요?

여러 공공데이터를 함께 보려 할 때 "년도"나 "지역" 같은 기준 항목이 데이터마다 달라 연계가 어려웠다고 합니다. 또한 특정 연도의 값이 NaN으로 비어 있는 결측치 문제도 있었고, 이 경우 해당 연도를 제외하는 방식으로 처리했습니다.

상관계수 -0.38은 어떻게 해석하나요?

상관계수는 -1에서 1 사이의 값을 가지며, -1이나 1에 가까울수록 상관관계가 강합니다. 글에서는 -0.38이 나온 결과를 두고 약하지만 상관관계가 있다고 판단했고, 수치만으로 그치지 않고 그래프로도 분포를 확인했습니다.

읽고 끝내지 말고, 지금 실행할 서비스와 상담으로 이어가세요.

인사이트로 문제를 이해했다면 다음 단계는 실행 구조를 정하는 일입니다. 관련 서비스 보기와 무료 미팅으로 바로 넘어갈 수 있습니다.

무료 미팅 / 상담 요청

박정근

STAR-T 대표 컨설턴트

IT 서비스 기획 및 디자인 전문가로서, 다양한 스타트업과 기업의 성공 사례를 연구하고 공유합니다.

지금 실행으로

읽고 끝내지 말고, 지금 실행할 서비스와 상담으로 이어가세요.

인사이트로 문제를 이해했다면 다음 단계는 실행 구조를 정하는 일입니다. 관련 서비스 보기와 무료 미팅으로 바로 넘어갈 수 있습니다.