Ⅰ단원 · 4 / 5차시

빅데이터와 인공지능

데이터의 형태와 빅데이터의 특징(5V)을 알아보고, 빅데이터와 인공지능이 실제 사회 문제를 해결한 사례와 알고리즘·순서도의 개념을 살펴봅니다.

학습목표

  • 정형 데이터와 비정형 데이터를 구분하고 예시를 분류할 수 있다.
  • 빅데이터의 특징인 5V(규모·속도·다양성·정확성·가치)를 설명할 수 있다.
  • 빅데이터와 인공지능을 활용해 사회 문제를 해결한 사례를 찾고, 알고리즘을 순서도로 표현할 수 있다.

시간 배분

단계활동
도입인공지능으로 행성까지 발견하다 — Kepler-90i5분
활동1정형 데이터와 비정형 데이터10분
활동2빅데이터의 특징 — 5V10분
활동3빅데이터와 인공지능으로 사회 문제 해결하기10분
활동4알고리즘과 순서도10분
정리빅데이터와 인공지능의 관계5분
도입 · 5분

인공지능으로 행성까지 발견하다 — Kepler-90i

2017년 12월 NASA와 구글은 케플러 우주 망원경이 관측한 빅데이터를 인공지능(딥러닝)에게 분석하도록 하여, 약 4년 동안 관측한 3만 5,000여 개의 방대한 감광 신호 중 진짜와 가짜를 구별하게 했습니다. 그 결과 항성 'Kepler-90' 주변에서 태양계 밖 새로운 행성 'Kepler-90i'를 발견했습니다.

이처럼 인공지능과 빅데이터를 활용하면 데이터가 쌓여 있는 다양한 영역에서 새로운 발견이 이루어질 수 있습니다.
활동 1 · 10분

정형 데이터와 비정형 데이터

관찰이나 측정으로 얻게 되는 가공되지 않은 정보를 데이터(data)라고 합니다. 데이터는 형태에 따라 정형 데이터와 비정형 데이터로 분류합니다.

구분정의예시
정형 데이터
(structured data)
정해진 형식에 맞추어 정리한 자료. 컴퓨터가 인식·처리하기 수월하다.이름, 나이, 키, 성별과 같이 표로 정리된 자료
비정형 데이터
(unstructured data)
일정한 형식에 따라 정리되지 않은 자료. 컴퓨터가 인식하려면 정형 데이터로 가공해야 한다.이미지, 동영상, 음성, 뉴스 기사, SNS 글, 상품평 등

정형 데이터 중 키·몸무게처럼 연속된 값을 갖는 자료는 연속형 데이터, 성별·혈액형처럼 범주로 정리된 자료는 범주형 데이터라고 합니다. 비정형 데이터는 전체 데이터의 약 80% 이상을 차지합니다.

확인하기 1 — 정형 데이터일까, 비정형 데이터일까?
맞힌 개수
0 / 4
활동 2 · 10분

빅데이터의 특징 — 5V

빅데이터(Big Data)는 컴퓨터 및 장치를 통해 생성되거나 저장된 정보를 의미합니다. 빅데이터 시대에는 빠르게 생성되는 다양한 형태의 데이터를 관리·분석·활용하여 가치를 찾아내는 것이 중요합니다. 빅데이터의 특징은 다음 5가지(5V)로 정리할 수 있습니다.

V
규모 (Volume)
데이터의 양이 폭발적으로 증가
V
속도 (Velocity)
데이터가 빠른 속도로 생성·변화
V
다양성 (Variety)
정형·비정형 등 형식이 다양함
V
정확성 (Veracity)
데이터의 신뢰성과 품질
V
가치 (Value)
데이터에서 유용한 가치를 이끌어냄
데이터 측정 단위 알아보기
10³
단위
킬로바이트 (KB)
활동 3 · 10분

빅데이터와 인공지능으로 사회 문제 해결하기

빅데이터를 활용하면 인공지능 학습이 이루어지고, 학습된 결과를 바탕으로 의사 결정이 이루어집니다. 인공지능과 빅데이터는 서로의 성능과 활용성을 높이는 상호 보완 관계에 있습니다. 다음은 빅데이터와 인공지능을 활용해 사회 문제를 해결한 실제 사례입니다.

사례 1

공공 데이터 기반 장애인 콜택시 배차 알고리즘 개선

문제 상황 — 기존 배차 알고리즘으로 공차 시간이 불필요하게 발생해 장애인 콜택시 대기 시간(평균 60분 이상)이 일반 택시 호출(평균 4분 미만)보다 훨씬 길었습니다.

기술 개발 — 인공지능 기법인 '합성곱 신경망(CNN)'을 적용해 배차 알고리즘의 가중치를 수정하고, 시간대별 수요 예측 가중치 15%를 추가했습니다.

기대 효과 — 이동 시간이 감소해 장애인 이동권을 실현했고, 추가 비용 없이 서비스 품질을 높였습니다.

사례 2

빅데이터 기반 맞춤형 복지 정책으로 사각지대 해소

문제 상황 — 지자체 실정을 반영한 현실적이고 효과적인 복지 시스템 개발이 필요했습니다.

기술 개발 — 공공·민간 복지 지원 내역(각 61,000건·63,000건)과 인구 현황 등을 분석해 'GBM 알고리즘' 기반 예측 모델로 복지 기관 접근성이 취약한 지역을 도출했습니다.

기대 효과 — 위기 가정을 선제적으로 지원하고, 복지 기관 접근성과 이용 편의성을 높였습니다.

사례 3

빅데이터 분석으로 해양 안전 세이프존 확대

문제 상황 — 2018~2020년 연안 사고 사망률이 같은 기간 교통사고 사망률의 10배에 달했지만, 광활한 해양 지역 특성상 체계적인 데이터 기반이 부족했습니다.

기술 개발 — 해양 안전사고·순찰 활동·유동 인구·기상 데이터를 수집·정제하고, 중첩 분석과 '다중 회귀분석'으로 안전지수를 도출했습니다.

기대 효과 — 최근 5년 대비 연안 사고 25%, 사망자 수 29%가 감소했습니다.

활동 4 · 10분

알고리즘과 순서도

빅데이터를 처리하는 과정도, 인공지능이 계산하는 과정도 결국 정해진 절차인 알고리즘을 따릅니다. 알고리즘의 흐름을 도형과 화살표로 나타낸 것을 순서도라고 합니다. 일차방정식 $ax-b=0$의 해를 구하는 순서도를 직접 실행해 봅시다.

순서도 실행기 — $ax-b=0$의 해 구하기
2
4
현재 단계
시작
결과
정리 · 5분

빅데이터와 인공지능의 관계

빅데이터는 인공지능 학습의 가장 중요한 재료이며, 인공지능은 빅데이터를 분석해 그 활용성을 높입니다. 두 기술은 서로의 성능을 끌어올리는 상호 보완 관계입니다.

빅데이터는 '21세기의 원유'라고 불립니다. 원유가 정제 과정을 거쳐 다양하게 쓰이듯, 빅데이터도 알고리즘을 통한 분석과 가공을 거쳐야 비로소 가치를 만들어 냅니다.

차시 예고

오늘은 데이터의 형태, 빅데이터의 특징(5V), 사회 문제 해결 사례와 알고리즘·순서도의 개념을 배웠습니다. 다음 시간에는 데이터 편향 문제를 살펴보고 Ⅰ단원 전체를 정리합니다.

← 3차시 — 퍼셉트론으로 논리 연산 만들기 5차시 — 데이터 편향과 단원 정리 →