p.61

01

기계학습의 개념

개념에 대한 적절한 예시 데이터로 그 안에 숨겨진 패턴을 찾아내고,
그것을 바탕으로 새로운 데이터에 대한 지능적인 예측과 판단을 한다.

문제 해결과 탐색, 지식 표현과 추론, 기계학습, 인공 신경망, 딥러닝의 포함 관계

왜 기계학습 기법을 사용하는가?

전통적인 프로그래밍 기계학습
문제 해결 방식 사람이 명시적인 규칙을 프로그램으로 작성 컴퓨터가 데이터의 패턴을 찾아 모델 생성
처리 과정 입력 + 규칙 → 출력 예시 데이터 → 학습 → 예측·판단
알맞은 문제 규칙을 분명하게 표현할 수 있는 문제 정확한 규칙을 미리 표현하기 어려운 문제
학생 성적 평균 계산 동물 이미지의 종 예측

02

p.64

기계학습으로 해결할 수 있는 문제

인간의 경험이 반영된 데이터를 기반으로 최적화된 모델을 만들어 문제를 해결

01

분류 · 예측

주어진 데이터를 미리 정의된 여러 그룹 중 하나로 나눈다.
미래의 값을 추정 · 알려지지 않은 데이터의 값을 결정

스팸 메일 분류
주택 가격 예측
02

군집

비슷한 특성을 가진 데이터를 같은 그룹으로 묶는다.

비슷한 성향의 고객 묶기
03

인식

이미지, 음성, 텍스트를 인식하고 이해한다.

얼굴 감정 · 음성 인식
04

자연어 처리

기계가 인간의 언어를 이해하고 처리한다.

자동 번역 · 감정 추론
05

생성

새로운 데이터나 콘텐츠를 만들어 낸다.

텍스트·이미지·음성 생성

03

p.65

기계학습을 적용한 다양한 사례

04

p.67

데이터

숫자, 문자, 이미지 등을 관찰하거나 측정하여 수집한 사실이나 값

01

데이터 속성

데이터를 구성하는 구체적인 정보 요소

수치형

숫자로 표현

이산형 값 사이가
끊어짐
학생 수, 횟수
연속형 값이 연속적으로 이어짐 시간, 키

범주형

정해진 범주 중 하나에 해당

성별: 남, 여 혈액형: A, B, AB, O 만족도: 만족, 불만족

02

데이터 유형

데이터가 구성되고 표현되는 형식

정형 데이터

속성이 미리 정해진 행과 열의 표 형태

붓꽃의 꽃받침과 꽃잎 수치가 행과 열로 정리된 표
붓꽃의 속성을 행과 열로 정리

비정형 데이터

속성을 미리 정의하기 어려운 정형화되지 않은 데이터

세 품종의 붓꽃 이미지 데이터
형태가 일정하지 않은 붓꽃 이미지

05

p.69~71

데이터 수집 및 선정

01 데이터 수집 방법

공공 데이터 수집

국가통계포털 · 공공데이터포털 · 기상자료개방포털

민간 데이터 수집

캐글·AI 허브·데이터셋 검색 엔진

직접 수집

설문 · 관찰 · 스마트 기기 · 센서

02 데이터 선정 과정

문제의 유형 분석

분류 · 예측 · 군집 · 인식 · 자연어 처리 · 생성

데이터 유형 탐색

정형 데이터 · 비정형 데이터

수집 방법 선택

공공 · 민간 · 직접 수집

03 수집 시 고려 사항

편향성과 공정성

데이터의 불균형이나 편향이 공정성 문제로 이어져 특정 속성 사람들의 불이익 발생 가능

수집 과정의 정당성

검증된 데이터를 정당한 방법으로 수집(개인정보 · 신뢰성)

06

p.72

데이터 탐색과 전처리

07

p.72~74

데이터 살펴보기

01

확인하기

형태 · 규모 · 유형

데이터의 형태, 개수, 속성, 유형을 확인한다.

df.info()
344개데이터7개속성
02

통계 요약

분포와 값의 범위

개수,평균,최솟값,최댓값 등으로 데이터의 분포를 파악한다.

df.describe()
부리 깊이 평균 17.15체질량 평균 4201.75
03

시각화

패턴 · 관계 · 편향

그래프로 데이터의 패턴, 관계, 편향을 찾는다.

sns.countplot()
Adelie168
Chinstrap68
Gentoo124

Chinstrap 데이터가 적음
예측 편향 가능성

08

p.74~76, 80~82

데이터 전처리

데이터 분석에 적합한 상태로 변환하는 과정

01

결측치 처리

값이 비어 있거나 NA, NaN으로 표시된 데이터

df.isnull().sum() df.dropna()
결측치가 있는 행 삭제 344개 → 334개
02

이상치 처리

잘못 입력되었거나 정상적인 값의 범위에서 크게 벗어난 데이터

sns.scatterplot() sns.boxplot()

데이터 경향

교과서의 이상치 포함 여부에 따른 회귀 경향 비교

상자그림으로
이상치 확인

교과서의 펭귄 종별 체질량 상자그림
03

정규화

MinMaxScaler()

최대-최소 정규화

최솟값과 최댓값 사이의 범위에서 0과 1의 범위로 맞춤

x′ = x − xminxmax − xmin

교과서의 날개 길이와 체질량 최소 최대 정규화 막대그래프

09

p.76~78

핵심 속성

기계학습 모델의 학습 및 예측 성능에 중요한 영향을 미치는 속성

01 핵심속성 추출방법

  1. 불필요한 속성 검토/제거

  2. 공정성에 문제 되는 속성 검토

  3. 중복되는 속성이 없는지 분석

  4. 주어진 속성의 중요도 판별

  5. 더 필요한 속성이 없는지 검토/추가

02 정형 데이터

sns.scatterplot()교과서의 펭귄 부리 길이와 부리 깊이 산점도
sns.regplot()교과서의 펭귄 부리 길이와 체질량 회귀 산점도
sns.heatmap()교과서의 펭귄 속성 상관계수 히트맵

03 비정형 데이터

교과서의 아기 울음소리, 클래식 음악, 재채기, 코 푸는 소리, 기침 소리 파형