Skip to main content

Command Palette

Search for a command to run...

Latest articles

  1. 기존의 자연어 처리 기법

    자연어 처리를 위한 딥러닝 기술 이전, 텍스트 마이닝 분야에서 기초적으로 사용되던 기법에 대해 정리한다. Bag-Of-Words (단어 가방 모형) 단어들의 순서는 전혀 고려하지 않고, 단어들의 출현 빈도(frequency)에만 집중하는 텍스트 데이터의 수치화 표현 방법입니다. 단어를 벡터로 표현하기 위해서는 주어진 문장에 쓰인 단어들을 사전(Vocabulary) 형태로 저장하며, 이때 주의할 점은 단어들의 중복을 허용하지 않아야 한다는 점...

    Jul 8, 20243 min read
    기존의 자연어 처리 기법
  2. 자연어 처리 활용 분야와 트렌드

    자연어 처리(NLP, Natural Language Processing)은 기본적으로 (1) 컴퓨터가 주어진 단어나 문장 그리고 보다 더 긴 문단이나 글을 이해하는 NLU(Natural Language Understading)과 (2) 이러한 자연어를 상황에 따라 적절히 생성할 수 있는 NLG(Natural Language Generation)이라 부르는 두 종류의 Task로 구성된다. 자연어 처리 분야별 학회 목록 NLP 분야는 CV 분야와...

    Jul 7, 20243 min read
    자연어 처리 활용 분야와 트렌드
  3. 최적화(Optimization) 기초

    본 강좌에서는 최적화(Optimization) 문제에서 나오는 여러가지 용어들에 대한 명확한 정의와 컨셉만을 집고 넘어간다. Generalization 인공지능에서 일반화(Generalization)란 학습된 모델이 unseen data에 대해 얼마나 잘 작동하는지를 의미한다. 즉, 일반화 성능(Generalization performence)은 학습 데이터에서의 성능과 테스트 데이터 사이에서의 성능이 얼마나 차이나는지를 말한다. Un...

    Jun 19, 20244 min read
    최적화(Optimization) 기초
  4. 베이즈 통계학 기초

    조건부 확률이란? 베이즈 통계학을 이해하기 위해서는 조건부 확률의 개념을 이해해야 한다. 조건부 확률 $P(A|B)$는 사건 B가 일어난 상황에서 사건 A가 발생할 확률을 의미한다. 조건부 확률을 계산하는 방법은 두 개의 사건 A와 B가 있을 때 두 사건의 교집합이 일어날 확률을 특정 사건으로 나눠주게 되면 계산할 수 있다. 이 수식을 다음과 같이 정리하면 베이즈 정리를 유도할 수가 있고, 조건부 확률을 이용해서 정보를 갱신하는 방법을 알 ...

    Jun 18, 20242 min read
    베이즈 통계학 기초
  5. 통계학 기초

    모수가 뭐에요? 통계적 모델링은 적절한 가정위에서 확률분포를 추정(inference)하는 것이 목표이며, 기계학습과 통계학이 공통적으로 추구하는 목표이다. 실제로 사용할 수 있는 분포의 종류도 굉장히 다양하여 어떤 확률 분포를 사용해서 모델링하는 것도 중요한 선택이다. 그러나 유한한 개수의 데이터만 관찰해서 모집단의 분포를 정확하게 알아낸다는 것은 불가능하므로, 근사적으로 확률분포를 추정할 수 밖에 없다. 예측모형의 목적은 분포를 정...

    Jun 17, 20244 min read
    통계학 기초
  6. 확률론 기초

    딥러닝에서 확률론이 왜 필요한가요? 기계학습에서 사용되는 손실함수(loss function)들의 작동 원리는 데이터 공간을 통계적으로 해석해서 유도하게 된다. 회귀 분석에서 손심함수로 사용되는 $L_2$ 노름은 예측오차의 분산을 가장 최소화하는 방향으로 학습을 유도한다. 분류 문제에서 사용되는 교차엔트로피(cross-entropy)는 모델 예측의 불확실성을 최소화하는 방향으로 학습을 유도한다. 즉, 분산 및 불확실성을 최소화하기 위해서는...

    Jun 16, 20243 min read
    확률론 기초
  7. 딥러닝 학습방법 이해하기

    신경망을 수식으로 분해해보자 행벡터 $O_i$는 데이터 $X_i$와 가중치 행렬 $W$ 사이의 행렬곱과 절편 $b$ 벡터의 합으로 표현된다고 가정해보자. 행렬은 (1) 데이터를 모아 놓은 행렬($X$)과 (2) 데이터를 다른 공간으로 보내주는 연산자($W$) 역할이 있다. 이는 d개의 변수로 p개의 선형모델을 만들어 p개의 잠재변수를 설명하는 모델을 의미한다. 화살표로 해당하는 것이 가중치 행렬 $W_{ij}$이다. 화살표의 개수는 d...

    Jun 13, 20243 min read
    딥러닝 학습방법 이해하기
  8. 경사하강법 활용

    선형회귀분석 n개의 변수로 데이터로 이뤄져 있는 상황에서 이를 가장 잘 표현하는 선형 모델을 찾는 문제가 선형회귀분석이다. 변수의 개수보다 식의 개수가 더 많아지는 경우 (n > m), 무어-펜로즈 역행렬을 이용해서 선형 모델에 해당하는 선형회귀식을 찾을 수가 있다. 또한, 경사하강법을 이용해서 선형 모델을 찾을 수 있다. 경사하강법으로 선형회귀 계수 구하기 경사하강법은 선형 모델이 아닌 다른 방식의 모델을 사용할 때도 이용할 수 있...

    Jun 12, 20243 min read
    경사하강법 활용
  9. 경사하강법 기초

    미분이 뭔가요? 미분(differentiation)은 변수의 움직임에 따른 함수값의 변화를 측정하기 위한 도구로 최적화에서 제일 많이 사용하는 기법이다. 어떤 주어진 한 점 $x$와 그 $x$에서 $h$만큼 이동한 $x+h$에서의 함수값과의 차이를 움직인 거리 $h$로 나눠줬을 때 변화율(기울기)이라 부른다. 변화율의 극한을 미분으로 정의한다. 파이썬에서는 sympy.diff를 가지고 미분을 계산할 수 있다. $$f'(x) = lim_...

    Jun 11, 20242 min read
    경사하강법 기초