1. Generative model(GM, 생성형 모델)
VLM이 영상을 입력으로 받아서 텍스트로 설명해주는 모델이라면 생성형 모델은 반대로 텍스트를 입력으로 받아서 영상, 비디오, 오디오 등을 생성해주는 모델임, 예) 피카소 화풍으로 개사진 그려줘 -> 개 영상 생성
특히, VLA모델에서 VLM이 이해한 환경정보를 로봇의 제어명령으로 생성해주는 Action decoder에서 사용됨
작동원리 ->
개념적으로 생성형 모델은 측정데이터로 부터 측정데이터가 속한 모집단의 확률 분포를 학습하고 새로운 데이터를 생성해주는 모델임
추론시 생성되는 새로운 데이터는 학습할때 공부한 측정데이터의 확률분포를 따르게 된다.
예를 들어, 수많은 개영상을 이용하여 훈련하여 개영상의 통계적 분포를 학습하고 학습된 모델을 이용하여 개와 비슷한 영상을 생성해냄
만약 측정데이터가 정규분포를 따르다면 모델은 평균과 분산을 학습을 통해 알아내고 추론시에는 이 평균, 분산정보를 이용하여 같은 분포를 갖는 새로운 데이터를 생성할수 있음 -> 측정데이터와 비슷한 통계적특성을 갖는 영상, 텍스트, 음성, 로봇궤적 등을 생성할수 있음
2. 종류
(1) GAN
(2) VAE(Variational Auto Encoder)
임의의 확률분포를 훈련(인코더+디코더)하고 훈련된 모델(디코더)을 통하여 원래 분포를 따르는 새로운 데이터를 생성하는 모델
모델구조 : 입력데이터(고차원, 임의분포) -> 인코더 -> 잠재변수(저차원, 정규분포) -> 디코더 -> 출력(고차원, 임의분포)
인코더+디코더구조는 영상분할 모델과 구조가 유사함
따라서, 인코더를 함수 f로 정의하면 디코더는 f의 역함수 역할을 한다고 보면됨
훈련과정에서는 임의분포를 따르는 측정데이터를 정규분포를 따르는 잠재변수로 변환하도록 인코더를 학습하고 잠재변수(정규분포)를 다시 원래 입력데이터로 복원하도록 디코더를 학습시킴 -> 영상분할모델의 학습과정 동일함, 이렇게하면 decoder는 잠재변수로 부터 원래 측정데이터와 유사한 데이터를 생성하는 법을 학습하게 됨
추론과정에서는 인코더는 사용하지 않고 디코더에 표준정규분포(평균0, 표준편차1인 정규분포)를 따르는 잠재변수 데이터를 입력하여 훈련에서 학습한 임의분포를 갖는 새로운 데이터를 생성함
(3) Diffusion Model(DM)
확산과정(encoder)을 통하여 훈련 영상데이터 원본(x0 = x)에 조금씩 노이즈를 더하여 완전 노이즈 상태(xT)로 만들고 역확산(decoder)과정을 통하여 노이즈가 섞인 영상으로 부터 노이즈를 제거하는 과정을 신경망으로 학습함(수학적으로는 확산과정이 함수 f라면 역확산과정은 f의 역함수를 신경망으로 모델링), 추론과정에서는 확산과정(encoder)은 필요없고 역확산과정에서 학습한 모델을 이용하여 완전 노이즈 상태에서 출발하여 새로운 영상을 생성함, 역확산 과정에서 노이즈 섞인 영상에서 노이즈를 제거하는 방법을 학습했기 때문에 디코더는 완전한 노이즈 상태를 입력으로 받아서 학습한대로 조금씩 원래영상을 복원할수 있음
Stochastic differential equation(확률미분방정식), Score Matching(SM) 훈련 알고리즘 사용
(4) Continuous Normalizing Flow Model(CNF)
ordinary differential equation(상미분방정식), Flow Matching(FM) 훈련알고리즘 사용
(5) 최근 연구 동향
최근추세는 DM와 CNF 모델을 FM 으로 훈련하는 것임 -> 훈련,추론 속도빠름
로봇제어용 VLA모델에서 Action decoder로 DF모델에서 CNF+FM으로 바뀌고 있는 추세
예를 들어 기존 VLM + CNF + FM 개발을 연구주제로 추천
이분야 공부를 위해서는 미분방정식 또는 동적시스템(dynamic system)에 대한 지식이 필요
3. 교재
밑바닥부터 시작하는 딥러닝 5 - 10단계로 익히는 이미지 생성 모델의 원리, 사이토 고키 저자(글) · 개앞맵시 번역, 한빛미디어, 2024년
-> 생성형모델의 기초가되는 확률이론부터 VAE, 확산모델까지 이론과 함께 구현방법까지 알려줌
특히, 확률통계기초, 정규분포, 가능도(우도), 최대가능도(우도)추정, KL발산, GMM, EM 등 확률통계 이론이 잘 정리되어 있어 확률공부에도 좋은 교재임
최대가능도(우도)추정->측정데이터로부터 모집단의 확률분포(평균,분산)를 추정하는 기술
쿨백-라이블러 발산(KL divergence) -> 두개의 확률분포의 유사도를 측정하는 지표
GMM -> Gaussian mixture model, 다봉분포, 여러개의 정규분포를 결합하여 여러개의 봉우리를 갖는 분포를 모델링
EM -> Expectation maximization, 기대값 최대화, GMM모델의 확률분포(평균, 분산)를 추정하는 기술
VAE(Variational Auto Encoder) -> 임의의 확률분포를 훈련(인코더+디코더)하고 훈련된 모델(디코더)을 통하여 원래 분포를 따르는 새로운 데이터를 생성하는 모델
확산모델(Diffusion model) -> 확산과정(encoder)을 통하여 훈련 영상데이터 원본에 조금씩 노이즈를 더하여 완전 노이즈 상태로 만들고 역확산(decoder)과정을 통하여 노이즈가 섞인 영상으로 부터 노이즈를 제거하는 과정을 신경망으로 학습함(수학적으로는 확산과정이 함수f라면 역확산과정은 f의 역함수를 신경망으로 모델링), 추론과정에서는 encoder는 필요없고 역확산과정에서 학습한 모델을 이용하여 완전 노이즈 상태에서 새로운 영상을 생성함
4. 논문
VAE: Auto-Encoding Variational Bayes, 2013
https://arxiv.org/abs/1312.6114
CNF : Neural Ordinary Differential Equations, 2018
https://arxiv.org/abs/1806.07366
Denoising Diffusion Probabilistic Models, 2020
https://arxiv.org/abs/2006.11239
FFJORD: Free-form Continuous Dynamics for Scalable Reversible Generative Models, 2019
https://arxiv.org/abs/1810.01367
Flow Matching for Generative Modeling, 2022, Meta AI
https://arxiv.org/abs/2210.02747
The Principles of Diffusion Models, 2026
https://arxiv.org/abs/2510.21890
Diffusion Models: A Comprehensive Survey of Methods and Applications, 2022
https://arxiv.org/abs/2209.00796
Flow Matching Guide and Code, 2024, Meta
https://arxiv.org/abs/2412.06264
Flow Matching 이론설명과 Meta에서 개발한 flow_matching 라이브러리 이용한 예제코드까지 제공됨
An Introduction to Flow Matching and Diffusion Models, 2026, MIT 강의노트
https://diffusion.csail.mit.edu/2026/docs/lecture_notes.pdf
5. 라이브러리
Diffusion model -> 허깅페이스 라이브러리 Diffusers 사용하면됨
TorchCFM -> flow-matching 라이브러리, 로봇, 과학분야 적합
flow_matching ->flow-matching 라이브러리 , 메타에서 개발 LLM개발에 적합
6. 유튜브 강의자료
https://dmqa.korea.ac.kr/activity/seminar/486