이 책은 AI를 위한 수학을 이미 읽고 온 학습자를 위한 VLM 특화 심화 교재입니다. 따라서 여기서는 Transformer의 일반론, 텍스트-only alignment의 일반론, CLIP의 가장 기초 개념을 처음부터 다시 가르치지 않습니다. 대신 VLM에서만 본격적으로 어려워지는 시각 토큰화, connector 설계, OCR와 grounding, multimodal tuning, faithfulness 평가, video/audio/agent 확장을 순서대로 다룹니다.
이 교본은 새 커리큘럼에서 세 과목으로 갈라집니다. 토큰화와 현대 트랜스포머 구조, 사전학습, 분산학습은 S13 대규모 언어모델 I(298~321강)이 되고, 미세조정과 선호 정렬, 추론 능력, 서빙, 에이전트는 S14 대규모 언어모델 II(322~350강)가 되며, 이미지 표현과 대조학습, 멀티모달 구조, 이미지 생성은 S15 비전·언어 모델(351~383강)이 됩니다. 기존 40강은 전 강의가 스텁 상태이므로 집필 소재로만 씁니다. S15를 마치면 3차원 비전(S16, 384~407강)과 음성과 오디오(S17, 408~428강)로 양식을 넓히고, 이어서 연산과 최적화(S18), 모델 운용(S19), 안전과 거버넌스(S20)로 만든 모델을 실제로 돌리는 법까지 갑니다. 전체 학습 순서는 00. 학습 순서와 커리큘럼에 있습니다.
- VLM에서만 중요한 시각 표현과 token budget 문제를 구조적으로 읽습니다.
- image-text alignment를
VLM용 pretraining 데이터와 목적함수 관점에서 다시 해석합니다.
- connector, resampler, Q-Former, decoder-only VLM 같은 대표 설계를 비교합니다.
- OCR, document understanding, region grounding, faithfulness를 핵심 난제로 정리합니다.
- multimodal tuning, evaluation, RAG/agent, frontier 논문 독해까지 VLM 중심으로 연결합니다.
- AI를 위한 수학 02단계: 벡터, 행렬, 투영, 저랭크 근사를 이미 안다고 가정합니다.
- AI를 위한 수학 05단계: cross-entropy, KL, 최적화 기본기는 다시 풀지 않습니다.
- AI를 위한 수학 07단계: 신경망, self-supervised learning, diffusion의 일반론은 선수지식입니다.
- AI를 위한 수학 08단계: Transformer, pretraining, alignment, CLIP의 큰 그림을 이미 읽었다고 가정합니다.
- Transformer의 가장 기본적인 attention 유도
- LLM pretraining과 tokenization의 일반론
- text-only SFT, RLHF, DPO의 보편 개론
- CLIP의 입문 수준 설명
이 책은 이런 공통 기반을 다시 길게 반복하지 않고, 그 공통 기반이 VLM에서 어떻게 달라지는가에 집중합니다.
이 책의 강의는 개념을 먼저 나열하지 않습니다. 문제를 먼저 던지고, 그 문제를 푸는 과정에서 개념과 공식을 끌어냅니다. 공식은 외워야 할 대상이 아니라 방금 푼 풀이를 짧게 줄인 것입니다.
각 개념은 다음 다섯 단계로 진행합니다.
- 문제: 아직 배우지 않은 상황이 문제로 먼저 나옵니다.
- 생각의 실마리: 바로 풀리지 않을 때 붙잡을 질문을 줍니다. 풀이를 보기 전에 이 실마리로 한 번 더 시도합니다.
- 풀이: 답까지 가는 계산과 논리를 모두 적습니다.
- 이 문제에서 배우는 것: 방금 쓴 풀이를 일반화해 정의와 공식으로 정리합니다.
- 바로 확인: 같은 도구로 풀리는 변형 문제로 손에 붙입니다.
그 뒤에 종합 문제 드릴과 심화 문제가 이어지고, 단원 끝에서 문제집이 전체를 통합합니다. 순서대로 따라가기만 해도 이 과목의 개념과 문제 유형을 전부 익히도록 설계했습니다.
그래서 읽는 방법도 다음과 같습니다.
- 문제를 읽으면 풀이로 바로 내려가지 말고 반드시 먼저 손으로 풀어 봅니다. 틀려도 괜찮습니다. 스스로 시도한 뒤 풀이와 대조할 때 개념이 기억에 남습니다.
- 처음부터 끝까지 순서대로 읽습니다. 뒤 단계는 앞 단계의 용어와 병목을 이미 안다고 가정합니다.
- 공통 개념이 나오면 여기서 새로 외우기보다
AI를 위한 수학에서 어디까지 배웠는지 먼저 떠올립니다.
- 각 강의는 "입력은 무엇인가, vision token은 어디서 줄어드는가, language side는 어디서 읽는가"를 기준으로 읽습니다.
- OCR, grounding, evaluation처럼 실제 실패 사례가 나오면 반드시 구조와 데이터 문제로 다시 연결합니다.
- 막히면 뒤로 가기보다 바로 앞 단계의 VLM 전용 병목을 다시 확인합니다.
- VLM의 시각 표현과 토큰화
- 멀티모달 정렬과 데이터 설계
- Connector와 VLM 아키텍처
- Grounding, OCR, structured visual reasoning
- 멀티모달 tuning, preference, safety
- 평가, faithfulness, hallucination 완화
- 비디오, 음성, RAG, 에이전트 시스템
- Frontier VLM과 최신 논문 독해
이 순서는 단순 역사 순서가 아니라, 시각 표현 -> 정렬 데이터 -> connector 구조 -> grounded reasoning -> tuning과 safety -> trust 평가 -> 시스템 확장 -> frontier로 병목을 따라가도록 배치했습니다.
- generic vision backbone 소개가 아니라
VLM에서 왜 token budget이 곧 성능 병목인지를 배웁니다.
- high-resolution 입력, connector 병목, backbone transfer를 VLM 과제와 바로 연결합니다.
- CLIP 기본 개념을 다시 처음부터 가르치지 않고,
VLM용 pretraining pipeline 안에서 정렬을 다시 읽습니다.
- interleaved data, OCR-heavy data, curated mixture가 왜 중요한지 정리합니다.
- generic Transformer 설명보다
vision token을 LM이 어떻게 읽게 만드는가에 집중합니다.
- connector, resampler, Q-Former, decoder-only VLM family를 비교합니다.
- VLM 고유 난제인 OCR, document/chart understanding, spatial reference, counting을 묶습니다.
- grounded reasoning과 hallucination failure를 구조적 문제로 읽습니다.
- text-only alignment 일반론이 아니라
멀티모달 instruction data와 visual evidence가 들어간 정렬을 다룹니다.
- refusal, jailbreak, safety policy를 이미지 입력까지 포함한 문제로 봅니다.
- benchmark 점수만이 아니라 faithfulness, verifier, abstention, human evaluation을 중심에 둡니다.
잘 맞는 모델과 믿을 수 있는 모델의 차이를 다룹니다.
- 단순 모달 추가가 아니라 video/audio/RAG/tool use가 붙으면서 시스템 문제가 어떻게 커지는지 봅니다.
- GUI agent와 serving, cost, latency를 함께 읽습니다.
- multimodal diffusion, unified model, MoE, world model 같은 VLM frontier를 정리합니다.
- open-source VLM 생태계와 실험 설계를
재현성과 제품 적용 가능성 기준으로 읽습니다.
- 최신 논문을 읽을 때 무엇이 진짜 novelty이고 무엇이 포장인지 구분하는 기준을 익힙니다.
- 먼저 어떤 입력과 출력 문제를 다루는지 세웁니다.
- 그다음 필요한 표현과 모듈을 쉬운 말로 정리합니다.
- 그다음 손실, attention, 토큰 흐름 같은 핵심 수식을 붙입니다.
- 마지막에 실제 사용 장면, 실패 사례, 다음 단계 연결로 마무리합니다.
이 책은 이 순서를 지키면서 진행하므로, 위에서 아래로 읽기만 해도 공통 AI 수학 위에 VLM 특화 난제가 층층이 쌓이도록 구성합니다.
- 이 책은 독립 입문서가 아니라 VLM 특화 심화 교재입니다.
- 공통 개념은 짧게 상기하고, VLM 고유 병목을 오래 봅니다.
- 구조 이름보다 정보 흐름과 failure mode가 먼저입니다.
- 높은 점수보다 grounded answer와 faithfulness를 더 중요하게 봅니다.
- 이 책의 목적은 유행 모델 나열이 아니라 VLM 설계를 읽는 습관을 만드는 것입니다.
이 책을 끝내면 어떤 VLM 논문이나 제품을 보더라도, generic Transformer 설명이 아니라 시각 표현이 어디서 압축되고, connector가 어떤 병목을 만들고, OCR와 grounding이 왜 어렵고, safety와 evaluation이 어디서 실패하는지를 순서대로 설명할 수 있어야 합니다. 더 나아가 이미지 VLM에서 비디오, 음성, RAG, agent, unified model까지 어떤 추가 난제가 붙는지도 연결해서 볼 수 있어야 합니다.