멀티모달 시스템은 이미지와 텍스트에 머물지 않고 음성과 오디오까지 넓어집니다. 이 강의는 spoken dialogue extension이 구조에 어떤 변화를 주는지 설명합니다.
- speech: 사람의 발화 신호입니다.
- audio: 비언어 음향을 포함한 소리 입력입니다.
- spoken dialogue: 음성 기반의 대화 구조입니다.
- turn-taking: 대화에서 발화 순서를 주고받는 과정입니다.
- 오디오 모달이 붙으면 무엇이 더 어려워지는가
- spoken dialogue는 텍스트 채팅과 무엇이 다른가
- 시간 정렬 문제는 왜 더 복잡해지는가
- 현실의 assistant는 종종 화면과 음성을 동시에 다뤄야 합니다.
- 음성은 시간축과 노이즈, 발화 경계 같은 추가 문제를 가져옵니다.
- acoustic representation과 language representation
- turn-level grounding
- spoken interaction latency
- audio-visual alignment
- spoken dialogue가 text chat보다 어려운 이유를 설명하라.
- 오디오 모달이 추가되면 어떤 정렬 문제가 생기는지 말하라.
- audio-visual system의 시간축 문제가 왜 복잡한지 설명하라.