在人工智能的快速发展中,视觉与语言的多模态交互已成为核心研究方向之一。本课程将系统讲解视觉与语言(Vision-and-Language, V&L)领域的核心算法、模型设计及实际应用,涵盖从基础理论到前沿技术的全链条知识。课程内容结合计算机视觉(CV)与自然语言处理(NLP)的交叉点,帮助学生掌握跨模态表征学习、多模态对齐与生成等关键技术。
课程亮点:
- 跨模态基础理论:深入解析视觉与语言联合建模的核心挑战(如模态差异、语义对齐),学习经典模型(如CLIP、ViLBERT、BLIP)的设计思想。
- 前沿技术实践:
- 多模态预训练与迁移学习
- 视觉问答(VQA)、图像描述生成(Image Captioning)
- 文本到图像生成(如Stable Diffusion、DALL·E)
- 视频与语言理解(Video-Language Modeling)


