课程封面

视觉与语言算法:跨模态智能的前沿与应用

共3节 已有7人学过

主讲老师张旭波

更新时间2025-05-19 13:46:25

课件资料暂无

免费

加载中...

课程介绍

在人工智能的快速发展中,视觉与语言的多模态交互已成为核心研究方向之一。本课程将系统讲解视觉与语言(Vision-and-Language, V&L)领域的核心算法、模型设计及实际应用,涵盖从基础理论到前沿技术的全链条知识。课程内容结合计算机视觉(CV)与自然语言处理(NLP)的交叉点,帮助学生掌握跨模态表征学习、多模态对齐与生成等关键技术。

​课程亮点​​:

  1. ​跨模态基础理论​​:深入解析视觉与语言联合建模的核心挑战(如模态差异、语义对齐),学习经典模型(如CLIP、ViLBERT、BLIP)的设计思想。
  2. ​前沿技术实践​​:
  • 多模态预训练与迁移学习
  • 视觉问答(VQA)、图像描述生成(Image Captioning)
  • 文本到图像生成(如Stable Diffusion、DALL·E)
  • 视频与语言理解(Video-Language Modeling)

讲师介绍

讲师头像

张旭波

对计算机视觉(图像分类,目标检测,语义分割),NLP,文生图以及GAN领域感兴趣。 B站:https://space.bilibili.com/625095571 CSDN博客:https://blog.csdn.net/Keep_Trying_Go? spm=1010.2135.3001.5421 GitHub: https://github.com/KeepTryingTo

AI课程导读

本课程从中文CLIP的理论与实战出发,带你系统掌握跨模态检索、零样本分类与参数高效微调的关键技术。你将理解原生CLIP为何在中文场景下降,中文CLIP如何用双塔结构、RoBERTa文本编码器和两阶段训练完成图文对齐;还会深入训练脚本,看懂ViT-B/16与BERT编码器、对比损失、相似度矩阵、检索准确率、混合精度与断点续训等工程实现。随后课程精讲Visual Prompt Tuning,讲清如何冻结ViT主干,仅靠浅层或深层可学习视觉prompt和分类头适配下游任务,并以少量参数逼近甚至超越全参数微调。适合具备一定深度学习基础、希望入门多模态、中文图文检索、CLIP应用或参数高效微调的学生、算法工程师和研究者。学完后,你能把CLIP从原理落到代码,把VPT从论文落到实现,并具备快速改造模型、完成下游任务实验的能力。

AI课程大纲

张旭波

对计算机视觉(图像分类,目标检测,语义分割),NLP,文生图以及GAN领域感兴趣。 B站:https://space.bilibili.com/625095571 CSDN博客:https://blog.csdn.net/Keep_Trying_Go? spm=1010.2135.3001.5421 GitHub: https://github.com/KeepTryingTo

评价

给该课程打分:

发表