课程封面

zero-shot多模态任意类别的目标统计

共15节 已有12人学过

主讲老师张旭波

更新时间2025-12-09 15:25:01

课件资料暂无

免费

加载中...

课程介绍

今天我将为大家介绍零样本多模态目标计数算法。这类算法能够在不依赖特定类别训练数据的情况下,精确统计图像中的目标数量。核心思想是结合视觉示例文本描述两种模态信息,实现灵活的目标指定与计数。

我们将重点解析基于视觉语言模型的先进方法,展示如何利用CLIP等预训练模型,通过对比学习将图像特征与文本/视觉示例嵌入对齐。课程将涵盖关键技术创新,包括跨模态注意力机制、动态掩码预测、以及用于处理类别不平衡的改进损失函数。

通过实际案例,您将了解算法如何同时接受“红色苹果”的文本描述和一个苹果的视觉示例,准确识别并统计图中所有红色苹果。我们还将探讨算法在开放场景中的实际应用与性能边界。

讲师介绍

讲师头像

张旭波

https://github.com/KeepTryingTo?tab=repositories https://blog.csdn.net/Keep_Trying_Go?spm=1010.2135.3001.10640 https://space.bilibili.com/625095571?spm_id_from=333.1007.0.0

AI课程导读

本课程系统讲解目标计数与目标统计的前沿方法,从 CounTR、WeCount、CLIP-Count 到零样本、开放词汇与多模态统计模型,串联理论、代码、训练和推理全流程。课程核心价值在于:不仅讲清密度图计数、特征交互、MAE 预训练、Mosaic 增强、滑窗归一化等关键技术,还深入 CLIP、Grounding DINO、类别原型、误差预测器、排序损失与跨模态解码器等热门方案,帮助你建立“任意类别、文本或样例指定”的通用计数框架。 适合计算机视觉研究者、算法工程师、研究生,以及从事人群计数、开放词汇检测、多模态理解或密集目标统计的开发者。学习后将掌握从数据构造、正负样本筛选、模型微调到测试推理的完整链路,能读懂并复现主流目标计数代码,理解如何提升模型泛化能力、类别敏感性与计数精度,为科研和工程落地打下扎实基础。

AI课程大纲

张旭波

https://github.com/KeepTryingTo?tab=repositories https://blog.csdn.net/Keep_Trying_Go?spm=1010.2135.3001.10640 https://space.bilibili.com/625095571?spm_id_from=333.1007.0.0

评价

给该课程打分:

发表