课程封面

【大模型算法】Transformer架构

共7节 已有18人学过

主讲老师ZOMI

更新时间2025-09-29 15:07:39

课件资料暂无

免费

加载中...

课程介绍

深入探讨超大规模 AI 计算集群的建设,核心围绕“万卡AI集群”,从面临的存算网络协同、快速交付与紧张工期等挑战出发,详细解读从 L0 级机房布线到 L3 级上层软件的全栈建设方案,并涵盖万卡性能测试方法与真实客户场景应用。视频还将深度分析 NVIDIA Blackwell架 构与 BG200 芯片的技术演进,研究马斯克 XAI 十万卡集群的案例实践,最终延伸至对构建十万卡级别超大规模集群的前瞻性思考。

讲师介绍

讲师头像

ZOMI

暂无讲师简介

AI课程导读

本课程从RNN/LSTM/Seq2Seq讲到Transformer、BERT/GPT,再深入Tokenizer、Input Embedding与RoPE、Attention及其MHA/MQA/GQA/MLA变种、长上下文架构和参数配比,形成一条从文本输入、核心机制到工程部署的完整认知链。它的核心价值在于不止讲概念,更解释大模型为什么能规模化、长上下文如何实现、KV Cache与显存吞吐如何权衡,以及Qwen、Llama、DeepSeek等模型在架构与参数上的取舍。适合大模型初学者、算法转行人员,以及从事应用开发、微调、推理部署和模型选型的工程师。学完后,你将掌握QKV、Self-Attention、Masked Attention、RoPE、GQA/MLA、MoE与config解读等关键知识,能区分BERT与GPT路线,读懂主流模型配置,并为后续微调、推理优化和架构分析打下扎实基础。

AI课程大纲

ZOMI

老师简介

评价

给该课程打分:

发表