深入探讨超大规模 AI 计算集群的建设,核心围绕“万卡AI集群”,从面临的存算网络协同、快速交付与紧张工期等挑战出发,详细解读从 L0 级机房布线到 L3 级上层软件的全栈建设方案,并涵盖万卡性能测试方法与真实客户场景应用。视频还将深度分析 NVIDIA Blackwell架 构与 BG200 芯片的技术演进,研究马斯克 XAI 十万卡集群的案例实践,最终延伸至对构建十万卡级别超大规模集群的前瞻性思考。

【AI集群原理】万卡AI集群
共10节 已有8人学过
主讲老师ZOMI
更新时间2025-12-31 14:06:07
课件资料暂无
免费
加载中...
课程介绍
讲师介绍

ZOMI
暂无讲师简介
AI课程导读
如果你关心大模型背后的算力底座,这门课值得完整学习。它不满足于罗列GPU参数,而是把万卡AI集群当作跨机房、跨硬件、网络、供电、散热、软件与调度的复杂系统工程,从建设挑战、整体方案、交付测试,到英伟达Blackwell架构、NVLink/NVSwitch网络、GH200/GB200超节点、xAI Colossus十万卡案例,逐步建立全栈认知。适合AI基础设施、算力平台、IDC、网络、运维、芯片与服务器架构、技术管理者,以及希望深入理解大模型训练底层的人。学完后,你将能识别能耗、网络、MFU、可靠性等核心瓶颈,理解L0-L3协同、硬装软装、测试验收、长稳与故障归因方法,看懂HGX、NVL72、SuperPOD等系统形态,并具备规划、选型、优化和评估万卡乃至十万卡集群的初步能力。
AI课程大纲
ZOMI
老师简介
评价
给该课程打分:
发表
