🚀 第一篇:性能工程与系统前置基石 (Performance Engineering & Systems Baseline)
主讲人:👓 Ringi(大厂 AI Infrastructure 工程师)
模块定位:必修基础 | 建议时长:10~12h
适用对象:会 Python/懂一点 PyTorch、希望系统建立 AI Infra 底层硬件、C++、操作系统与性能建模心智模型的初学者。
🎯 为什么设置系统前置模块?
在深入写 CUDA Kernel 或千卡分布式训练之前,我们必须打通从 编程语言 (C++/Python) 数学与算子 操作系统/CPU体系结构 PyTorch内部机制 集合通信 性能工程三账本 的完整知识链路。 本模块参考了caomaolufei/AIInfraGuide 模块一前置知识体系,并注入了 Ringi 工程师的实战视角,帮助零基础与初学者扫清所有底层认知障碍!
📑 模块全景章节目录(11 讲系统递进)
🛠️ 模块学习建议与检验标准
- 动手跑代码:每一讲均配有最小可运行验证代码,请在本地 Python / PyTorch 环境中亲自运行并观察输出。
- 白板手算:合上代码,能够手算 GEMM 计算量、Tensor Strides 物理偏移量与模型三账本。
- 完成 Profiling 实验:掌握通过
chrome://tracing分析性能瓶颈的核心工程方法。
返回主目录:《Ringi AI Infra 学习体系全景地图》