IT网课学习吧

深入理解 GPU 计算: CUDA 编程指南

AI
课程简介

《深入理解 GPU 计算: CUDA 编程指南》QQ_1762159623444.webp (419.74 KB, 下载次数: 67) 下载附件   保存到相册 2025-11-3 16:47 上传【技能收获】学完可掌握:Embedding 向量检索。课程以实战为导向,覆盖从基础概念到完整项目落地的关键步骤,配套章节笔记便于课后复盘与面试前快速回顾。【学习建议】建议按目录顺序学习,先打基础再进入综合实战章节;每完成 2~3 节可结合笔记整理一份学习小结,最终尝试独立复现一套完整 Demo 写入个人作品集。【就业发展】可面向岗位:AI 应用工程师、RAG 系统开发、Java 后端 +

已有 1 人浏览 发布 2026-09-14 更新 2026-09-14

这门课的名字叫《深入理解 GPU 计算: CUDA 编程指南》,乍一看像是又一份"照着官方文档念一遍"的教程。但把课纲摊开来看,它的落点其实不在 CUDA API 本身,而是想把你带到"能自己判断一段代码为什么跑不满 GPU"的位置上。对收藏党来说,这门课的价值不在于它覆盖了多少个函数,而在于它把 GPU 执行模型这条主线讲透了,剩下的边角料你可以自己补。

课纲的含金量集中在执行模型这一块

市面上讲 CUDA 的内容,八成时间花在"怎么把 for 循环改成 kernel"上,剩下两成讲怎么调库。这门课的顺序不太一样,它把线程层次、warp 调度、内存层级放在很靠前的位置,先让你建立"一块 GPU 上到底发生了什么"的图景,再回到代码。这个顺序对自学者更友好——因为 CUDA 的坑几乎都出在模型理解上,而不是语法上。语法你查手册十分钟就能会,但为什么 shared memory 用错了反而更慢、为什么 occupancy 高不等于性能好,这些只有先有模型才能想明白。

这几类章节建议精看,其余可以快过

  • 线程组织与索引计算。看着简单,但 grid-stride loop、边界判断、多维索引的写法直接决定后面所有 kernel 的正确性。这一块值得动手把每个例子重写一遍。
  • 内存层级与访问模式。global、shared、寄存器、常量内存之间的取舍,是 CUDA 性能差异的主要来源。课纲里凡是涉及 bank conflict、合并访问、cache 行为的部分,都建议逐段推敲,不要跳过。
  • 同步与通信。__syncthreads 的语义、warp 内 shuffle、原子操作这几节,属于"用错一次就记一辈子"的类型,精读性价比很高。
  • 性能分析与调优思路。如果课里有 profiling 工具相关的章节,把它当成方法论来学,而不是当成工具说明书。工具会换,思路不会。

相对可以快过的,是环境搭建、编译命令、基础语法罗列这些部分。不是说不重要,而是这些内容查文档效率更高,没必要在课程里耗时间。

资料包别整包吞,按用途拆开

这类课程的配套资料通常混着讲义、示例代码、笔记和截图。比较实用的拆法是三份:一份是随课讲义,用来对照视频确认自己没漏掉关键概念;一份是示例代码,要单独拎出来跑,改参数、改 block 尺寸、改内存布局,看性能数字怎么变——这是这门课真正的练习;还有一份是复习笔记,留到面试前或者写项目卡住时再翻,平时不必反复看。截图类的东西大多只是环境或界面示意,扫一眼即可,不用存。

学完之后你能拿它做什么

老实说,学完这门课你不会立刻变成 GPU 性能工程师,但你会具备两样东西:一是读得懂别人写的 kernel 并说出它大概快在哪、慢在哪;二是遇到"模型推理慢"这类问题时,知道该往哪个方向查,而不是只会调 batch size。往近了说,这对做推理加速、算子优化、甚至只是想让自己的训练脚本别浪费卡时的人,都是实打实的分水岭。往远了说,CUDA 这套执行模型的思维方式,在别的并行框架里也复用得上。

建议的学习节奏是:模型章节慢,语法章节快,示例代码一定要自己跑一遍再改一遍。每过两三节回头整理一次"这一节解决的问题是什么",比抄笔记有用得多。


QQ_1762159623444.webp 下载附件   保存到相册 2025-11-3 16:47 上传

课程推荐

《深入理解 GPU 计算: CUDA 编程指南》QQ_1762159623444.webp 下载附件   保存到相册 2025-11-3 16:47 上传【技能收获】学完可掌握:Embedding 向量检索。课程以实战为导向,覆盖从基础概念到完整项目落地的关键步骤,配套章节笔记便于课后复盘与面试前快速回顾。【学习建议】建议按目录顺序学习,先打基础再进入综合实战章节;每完成 2~3 节可结合笔记整理一份学习小结,最终尝试独立复现一套完整 Demo 写入个人作品集。【就业发展】可面向岗位:AI 应用工程师、RAG 系统开发、Java 后端 + 大模型落地、企业知识库架构师。大模型应用岗需求持续走高,具备「后端 + RAG 落地」复合能力的人才在招聘市场更稀缺,简历中可突出完整项目链路而非仅会使用 API。 若你已有一定编程或运维基础,本课程可帮助你在现有技能栈上快速叠加热门方向能力,提升求职时的项目说服力与薪资谈判空间。

视频目录(99 节)

*   1 课程介绍.mp4

*   2 什么是 GPU 计算.mp4

*   3 GPU 硬件架构综述.mp4

*   4 处理器空间.mp4

*   5 内存空间.mp4

*   6 GPU 计算能力.mp4

*   7 如何编写 CUDA 程序.mp4

*   8 如何编译 CUDA 程序.mp4

*   9 函数修饰符.mp4

*   10 内存修饰符.mp4

*   11 内建-内置向量.mp4

*   12 内建变量.mp4

*   13 CUDA 编程模型.mp4

*   14 CUDA 程序执行与硬件映射.mp4

*   15 程序解析- 向量加法.mp4

*   16 主机函数- __host__.mp4

*   17 设备函数- __device__.mp4

*   18 核函数- __global__.mp4

*   19 网格.mp4

*   20 线程块.mp4

*   21 网格维度- gridDim.mp4

*   22 线程块维度- blockDim.mp4

*   23 线程块 ID- blockIdx.mp4

*   24 线程 ID- threadIdx.mp4

*   25 线程调度.mp4

*   26 线程块与线程映射.mp4

*   27 例子- 向量加法.mp4

*   28 如何启动核函数.mp4

*   29 线程执行顺序.mp4

*   30 GPU 内存介绍.mp4

*   31 CPU 内存介绍.mp4

*   32 页锁定内存.mp4

*   33 GPU 内存如何管理.mp4

*   34 CPU 内存管理.mp4

*   35 页锁定内存管理.mp4

*   36 全局内存管理.mp4

*   37 例子- 全局内存.mp4

*   38 什么是共享内存.mp4

*   39 共享内存冲突.mp4

*   40 共享内存 Bank.mp4

*   41 共享内存 bank 冲突- 计算能力 1.x.mp4

*   42 共享内存 bank 冲突- 计算能力 2.0 及以上.mp4

*   43 共享内存应用- 加**约.mp4

*   44 内存拷贝- cudaMemcpy.mp4

*   45 例子- 内存管理.mp4

*   46 内存空间类型查询 (Address Space).mp4

*   47 向量操作.mp4

*   48 稀疏矩阵存储格式.mp4

*   49 稀疏矩阵向量乘法 (SpMV).mp4

*   50 什么是同步.mp4

*   51 核函数同步.mp4

*   52 线程块同步.mp4

*   53 Warp 同步.mp4

*   54 Warp 同步概述.mp4

*   55 什么是规约算法- 如何并行.mp4

*   56 并行规约算法-1- 二叉树算法.mp4

*   57 并行规约算法-2- 改进 warp divergence.mp4

*   58 并行规约算法-3- 改进共享内存访问 消除冲突.mp4

*   59 并行规约算法-4- 改进全局内存访问.mp4

*   60 并行规约算法-5- warp 内循环展开.mp4

*   61 并行规约算法-6- 完全循环展开.mp4

*   62 并行规约算法:成功优化的关键.mp4

*   63 完整并行规约算法: 三阶段算法与完整代码.mp4

*   64 并行规约算法应用- 内积.mp4

*   65 线程调度概述.mp4

*   66 Warp 投票函数.mp4

*   67 Warp 匹配函数.mp4

*   68 Warp 规约操作.mp4

*   69 Warp 内通信- 交换数据.mp4

*   70 例子- __activemask.mp4

*   71 例子- __ballot_sync.mp4

*   72 例子- __shfl_down_sync.mp4

*   73 例子- warp 内广播.mp4

*   74 例子- warp 内 scan 操作 (扫描).mp4

*   75 例子- warp 内规约操作.mp4

*   76 Cooperative Groups (合作组).mp4

*   77 隐式组类型 (内建组类型- 内置组类型).mp4

*   78 例子- 向量加法-1645693606.mp4

*   79 显式棋盘组划分 (Tiled Partition).mp4

*   80 合并组 (Coalesced Groups).mp4

*   81 例子- 合并组.mp4

*   82 例子- warp 内广播-1645693728.mp4

*   83 例子- warp 内广播 2.mp4

*   84 组划分 (tiled_partition).mp4

*   85 组划分- labeled_partition.mp4

*   86 例子- 合并组标记划分.mp4

*   87 组划分- binary_partition.mp4

*   88 例子- 合并组二分划分.mp4

*   89 组同步.mp4

*   90 网格组同步.mp4

*   91 规约操作 (Reduce).mp4

*   92 例子- 规约算法 1.mp4

*   93 例子- 规约算法 2.mp4

*   94 例子- 规约算法 3.mp4

*   95 例子- 规约算法 4.mp4

*   96 CUDA 程序概述.mp4

*   97 CUDA 程序优化- 探索并行化.mp4

*   98 CUDA 程序优化- GPU 内存优化策略.mp4

*   99 CUDA 程序优化- 指令优化.mp4

课程购买
课程价格
金币29.9
299金币限时优惠会员免费
销量:0
💎 开通会员每日免费下载,比单买更划算 →
支付成功后会自动显示下载资源云盘的链接!点击链接即可下载到本地。