IT网课学习吧

LLM 推理优化与部署实战

AI
课程简介

《LLM 推理优化与部署实战》LLMtlyhybs_ql_1.webp (18.64 KB, 下载次数: 271) 下载附件   保存到相册 LLM 推理优化与部署实战 (图1) 2026-1-14 14:54 上传【技能收获】学完可掌握:Docker / 容器化。课程以实战为导向,覆盖从基础概念到完整项目落地的关键步骤,配套章节笔记便于课后复盘与面试前快速回顾。【学习建议】建议按目录顺序学习,先打基础再进入综合实战章节;每完成 2~3 节可结合笔记整理一份学习小结,最终尝试独立复现一套完整 Demo 写入个人作品集。【就业发展】可面向岗位:AI 应用工程师、RAG 系统开发、Jav

已有 1 人浏览 发布 2026-09-14 更新 2026-09-18

先把判断说在前面:这门课的重心不在"跑通一个模型"

看到"LLM 推理优化与部署实战"这个标题,很多人第一反应是以为教你怎么把模型跑起来。但真正拉开差距的从来不是"能跑",而是"跑得省、跑得稳、跑得可复现"。这门课的价值判断点就在这里:它把容器化作为落地底座,Docker 那部分不是凑数章节,而是决定你后面所有优化手段能不能被固化下来的前提。如果你之前部署模型靠的是"在我机器上明明能跑",这门课值得当正课看。

课纲里含金量偏高的几块

从主题能推断出的知识密度分布,大概有三处值得精看:

  • 容器化与运行环境固化——镜像分层、依赖锁定、资源限制这些内容如果讲得细,是能直接搬到工作里的。这部分建议放慢速度,因为它决定了后面每一次实验的可对比性。
  • 推理环节的性能话题——显存占用、批处理、并发请求下的表现,是这类课最容易讲空的地方。看的时候重点留意有没有给出可量化的对比,而不是只讲概念。
  • 部署形态的选择——把模型封装成可被外部调用的服务,这一段的工程细节(接口设计、启动流程、异常处理)往往比模型本身更影响实际体验。

反过来,纯概念铺垫的章节可以快速扫过,不必逐帧跟。目录里如果出现大段基础介绍,用它建立词汇表就够了,不用当知识点背。

资料包别整包吞,按用途拆成三层

这类课程配套的东西通常混在一起,一股脑塞进收藏夹的结果就是再也不打开。建议按用途分:

  • 可执行层——环境配置、启动脚本这类,直接落在本地跑一遍,跑不通再回头找笔记,这是唯一必须动手的部分。
  • 复盘层——章节笔记留到第二遍再看,第一遍看视频时不要开着笔记对照,会打断节奏。
  • 索引层——课程整体结构图之类的,作用只是帮你定位"某个问题大概在第几块",不需要精读。

笔记本身的价值在于压缩,别把它当成第二份教材来抄。每两三节写一段自己的话,比抄满一页更管用。

适合谁,以及怎么用才不白学

如果你已经在做 AI 应用侧的东西,比如搭过检索增强的问答、调过模型接口,但一到"自己部署、自己压性能"就发怵,这门课的容器化加推理这条线正好补上缺口。反过来,如果连基本的服务化概念都没有,先补网络和 Linux 基础再来,不然容器那几节会看得很痛苦。

学习路径上不建议一次刷完。挑一个自己熟悉的小模型当靶子,跟着课程把环境固化、服务封装、性能观察各做一遍,最后整理成一份能复现的记录。这份记录比看完多少节视频更能说明问题——面试时能讲清楚"我怎么把延迟压下来的",比列一串课程名有用得多。


LLMtlyhybs_ql_1.webp 下载附件   保存到相册 LLM 推理优化与部署实战 (图1) 2026-1-14 14:54 上传

课程推荐

《LLM 推理优化与部署实战》LLMtlyhybs_ql_1.webp 下载附件   保存到相册 LLM 推理优化与部署实战 (图1) 2026-1-14 14:54 上传【技能收获】学完可掌握:Docker / 容器化。课程以实战为导向,覆盖从基础概念到完整项目落地的关键步骤,配套章节笔记便于课后复盘与面试前快速回顾。【学习建议】建议按目录顺序学习,先打基础再进入综合实战章节;每完成 2~3 节可结合笔记整理一份学习小结,最终尝试独立复现一套完整 Demo 写入个人作品集。【就业发展】可面向岗位:AI 应用工程师、RAG 系统开发、Java 后端 + 大模型落地、企业知识库架构师。大模型应用岗需求持续走高,具备「后端 + RAG 落地」复合能力的人才在招聘市场更稀缺,简历中可突出完整项目链路而非仅会使用 API。 若你已有一定编程或运维基础,本课程可帮助你在现有技能栈上快速叠加热门方向能力,提升求职时的项目说服力与薪资谈判空间。

视频目录(66 节)

*   1-1 课程内容介绍.mp4

*   1-2 LLM推理基础-预填充与解码阶段.mp4

*   1-3 LLM推理基础-推理阶段与KVCache的关系.mp4

*   1-4 LLM推理基础-生成KVCache过程推演.mp4

*   1-5 LLM推理基础-为何需要对KVCache优化.mp4

*   1-6 LLM推理基础-如何估算模型占用内存.mp4

*   1-7 LLM推理基础-GPU内部运算原理与推理机制的关系.mp4

*   1-8 LLM推理基础-列举LLM存储介质以及如何搬运参数.mp4

*   1-9 LLM推理基础-优化思路-参数量化-运行时加速-IO优化.mp4

*   1-10 LLM推理基础-章节总结.mp4

*   1-11 LLM性能指标-内容介绍.mp4

*   1-12 LLM性能指标-推理评估指标全景图.mp4

*   1-13 LLM性能指标-首词生成时间.mp4

*   1-14 LLM性能指标-每词生成时间.mp4

*   1-15 LLM性能指标-端到端的请求时间.mp4

*   1-16 LLM性能指标-系统吞吐量TPS.mp4

*   1-17 LLM性能指标-业务指标SLO.mp4

*   1-18 LLM性能指标-评测过程与评测工具.mp4

*   1-19 LLM性能指标-章节总结.mp4

*   1-20 模型压缩-内容介绍.mp4

*   1-21 模型压缩-压缩策略-量化-剪枝-蒸馏.mp4

*   1-22 模型压缩-模型量化-参数存储空间的组成.mp4

*   1-23 模型压缩-模型量化前后使用的方法AWQ与GPTQ.mp4

*   1-24 模型压缩-AWQ针对PPL的实验结果.mp4

*   1-25 模型压缩-AWQ量化过程与实现-.mp4

*   1-26 模型压缩-GPTQ量化过程以及优化IO策略.mp4

*   1-27 模型压缩-GPTQ量化工具与实践.mp4

*   1-28 模型压缩-剪枝分类和过程详解.mp4

*   1-29 模型压缩-模型蒸馏分类和应用场景.mp4

*   1-30 模型压缩-章节总结.mp4

*   1-31 运行时加速方案-内容介绍.mp4

*   1-32 运行时加速方案-多头注意力机制原理与弊端.mp4

*   1-33 运行时加速方案-多头注意力计算过程与分析.mp4

*   1-34 运行时加速方案-MQA与GQA机制以及性能比较.mp4

*   1-35 运行时加速方案-GPU运算与数据传输分析.mp4

*   1-36 运行时加速方案-FlashAttention切块和算子.mp4

*   1-37 运行时加速方案-PagedAttention原理解析.mp4

*   1-38 运行时加速方案-持续批处理原理解析.mp4

*   1-39 运行时加速方案-核心推理框架选型.mp4

*   1-40 运行时加速方案-章节总结.mp4

*   1-41 推理部署实战指导与总结.mp4

*   2-1 vLLM产品介绍.mp4

*   2-2 vLLM分布式推理.mp4

*   2-3 显卡驱动安装与配置.mp4

*   2-4 Docker进行vLLM模型安装与部署.mp4

*   2-5 测试vLLM部署的大模型.mp4

*   2-6 vLLM分布式部署思路.mp4

*   2-7 系统构建网络配置和框架安装.mp4

*   2-8 Head和Worker节点配置创建推理集群.mp4

*   2-9 测试vLLM分布式部署.mp4

*   3-1 量化实战-量化目的与结果介绍.mp4

*   3-2 量化实战-思路与实战步骤讲解.mp4

*   3-3 量化实战-了解硬件架构量化工具.mp4

*   3-4 量化实战-安装WSL与Conda.mp4

*   3-5 TensorRT模型优化器安装与配置.mp4

*   3-6 NVFP4量化格式.mp4

*   3-7 模型量化脚本解析与校准数据集.mp4

*   3-8 模型量化以及结果查看.mp4

*   3-9 测试量化之后模型查看返回结果.mp4

*   3-10 介绍EvalScope与Perf命令组成.mp4

*   3-11 使用EvalScope评测量化模型.mp4

*   3-12 介绍LLMCompressor量化工具.mp4

*   3-13 安装LLMCompressor.mp4

*   3-14 使用LLMCompressor对GPTQ-AWQ-NV.mp4

*   3-15 针对两种量化工具比较四种量化结果.mp4

*   3-16 量化实战-课程总结.mp4

课程购买
课程价格
金币29.9
299金币限时优惠会员免费
销量:0
💎 开通会员每日免费下载,比单买更划算 →
支付成功后会自动显示下载资源云盘的链接!点击链接即可下载到本地。