《LLM 推理优化与部署实战》LLMtlyhybs_ql_1.webp (18.64 KB, 下载次数: 271) 下载附件 保存到相册 LLM 推理优化与部署实战 (图1) 2026-1-14 14:54 上传【技能收获】学完可掌握:Docker / 容器化。课程以实战为导向,覆盖从基础概念到完整项目落地的关键步骤,配套章节笔记便于课后复盘与面试前快速回顾。【学习建议】建议按目录顺序学习,先打基础再进入综合实战章节;每完成 2~3 节可结合笔记整理一份学习小结,最终尝试独立复现一套完整 Demo 写入个人作品集。【就业发展】可面向岗位:AI 应用工程师、RAG 系统开发、Jav
看到"LLM 推理优化与部署实战"这个标题,很多人第一反应是以为教你怎么把模型跑起来。但真正拉开差距的从来不是"能跑",而是"跑得省、跑得稳、跑得可复现"。这门课的价值判断点就在这里:它把容器化作为落地底座,Docker 那部分不是凑数章节,而是决定你后面所有优化手段能不能被固化下来的前提。如果你之前部署模型靠的是"在我机器上明明能跑",这门课值得当正课看。
从主题能推断出的知识密度分布,大概有三处值得精看:
反过来,纯概念铺垫的章节可以快速扫过,不必逐帧跟。目录里如果出现大段基础介绍,用它建立词汇表就够了,不用当知识点背。
这类课程配套的东西通常混在一起,一股脑塞进收藏夹的结果就是再也不打开。建议按用途分:
笔记本身的价值在于压缩,别把它当成第二份教材来抄。每两三节写一段自己的话,比抄满一页更管用。
如果你已经在做 AI 应用侧的东西,比如搭过检索增强的问答、调过模型接口,但一到"自己部署、自己压性能"就发怵,这门课的容器化加推理这条线正好补上缺口。反过来,如果连基本的服务化概念都没有,先补网络和 Linux 基础再来,不然容器那几节会看得很痛苦。
学习路径上不建议一次刷完。挑一个自己熟悉的小模型当靶子,跟着课程把环境固化、服务封装、性能观察各做一遍,最后整理成一份能复现的记录。这份记录比看完多少节视频更能说明问题——面试时能讲清楚"我怎么把延迟压下来的",比列一串课程名有用得多。
LLMtlyhybs_ql_1.webp 下载附件 保存到相册 LLM 推理优化与部署实战 (图1) 2026-1-14 14:54 上传
课程推荐
《LLM 推理优化与部署实战》LLMtlyhybs_ql_1.webp 下载附件 保存到相册 LLM 推理优化与部署实战 (图1) 2026-1-14 14:54 上传【技能收获】学完可掌握:Docker / 容器化。课程以实战为导向,覆盖从基础概念到完整项目落地的关键步骤,配套章节笔记便于课后复盘与面试前快速回顾。【学习建议】建议按目录顺序学习,先打基础再进入综合实战章节;每完成 2~3 节可结合笔记整理一份学习小结,最终尝试独立复现一套完整 Demo 写入个人作品集。【就业发展】可面向岗位:AI 应用工程师、RAG 系统开发、Java 后端 + 大模型落地、企业知识库架构师。大模型应用岗需求持续走高,具备「后端 + RAG 落地」复合能力的人才在招聘市场更稀缺,简历中可突出完整项目链路而非仅会使用 API。 若你已有一定编程或运维基础,本课程可帮助你在现有技能栈上快速叠加热门方向能力,提升求职时的项目说服力与薪资谈判空间。
视频目录(66 节)
* 1-1 课程内容介绍.mp4
* 1-2 LLM推理基础-预填充与解码阶段.mp4
* 1-3 LLM推理基础-推理阶段与KVCache的关系.mp4
* 1-4 LLM推理基础-生成KVCache过程推演.mp4
* 1-5 LLM推理基础-为何需要对KVCache优化.mp4
* 1-6 LLM推理基础-如何估算模型占用内存.mp4
* 1-7 LLM推理基础-GPU内部运算原理与推理机制的关系.mp4
* 1-8 LLM推理基础-列举LLM存储介质以及如何搬运参数.mp4
* 1-9 LLM推理基础-优化思路-参数量化-运行时加速-IO优化.mp4
* 1-10 LLM推理基础-章节总结.mp4
* 1-11 LLM性能指标-内容介绍.mp4
* 1-12 LLM性能指标-推理评估指标全景图.mp4
* 1-13 LLM性能指标-首词生成时间.mp4
* 1-14 LLM性能指标-每词生成时间.mp4
* 1-15 LLM性能指标-端到端的请求时间.mp4
* 1-16 LLM性能指标-系统吞吐量TPS.mp4
* 1-17 LLM性能指标-业务指标SLO.mp4
* 1-18 LLM性能指标-评测过程与评测工具.mp4
* 1-19 LLM性能指标-章节总结.mp4
* 1-20 模型压缩-内容介绍.mp4
* 1-21 模型压缩-压缩策略-量化-剪枝-蒸馏.mp4
* 1-22 模型压缩-模型量化-参数存储空间的组成.mp4
* 1-23 模型压缩-模型量化前后使用的方法AWQ与GPTQ.mp4
* 1-24 模型压缩-AWQ针对PPL的实验结果.mp4
* 1-25 模型压缩-AWQ量化过程与实现-.mp4
* 1-26 模型压缩-GPTQ量化过程以及优化IO策略.mp4
* 1-27 模型压缩-GPTQ量化工具与实践.mp4
* 1-28 模型压缩-剪枝分类和过程详解.mp4
* 1-29 模型压缩-模型蒸馏分类和应用场景.mp4
* 1-30 模型压缩-章节总结.mp4
* 1-31 运行时加速方案-内容介绍.mp4
* 1-32 运行时加速方案-多头注意力机制原理与弊端.mp4
* 1-33 运行时加速方案-多头注意力计算过程与分析.mp4
* 1-34 运行时加速方案-MQA与GQA机制以及性能比较.mp4
* 1-35 运行时加速方案-GPU运算与数据传输分析.mp4
* 1-36 运行时加速方案-FlashAttention切块和算子.mp4
* 1-37 运行时加速方案-PagedAttention原理解析.mp4
* 1-38 运行时加速方案-持续批处理原理解析.mp4
* 1-39 运行时加速方案-核心推理框架选型.mp4
* 1-40 运行时加速方案-章节总结.mp4
* 1-41 推理部署实战指导与总结.mp4
* 2-1 vLLM产品介绍.mp4
* 2-2 vLLM分布式推理.mp4
* 2-3 显卡驱动安装与配置.mp4
* 2-4 Docker进行vLLM模型安装与部署.mp4
* 2-5 测试vLLM部署的大模型.mp4
* 2-6 vLLM分布式部署思路.mp4
* 2-7 系统构建网络配置和框架安装.mp4
* 2-8 Head和Worker节点配置创建推理集群.mp4
* 2-9 测试vLLM分布式部署.mp4
* 3-1 量化实战-量化目的与结果介绍.mp4
* 3-2 量化实战-思路与实战步骤讲解.mp4
* 3-3 量化实战-了解硬件架构量化工具.mp4
* 3-4 量化实战-安装WSL与Conda.mp4
* 3-5 TensorRT模型优化器安装与配置.mp4
* 3-6 NVFP4量化格式.mp4
* 3-7 模型量化脚本解析与校准数据集.mp4
* 3-8 模型量化以及结果查看.mp4
* 3-9 测试量化之后模型查看返回结果.mp4
* 3-10 介绍EvalScope与Perf命令组成.mp4
* 3-11 使用EvalScope评测量化模型.mp4
* 3-12 介绍LLMCompressor量化工具.mp4
* 3-13 安装LLMCompressor.mp4
* 3-14 使用LLMCompressor对GPTQ-AWQ-NV.mp4
* 3-15 针对两种量化工具比较四种量化结果.mp4
* 3-16 量化实战-课程总结.mp4