学习站 · inference.xph.ink
模型部署与推理优化
模型部署与推理优化(Model Deployment & Inference Optimization)研究的是训练完成后那段路:如何让大语言模型以可接受的延迟、吞吐、显存占用与成本,稳定地跑在云端 GPU 集群、公司内网服务器或用户的手机与笔记本上。它不是训练技术的延伸课,而是一门独立学科——训练追求的是 loss,部署追求的是「每瓦特、每美元、每毫秒」下的 token 产出。
7模块
29知识点
665分钟总时长
4入门 / 14核心 / 9进阶 / 2前沿难度分布
总体学习进度0%
最小可用路径(约 180 分钟)
从零把一个 7B 模型部署进生产并会排查故障的最短闭环。