从零实现 LLM 推理引擎:深挖 vLLM 的六大核心优化 2026-06-30 2026-07-22 AI LLM / AI Infra / vLLM / PagedAttention / 推理优化 / 投机解码 / 实习求职 通过可测试的 Python 实现,讲清 Paged KV Cache、Continuous Batching、Chunked Prefill 等六项推理优化。 0 | 0
Week 2:GPU 与推理加速——从 Kernel、算子融合到 LLM Serving 2026-05-05 2026-07-22 技术 深度学习 / GPU / 推理加速 / LLM / CMU 10-414 / vLLM / TensorRT 从 GPU 执行模型、Kernel 与算子融合出发,理解 KV Cache、batching 和 LLM Serving 的性能瓶颈。 0 | 0