标签
LLM
QLoRA 精读:4-bit 量化如何把 65B 微调压进单卡
从 NF4、双重量化、Paged Optimizer 与全层 LoRA 出发,拆解 QLoRA 的显存账本、训练流程、实验边界和复现要点。
0
|
0
LLM 技术路线:从 Transformer 到训练、推理与应用
一份系统化 LLM 学习路线,覆盖 Transformer、预训练、SFT、RLHF、RAG、Agent、推理优化、评测和工程项目。
1
|
0
从零实现 LLM 推理引擎:深挖 vLLM 的六大核心优化
通过可测试的 Python 实现,讲清 Paged KV Cache、Continuous Batching、Chunked Prefill 等六项推理优化。
0
|
0
Claude Code 上下文管理:请求前减负、Auto Compact 与应急恢复
基于源码区分请求前优化、高水位压缩和 API 报错恢复,厘清 Microcompact、Full Compact 与 Auto Compact 的关系。
0
|
0
Nanotron 项目详解:Hugging Face 的大模型预训练框架怎么做分布式训练
从 3D 并行、ZeRO、Pipeline Schedule 和 Checkpoint 拆解 Hugging Face 大模型预训练框架。
0
|
0
Week 2:GPU 与推理加速——从 Kernel、算子融合到 LLM Serving
从 GPU 执行模型、Kernel 与算子融合出发,理解 KV Cache、batching 和 LLM Serving 的性能瓶颈。
0
|
0
MiniCode 源码解析:用 5000 行 TypeScript 实现一个 AI 编程助手
从入口、Agent Loop、工具注册和终端 UI 拆解一个 5000 行 TypeScript AI 编程助手。
0
|
0