分类
AI
QLoRA 精读:4-bit 量化如何把 65B 微调压进单卡
从 NF4、双重量化、Paged Optimizer 与全层 LoRA 出发,拆解 QLoRA 的显存账本、训练流程、实验边界和复现要点。
2
|
0
Transformer、ViT 与 CLIP 基础:从三篇代表论文到高频面试题
以三篇代表论文为主线,串起 Transformer、Vision Transformer 与 CLIP 的结构、目标和面试高频题。
5
|
0
从零实现多模态 RAG:BM25、Dense 检索、RRF 融合、MMR 重排全部手写
用纯 NumPy 手写 BM25、Dense 检索、RRF 融合和 MMR 重排,构建可评测的多模态 RAG。
3
|
0
从零实现 LLM 推理引擎:深挖 vLLM 的六大核心优化
通过可测试的 Python 实现,讲清 Paged KV Cache、Continuous Batching、Chunked Prefill 等六项推理优化。
3
|
0
Nanotron 项目详解:Hugging Face 的大模型预训练框架怎么做分布式训练
从 3D 并行、ZeRO、Pipeline Schedule 和 Checkpoint 拆解 Hugging Face 大模型预训练框架。
7
|
0