2026
10 篇文章
07-28
Dynamic-LLaVA 精读:同时压缩视觉 Token 与生成上下文
07-27
VideoLISA 精读:多模态模型的训练侧视频分割适配
07-23
SparseVLM 精读:让问题决定保留哪些视觉 Token
07-23
InstructBLIP 精读:让视觉特征听懂任务指令
07-22
从 PyTorch 到 CUDA Kernel:融合 RMSNorm 在 RTX 4090D 上加速 4.27 倍
07-22
DeeR-VLA 精读:用动态早退加速多模态机器人推理
07-22
TD-MPC2 精读:用隐式世界模型统一 104 个连续控制任务
07-21
Yo'LLaVA 精读:用 16 个软 Token 记住你的专属视觉概念
07-21
FlashAttention-3 精读:用异步流水与 FP8 加速 Hopper Attention
07-20
DCCF 精读:把跨模态冲突当作假新闻证据