infra规划 AI Infra 学习与研究路线 1. 总体目标 目标定位 未来 2~3 年主攻: 分布式训练与通信优化 + LLM 推理 Infra 最终形成: 1234567891011121314151617 AI Infra │ ┌────────────┴────────────┐ ↓ 2026-08-12 学习 #AI Infra #学习路线
LLM中的数学原理及infra优化 引言 本文将拆解大模型中几个核心操作(RMSNorm、Softmax、Causal Mask、Sampling)背后的数学与 Infra 优化逻辑。看完你会发现,Infra 优化,本质上就是在用数学上的等价变换,或者对精度的适度妥协,去换取更高的硬件利用率和极致的推理速度。 1.RMSNorm - 均方根归一化 大语言模型(Transformer 结构)通常包含数十甚至上百个堆叠的隐藏层(如 Tr 2026-08-09 学习 #LLM #ai infra #学习
Triton_learning GPU简介 1. CPU vs GPU 的比喻 CPU:像一个数学教授,非常聪明,能做复杂的计算,但只有十几双手(核心数少,比如8核、16核)。 GPU:像1000个小学生,每个只会做简单的加法,但人数超多(几千个核心),可以同时处理大量简单任务。 向量加法就是典型的"简单任务重复无数遍",特别适合GPU。 2. GPU 的结构 GPU 上有成千上万个 线程(thread) 2026-08-06 学习 #ai infra #学习 #GPU
FlashAttention FlashAttention 一、Introduction 为了加快LLM的训练和推理速度,针对transformer注意力机制的特点和GPU等硬件结构,通过分块和重计算来减少HBM读写次数,进而加快注意力计算的一种优化算法。 二、 Background 2.1 硬件特性 GPU的内存结构如上图左侧所示: SRAM是GPU的片上内存,GPU计算时必须先把数据搬运到SRAM上才能进行计算。内存最小 2026-08-04 学习 #LLM #ai infra
欢迎来到我的博客 你好呀,欢迎来到我的博客 👋 这里会用来记录我的学习笔记和日常生活: 📚 学习:技术文章、读书笔记、学习心得 🌱 生活:日常随笔、旅行记录、成长感悟 ✍️ 如何写一篇新文章 方式一:命令行创建(适合纯文本文章) 在项目根目录运行: 1npx hexo new post 文章标题 然后编辑 source/_posts/ 下生成的 Markdown 文件,文章会自动出现在首页。 方式二:T 2026-08-04 随笔 #欢迎 #开始