Skip to content

Part 2 L1 202606 | 组队学习口记录 ​

1. 概览 ​

本周期面向 Part 2 的 L1 学习内容,用于记录这一次组队学习的计划、Task 笔记、助教出题和讨论复盘。

2. 学习主线 ​

按下面这条 Part 2 主线推进: ​

  • 从 基础算子 到 注意力, 从 注意力 到 模型组装,从 模型组装 到 MoE,从 MoE 到 训练与微调
Task1:PyTorch 入门与基础算 - 00 PyTorch Warmup - 01 RMSNorm Tutorial ​
Task2:激活函数与位置编码 - 02 SwiGLU Activation- 03 RoPE Tutorial ​
Task 3:Attention 核心实现 - 04 Attention MHA/GQA ​
Task4:模型块组装 - 05 LLaMA3 Block Tutorial - 06 MoE Router ​
Task5:MoE 与结构技巧 - 07 MoE Load Balancing Loss - 08 Architecture Tricks ​
Task6:训练、微调与学习率策略 - 09 SFT Training Loop - 10 LoRA Tutorial - 11 Optimizer Updates and Learning Rate Scheduling ​

3. 群内讨论 ​

Top 10 大模型算法系统核心基础知识

为什么说“传统初学者容易犯的错误是先选 Top-K 的 logits,再做 Softmax”?

4. 助教出题 ​

【每日竞答集锦】https://my.feishu.cn/docx/XmJhdlEWIoPoXyxYeCZcd9K3n0c?from=from_copylink

5. 优秀笔记 ​

所有笔记在一个地址 ​

具体任务以及对应优秀笔记 ​

Task 1:PyTorch 入门与基础算子 ​

Task 2:激活函数与位置编码 ​

Task 3:Attention 核心实现 ​

Task4:模型块组装 ​

Task5:MoE 与结构技巧 ​

Task6:训练、微调与学习率策略 ​

6. 状态 ​

已完成

Released under the MIT License.