1. 中文系统性课程/教程(强烈推荐起步)
Datawhale diy-llm(GitHub):系统性大语言模型构建课程,覆盖预训练数据工程、Tokenizer、Transformer、MoE、GPU编程(CUDA/Triton)、分布式训练、Scaling Laws、推理优化及对齐(SFT/RLHF/GRPO)。有渐进式作业和代码,专为中文学习者设计。 地址:https://github.com/datawhalechina/diy-llm
Datawhale so-large-lm:大模型基础知识系统教程,从数据准备、模型构建、训练策略到评估与安全。 地址:https://github.com/datawhalechina/so-large-lm
上海交大《动手学大模型》(Dive into LLMs):高星开源实践教程(GitHub 数万 Star),用 Jupyter Notebook 覆盖微调与部署、Prompt工程、知识编辑、数学推理、RLHF、多模态等,配课件和代码,完全免费。 地址:https://github.com/Lordog/dive-into-llms(或相关 fork)
SwanLab 大模型训练课程:偏实践,涵盖预训练、微调(Qwen、GLM 等)、指令微调、LLaMA-Factory 等,配套代码。 地址:https://docs.swanlab.cn/course/llm_train_course/
其他实用中文项目:LLaMA-Factory(一站式微调框架)、MiniMind(低成本从零训练极简模型)、各种 CSDN/掘金实战教程(搜索“手把手训练大模型”)。
2. 英文高质量课程与从零实现
Andrej Karpathy 的系列视频(必看):
Neural Networks: Zero to Hero(从反向传播到 GPT 从零实现)。
Let’s build GPT: from scratch, in code, spelled out(约 2 小时手写 GPT)。 YouTube 搜索即可,代码风格极简清晰。
Sebastian Raschka《Build a Large Language Model (From Scratch)》:书籍 + GitHub 仓库(高星),用 PyTorch 完整走通 tokenization、attention、预训练、微调。配套视频和 notebook。 官网:https://sebastianraschka.com/llms-from-scratch/ GitHub:https://github.com/rasbt/LLMs-from-scratch
Hugging Face LLM Course(原 NLP Course 升级版):免费,覆盖 Transformers、Datasets、Tokenizers、微调、推理模型等,实操性强。 地址:https://huggingface.co/course 或 https://huggingface.co/learn
Maxime Labonne 的 LLM Course:分为 LLM Scientist(训练/对齐)和 LLM Engineer(应用),资源集合很全。 GitHub:https://github.com/mlabonne/llm-course
Hugging Face smol-course:专注小模型对齐(Instruction Tuning、DPO、评估等),适合消费级硬件上手。 地址:https://huggingface.co/learn/smol-course
其他:Stanford CS324(Large Language Models)、DeepLearning.AI 相关课程(如 Fine-tuning & RL for LLMs)、Weights & Biases 的 Training LLMs 课程。
3. 书籍推荐
《Build a Large Language Model (From Scratch)》(Sebastian Raschka)——从零实现首选。
《Hands-On Large Language Models》(Jay Alammar 等)——原理到应用。
《LLM Engineer’s Handbook》(Maxime Labonne 等)——工程全生命周期。
中文可参考李宏毅生成式 AI 课程笔记、各种技术报告解读。
4. 关键论文与技术报告(理论深度)
《Attention Is All You Need》(Transformer 奠基)。
GPT 系列、LLaMA / Llama 2/3、Qwen、DeepSeek 等技术报告。
Scaling Laws 相关论文。
对齐:InstructGPT、DPO、GRPO 等。
推荐用 GitHub 上的论文精读仓库(如 datawhale 相关、LLMForEverybody)配合阅读。
5. 实践框架与工具(动手必备)
Hugging Face 生态:transformers + peft(LoRA/QLoRA)+ trl(SFT/DPO)+ datasets + accelerate。
LLaMA-Factory:中文友好的一站式微调工具。
Unsloth:高效微调(显存友好)。
DeepSpeed / Megatron / FSDP:分布式与大规模训练。
小规模从零:nanoGPT、minGPT、MiniMind 等。