大模型(LLM)学习路线与核心资料整理
本文整理了大模型(Large Language Model, LLM)的学习路径、核心知识点及相关资料,涵盖从基础数学原理到架构设计、微调优化及评估量化的全流程。

GitHub 地址:https://github.com/mlabonne/llm-course


LLM 基础知识
1. 机器学习之数学基石
在踏足机器学习的殿堂之前,深入理解其背后的数学原理至关重要。
线性代数:它如同桥梁,连接着算法与数据世界。向量、矩阵、行列式、特征值与特征向量、向量空间及线性变换等概念,均为深度学习中的算法提供坚实的支撑。
微积分:在连续函数的优化旅程中,导数、积分、极限与级数如同灯塔,指引我们前行。同时,多变量微积分与梯度的概念亦不可忽视。
概率与统计:它们让模型从数据中汲取智慧,预见未来。概率论、随机变量、概率分布、期望、方差、协方差、相关性、假设检验、置信区间、最大似然估计及贝叶斯推理,这些概念如同星辰,点亮了我们的预测之路。
📚 资源推荐:
- 3Blue1Brown - 线性代数的本质:几何视角下,线性代数的真谛尽收眼底。
- StatQuest 与 Josh Starmer - 统计基础知识:简单明了,统计学的奥秘触手可及。
- Aerin 女士的 AP 统计直觉:深入浅出,概率分布背后的逻辑跃然纸上。
- 沉浸式线性代数:视觉盛宴,线性代数的另一种解读方式。
- Khan Academy - 线性代数:直观易懂,初学者的首选。
- 可汗学院 - 微积分:深入浅出,微积分的基础知识一网打尽。
- 可汗学院 - 概率与统计:清晰易懂,概率与统计的知识轻松掌握。
2. Python:机器学习的得力助手
Python,这门强大而灵活的编程语言,因其在数据科学领域的卓越表现,成为机器学习的得力助手。
Python 基础:从基本语法、数据类型、错误处理到面向对象编程,每一步都是通往数据科学殿堂的必经之路。
数据科学库:NumPy 助你一臂之力,实现高效的数值运算;Pandas 让你轻松驾驭数据的海洋;Matplotlib 与 Seaborn 则为你绘制出数据的美丽图景。
数据预处理:特征缩放、标准化、缺失数据处理、异常值检测、分类数据编码以及数据集的拆分,每一步都为模型的训练与测试打下坚实基础。
机器学习库:Scikit-learn 是你手中的利剑,监督学习、非监督学习,多种算法任你挑选。从线性回归、逻辑回归、决策树、随机森林到 K 最近邻、K 均值聚类,每一个算法都蕴含着数据背后的智慧。降维技术如 PCA 和 t-SNE 则助你一臂之力,将高维数据可视化,洞察其本质。






