跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

从神经元基本原理理解 LLM 智能涌现

探讨了大语言模型(LLM)参数规模与性能提升的关系,即 Scaling Law。通过分析神经网络中单个神经元的工作原理,解释了权重(w)、偏置(b)及激活函数的作用。重点介绍了 Sigmoid、Tanh、ReLU 等常见激活函数的特性及其在解决梯度消失问题上的差异,为理解 LLM 的智能涌现提供了基础理论支撑。

BigDataPan发布于 2025/2/7更新于 2026/7/835 浏览
从神经元基本原理理解 LLM 智能涌现

神经网络的重要参数

大模型如 Llama 3.1 8B、70B、405B(即 80 亿、700 亿、4050 亿参数)中的这些几十亿、几百亿、几千亿的参数主要是指模型中所有可训练的权重和偏置的总和,这些参数分布在模型的各个层、节点和组件中,用于学习数据的复杂表示并生成预测结果。

神经网络参数示意图

'大力出奇迹',即 Scaling Law:在保持模型架构和训练策略不变的情况下,通过简单地增加模型的参数数量、训练数据量或计算资源,可以在一定程度上提升模型的性能。这种趋势在多个大型语言模型的实验中都得到了验证,表明在当前的技术水平下,参数规模的增长仍然是推动模型性能提升的重要因素。

能够大力出奇迹,可能来源于大模型是由无数简单的神经元构成,就像蜂群由无数工蜂组成。越是简单的个体,不断叠加个体的数量,一定会量变到质变,产生智能涌现。

神经元结构示意

这一切的逻辑,背后的理论支撑是什么?机器学习(Machine Learning)时代已经出现了,从数学的角度那是更早就有了。即神经网络中单个神经元:y = σ(wx + b),线性回归再叠加一个激活函数。

神经元公式示意

神经网络中单个神经元

大语言模型(LLM)动辄上千亿的参数如何'大力出奇迹',如何遵守 Scaling Law,如何产生智能涌现(Emergent)?这些目前都无法证明、不好理解,但是单个神经元的工作原理我们还是能搞清楚的。想搞懂大模型,那就先从了解权重 w、偏置 b 以及激活函数开始吧。

神经元原理图

神经网络的重要参数

权重 w 和偏置 b:在神经网络中,模型参数包括每一层的权重 (weight) 和偏置项 (bias)。这些参数在训练过程中通过反向传播算法进行调整,以最小化损失函数。神经网络模型参数的数量和复杂性随着网络层数和每层的神经元数量的增加而增加。

  • 权重(w):用于描述不同神经元之间的连接强度。在神经网络的前向传播过程中,输入数据会与权重进行加权求和,从而影响神经元的输出。
  • 偏置(b):用于调整神经元的输出。偏置的作用类似于线性方程中的截距项,它使得神经元的输出可以偏离原点。

权重与偏置示意

激活函数

在神经网络中,输入通过加权求和(权重(w)和偏置(b)),然后被一个函数作用,这个函数就是激活函数。它决定了节点是否应该被激活(即,是否让信息通过该节点继续在网络中向后传播)。

神经网络中,如果只有线性变换,那么无论神经网络有多少层,输出都是输入的线性组合。引入非线性激活函数,使得神经网络逼近任何非线性函数。

激活函数作用

常见的激活函数

常见的激活函数包括:Sigmoid、Tanh、Softmax、ReLU、Leaky ReLU。

  • Sigmoid:将输入的连续实值压缩到 0 和 1 之间,特别大的负数映射为 0,特别大的正数映射为 1。但它存在梯度消失和输出不是以 0 为中心的问题。
  • Tanh:将输入的连续实值压缩到 -1 和 1 之间,输出以 0 为中心。但它同样存在梯度消失的问题。
  • Softmax:常用于多分类问题的输出层,将神经元的输出映射到概率分布上。
  • ReLU (Rectified Linear Unit):当输入大于 0 时,输出等于输入;当输入小于等于 0 时,输出为 0。ReLU 解决了梯度消失的问题,但可能会导致神经元'死亡'的问题。
  • Leaky ReLU:对 ReLU 进行了改进,当输入小于 0 时,给予一个很小的斜率,从而避免神经元'死亡'的问题。

常见激活函数

传统激活函数 Sigmoid

Sigmoid 函数的输出始终在 0 和 1 之间,这使得它经常被用于二分类问题中,其中输出可以解释为属于某一类的概率。

与一些现代激活函数(如 ReLU)相比,Sigmoid 函数需要计算指数函数和除法操作,会增加计算成本,导致梯度消失/梯度爆炸问题。

Sigmoid 函数

主流激活函数 ReLU

ReLU(Rectified Linear Unit)是当今深度学习领域中最主流的激活函数之一。

ReLU 函数

ReLU 函数公式

ReLU 公式

ReLU 与传统的 Sigmoid 和 tanh 激活函数相比,ReLU 函数在输入为正数时导数为 1,在输入为负数时导数为 0,这有效地避免了梯度消失/梯度爆炸问题。由于 ReLU 函数的非线性特性和计算简单性,它可以帮助神经网络更快地收敛到最优解。

ReLU 动态

目录

  1. 神经网络的重要参数
  2. 神经网络中单个神经元
  3. 神经网络的重要参数
  4. 激活函数
  5. 常见的激活函数
  6. 传统激活函数 Sigmoid
  7. 主流激活函数 ReLU
  8. ReLU 函数公式
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • C++ 继承机制核心详解
  • hls4ml:FPGA机器学习快速上手指南
  • Dify MCP-Server 插件将工作流发布为第三方可调用服务
  • 二叉搜索树 C++ 实现:增删查改详解
  • C++ 模板编程入门:从零理解泛型核心
  • 通义万相 2.1 应用拓展与平台调优实践
  • Windows 系统安装与配置 RabbitMQ 教程
  • 拒绝经验过剩:程序员的工作只能是代码?
  • 企业级 Agent 构建实战:从 RAG 到自主智能体的全栈架构
  • MySQL 常用函数整理与使用指南
  • Python 数据科学工具链入门:NumPy、Pandas、Matplotlib 快速上手
  • GitHub 学生认证申请流程与常见问题
  • VIVADO RAM IP 核生成配置与仿真测试
  • 基于 DeepSeek 的贪吃蛇游戏开发实战
  • C++ STL list 容器底层实现分析
  • TinyLlama 与 LiteLlama:轻量级模型实现高性能推理与应用
  • Windows 10/11 部署 OpenClaw:环境搭建与机器人互联实战
  • MySQL 8.0.x 跨平台安装实战:Windows、CentOS、Ubuntu 配置详解
  • AIGC 重塑文学创作:机遇、挑战与应对
  • Visual C++ 运行库安装与 DLL 缺失问题排查指南

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online