Search
搜索笔记、问答与随笔
按标题、摘要、分类或标签查找当前已经整理的内容。
找到 25 条内容
神经网络中的正向传播与反向传播:从数值计算到矩阵公式
从两层神经网络的具体数值出发,推导链式法则、矩阵梯度、Softmax 交叉熵与 PyTorch 自动微分。
知识笔记Transformer 矩阵与维度完整讲解(整合版)
从 Token 输入、Q/K/V、多头注意力到 Transformer Block 与 KV Cache,系统追踪矩阵运算和维度变化。
知识笔记Python 四种核心容器怎么选
从顺序、可变性、去重和键值映射出发,建立列表、元组、集合和字典的选择逻辑。
知识笔记PyTorch 训练流程:数据最终去了哪里
从 Dataset、DataLoader 到 Model、Loss 与 Optimizer,追踪一次训练迭代的输入、输出和参数更新。
知识笔记RNN 的三个时间位置:h 与预测分别去哪
用‘我喜欢你’三个位置,区分横向传递的隐藏状态与纵向用于计算损失的预测。
知识笔记Prompt 不只是文字:从输入到校验的完整链路
把提示词放回真实应用流程,区分消息组织、模型调用、结构化解析和结果校验。
AI 问答os.getenv()为什么能传两个参数,get不是只取一个值吗?
第一个参数说明要查哪个环境变量,第二个参数提供查不到时的默认值;函数接收两个参数,但最终只返回一个结果。
AI 问答AdaGrad如何根据梯度平方和自动调整学习率?
区分基础学习率与每个参数的有效学习率,并解释AdaGrad为什么越训练越慢。
AI 问答梯度平方丢失方向后,Adam怎样同时决定方向和步长?
Adam用m保存带符号的梯度平均,用v保存梯度平方平均,两份状态各司其职。
AI 问答Adam与AdamW有什么区别,为什么要解耦权重衰减?
两者的Adam更新相同,真正区别在于weight decay是否先混入梯度和自适应状态。
AI 问答Adam、AdamW与StepLR有什么区别,都是自动调整学习率吗?
优化器决定怎样利用梯度更新参数,StepLR则按训练轮数修改优化器的基础学习率。
AI 问答AdamW会创建自己的w和b吗,m、v与模型参数是什么关系?
模型只有原来的可训练参数,AdamW额外保存的是每个参数的优化历史状态。
AI 问答把λw加进梯度是什么意思,λ和w分别是什么?
从L2正则项的求导看懂λw的来源,并区分耦合L2与AdamW权重衰减。
AI 问答从SGD到AdamW,各种优化器分别解决了什么问题?
用一条演进路线理解Momentum、AdaGrad、RMSProp、Adam和AdamW分别新增了什么。
AI 问答文档已经是字典,为什么还要写row = dict(doc)?
dict(doc)创建新的外层字典,避免附加向量时直接修改DOCS中的原始文档。
AI 问答zip()怎样组合数据,zip(*data)中的*又做了什么?
先理解zip按位置配对,再理解星号把外层序列拆成多个位置参数。
AI 问答RMSProp怎样改进AdaGrad,近期梯度权重更大是什么意思?
RMSProp用梯度平方的指数加权平均控制步长,让旧信息逐渐衰减。
AI 问答反向传播做了什么,参数究竟在哪里更新?
反向传播负责计算梯度,优化器才真正修改参数;从一次训练迭代看清二者的分工。
AI 问答模型蒸馏中的教师模型、学生模型和软标签是什么?
学生模型同时学习真实标签和教师模型的概率分布,以较小体积保留更多类别关系信息。
AI 问答LSTM的细胞状态和遗忘门、输入门、输出门分别做什么?
LSTM通过细胞状态保存长期信息,并用三个门控制旧信息保留、新信息写入和当前信息输出。
AI 问答Precision、Recall和F1分别怎么计算?
Precision关注预测为正的结果有多准,Recall关注真实正类找回多少,F1综合二者。
AI 问答RNN的输入、隐藏状态、输出形状和主要缺陷是什么?
沿时间步追踪x、h、output和hn,理解共享参数、序列输出以及长期依赖问题。
AI 问答怎样完整介绍Transformer、QKV和Encoder/Decoder?
从token形状开始,串起自注意力、多头注意力、FFN、残差连接以及Encoder与Decoder。
AI 问答怎样根据训练集和验证集判断欠拟合与过拟合?
训练和验证都差通常是欠拟合;训练很好但验证明显变差通常是过拟合。
AI 问答梯度消失和梯度爆炸为什么发生,怎样处理?
二者都与反向传播的链式连乘有关:连续缩小会消失,连续放大会爆炸。
