深度学习
概念
- Batch Normalization — 在一个 batch 上对某一特征维度统计均值和方差并做归一化。在 CNN 中广泛使用,但不适合 Transformer 的序
- Layer Normalization — 对单个样本内部的特征维度做标准化,稳定网络中的数值分布,使训练更稳定。是 Transformer 的基础组件,不依赖 bat
- Self-Attention机制 — Self-Attention(自注意力)是 Transformer 的核心机制,让序列中每个位置根据内容动态关注其他所有位置
- Transformer架构 — Transformer 是 2017 年提出的序列到序列神经网络架构,以 Self-Attention机制 替代 RNN 的顺序传播,实现完全并行的全局
- 位置编码 — 位置编码(Positional Encoding)是 Transformer 中补充序列顺序信息的机制。Self-Att</li> <li>[[域随机化 — 域随机化(Domain Randomization)是解决仿真到真实迁移(sim-to-real gap)的核心技术:在仿真训练中随机化大量环境参数(物理属性、
- 多头注意力 — 多头注意力(Multi-Head Attention)在 h 个独立子空间中并行执行 Self-Attention机制,再拼接并线性变换,使模型同时捕获
- 残差连接 — 将子层输入直接加到子层输出上:$x + \text{Sublayer}(x)$,缓解深层网络梯度消失问题,是 Transform</li> <li>[[相对位置编码 — 相对位置编码关注两个 token 之间相隔多远,而非各自处于第几位。位置信息直接注入注意力分数计算,使模型在决定"该关注谁"时显式考虑相对距离 $i-j
- 端到端视觉运动学习 — 端到端视觉运动学习是让机器人直接从原始摄像头像素映射到关节力矩的深度学习范式,绕过传统的感知-状态估计-规划-控制模块化流水线,用统一的神经网络联</li> <li>[[绝对位置编码 — 绝对位置编码直接告知模型当前 token 处于第几个位置。分固定式(正弦/余弦公式)和可学习式两种,是原始 Transf</li> <li>[[自注意力机制 — Self-Attention(自注意力)是 </li> <li>[[负迁移 — 负迁移(Negative Transfer)是多任务学习中的核心问题,指当不同任务的学习信号冲突时,共享参数被拉向不同方向导致所有任务性能下降的现象。
实体
- APPNP — Klicpera 等人于 ICLR 2019 发表的论文,基于 Personalized PageRank 思想,在每层传播中混入初始特征(teleport)以
- SGC — Wu 等人于 ICML 2019 发表的简化图卷积论文,移除非线性激活并将多层权重矩阵压缩为一个,面向节点分类任务,与 LightGCN 共享简
- Sergey-Levine — Sergey Levine 是 UC Berkeley 计算机科学系教授,深度机器人学习领域最具影响力的研究者之一(Google Scholar 引用超
- T5 — Google 提出的 Text-to-Text Transfer Transformer,将所有 NLP 任务统一为