| 术语 | 描述 |
|---|---|
| 预训练模型 pre-trained model | 通过自监督或者无监督技术,在大量的训练数据上训练得到初始模型,能被迁移到目标相近的任务中进行使用的一种深度学习模型。 |
| 大规模预训练模型 large scale pre-trained model | 大模型 large scale model;大规模深度学习模型 large-scale deep learning model;基于大量数据训练得到,具有复杂计算架构,能够处理复杂任务,且具备一定泛化性的深度学习模型。注:大模型的参数量由其功能和模态决定,一般不低于1亿。大模型训练使用的数据总量受参数量的影响,达到收敛的大模型的参数量的对数与其训练数据总量的对数成正比。 |
| 转换器 transformer | 基于多头注意力机制,包含残差连接、层归一化和全连接的、能并行处理序列数据的、序列到序列架构的网络。 |
| 自注意力 self-attention | 通过计算输入序列内部每个元素对其他所有元素的注意力权重,建立序列内部的不同位置间关系的机制。 |
| 多头注意力 multi-head attention | 大规模预训练模型中利用多个参数量进行注意力计算机制。 |
| 层归一化 layer normalization | 对一个中间层的所有神经元或一个位置的特征进行归一化。 |
| 前馈网络 feedforward network | 神经网络中的推理模型。 |
| 量化 quantization | 将神经网络中的权重、激活值等高精度浮点数转换为较低比特宽度的数值表示 (如 INT8),以减少模型体积、加快推理速度并尽可能保持神经网络预测精度的算法。 |
| 剪枝 pruning | 移除神经网络中冗余或重要性较低的结构 (如权重、节点或通道),以减小模型规模、加快推理速度并降低计算成本的神经网络压缩和加速算法。 |
| intel Ngraph | 第三方高效计算引擎,用于执行合并后的操作节点。 |
| Nvidia TensorRT | 第三方高效计算引擎,用于执行合并后的操作节点。 |
Copyright ?2007-2026 ANTPEDIA, All Rights Reserved
京ICP备07018254号 京公网安备1101085018 电信与信息服务业务经营许可证:京ICP证110310号
页面更新时间: 2026-09-10 19:59