Attention实现
import math
import torch
from torch import nn
from d2l import torch as d2l
带掩码的softmax
有些query是不应该看到后面的key的
#@save
def masked_softmax(X, valid_lens):
"""通过在最后一个轴上掩蔽元素来执行softmax操作"""
# X:3D张量,valid_lens:1D或2D张量
if valid_lens is None:
return nn.functional.softmax(X, dim=-1)
else:
shape = X.shape
if valid_lens.dim() == 1:
valid_lens = torch.repeat_interleave(valid_lens, shape[1])
else:
valid_lens = valid_lens.reshape(-1)
# 最后一轴上被掩蔽的元素使用一个非常大的负值替换,从而其softmax输出为0
X = d2l.sequence_mask(X.reshape(-1, shape[-1]), valid_lens,
value=-1e6)
return nn.functional.softmax(X.reshape(shape), dim=-1)
测试一下
例1
masked_softmax(torch.rand(2, 2, 4), torch.tensor([2, 3]))

本文介绍了两种注意力机制——加性注意力和点积注意力在深度学习中的实现细节,包括掩码softmax、线性变换和权重计算过程。通过实例演示,展示了如何在不同情境下运用这些机制来处理不同时长的序列数据。

1626

被折叠的 条评论
为什么被折叠?



