Em linguagem simples
Para cada , a pergunta quais outros são úteis agora. Ela calcula uma mistura ponderada da informação deles, produzindo uma representação com contexto.
Um não precisa trabalhar sozinho. Veja como , chaves e valores deixam ele trocar informação com o resto da sequência.
Leia uma linha: como uma consulta distribui atenção por todas as chaves.
Para cada , a pergunta quais outros são úteis agora. Ela calcula uma mistura ponderada da informação deles, produzindo uma representação com contexto.
Q = XWQ, K = XWK, V = XWV. Os produtos escalares entre e chave são escalados por √dk, mascarados quando for o caso, e normalizados por linha com . Cada linha de soma um.
A entre pode codificar dependências de sequência, inclusive de longo alcance. Um valor de não é automaticamente um contato físico, uma explicação causal nem prova de interação bioquímica.
Attention(Q,K,V) = softmax(QKᵀ/√dₖ + M)V
O mapa de calor usa de de 4 dimensões, fixos e não treinados, com informação de posição senoidal. Cada cabeça selecionável usa projeções 4×4 fixas e diferentes. São cálculos exatos de sobre de brinquedo, não extraídos do ESM ou do .
Uma máscara causal coloca menos infinito nas pontuações de posições futuras antes do , zerando a probabilidade delas. Um usa contexto bidirecional; um modelo só de usa máscara causal.
A concatena o resultado de cada cabeça e o projeta de volta à dimensão do modelo. Um bloco também tem uma rede feed-forward por posição, e . Empilhar sozinha não descreve a arquitetura inteira.
O original é um modelo -. O usa o desenho do ; modelos no estilo GPT usam blocos causais. A posição da e o mecanismo posicional variam entre famílias. A densa padrão cria uma n×n de interações por cabeça, com quadrático no comprimento da sequência.