Prestar atenção
05 / Atenção e Transformers

O contexto muda tudo.

Um não precisa trabalhar sozinho. Veja como , chaves e valores deixam ele trocar informação com o resto da sequência.

Dentro da autoatenção

Passe por uma célula para seguir o cálculo
Chaves / colunas →
Q↓MAKLVGMAKLVG

Leia uma linha: como uma consulta distribui atenção por todas as chaves.

Output[3] = Σⱼ attention[3, j] × V[j]
= [-0.26, -0.42, 0.55, -0.54]
Conta exata · projeções fixas, de brinquedo, sem treinodₖ = 4 · n = 6 · 3 independent heads

Montar um bloco Transformer

Escolha uma camada para ver o que ela faz
Repetir × N blocos Transformer
Interactive exhibitExplore with mouse, touch or keyboard
01 / A intuição

Em linguagem simples

Para cada , a pergunta quais outros são úteis agora. Ela calcula uma mistura ponderada da informação deles, produzindo uma representação com contexto.

02 / Por dentro

A ideia técnica

Q = XWQ, K = XWK, V = XWV. Os produtos escalares entre e chave são escalados por √dk, mascarados quando for o caso, e normalizados por linha com . Cada linha de soma um.

03 / A ligação com a biologia

Dos dados às proteínas

A entre pode codificar dependências de sequência, inclusive de longo alcance. Um valor de não é automaticamente um contato físico, uma explicação causal nem prova de interação bioquímica.

Olhar mais fundo: matemática, métodos e limites

Attention(Q,K,V) = softmax(QKᵀ/√dₖ + M)V

O mapa de calor usa de de 4 dimensões, fixos e não treinados, com informação de posição senoidal. Cada cabeça selecionável usa projeções 4×4 fixas e diferentes. São cálculos exatos de sobre de brinquedo, não extraídos do ESM ou do .

Uma máscara causal coloca menos infinito nas pontuações de posições futuras antes do , zerando a probabilidade delas. Um usa contexto bidirecional; um modelo só de usa máscara causal.

A concatena o resultado de cada cabeça e o projeta de volta à dimensão do modelo. Um bloco também tem uma rede feed-forward por posição, e . Empilhar sozinha não descreve a arquitetura inteira.

O original é um modelo -. O usa o desenho do ; modelos no estilo GPT usam blocos causais. A posição da e o mecanismo posicional variam entre famílias. A densa padrão cria uma n×n de interações por cabeça, com quadrático no comprimento da sequência.

Ir à pesquisa original

Um instante para juntar as pontas

Por que uma linha de atenção soma 1?