Em linguagem simples
A tokenização transforma uma sequência em símbolos discretos. Um leva cada símbolo a um . Um modelo de linguagem aprende a atribuir probabilidades usando o contexto.
Um modelo de linguagem aprende padrões estatísticos em sequências. Compare a predição do próximo com o objetivo mascarado do .
O codificador do BERT pode atender nos dois sentidos.
Rode o experimento para revelar a distribuição.
The count demo learns frequencies from these sentences. Its displayed scores are log(count + 0.1) / temperature before softmax.
the protein is solublethe protein is stablethe protein is solublethe enzyme binds a substratethe enzyme is stablea protein has a sequencea sequence contains amino acidsthe model learns a sequencethe model predicts a tokenthe protein binds a moleculethe enzyme is solublea model learns from dataWordPiece tokens → token, position and segment embeddings → stacked bidirectional Transformer encoder blocks → masked-token prediction head → vocabulary softmax. Cross-entropy at selected targets supplies gradients during training. Original BERT also trained a next-sentence objective.
BERT is an encoder reference, not an autoregressive chat model. ProtBERT applies a related masked-encoder idea to protein sequences.
A tokenização transforma uma sequência em símbolos discretos. Um leva cada símbolo a um . Um modelo de linguagem aprende a atribuir probabilidades usando o contexto.
Modelos autorregressivos preveem o próximo a partir dos anteriores. O é um que aprende representações bidirecionais com modelagem de linguagem mascarada; o original também usava predição da próxima frase.
O é uma ponte útil para a modelagem mascarada de proteínas: esconda parte de uma sequência e preveja o que falta usando os dois lados. O objetivo transfere, embora tokenização e dados sejam outros.
Lnext = −Σ log p(xₜ | x<t)
O -base tem 12 camadas de , 768 dimensões ocultas e 12 , com cerca de 110 milhões de . É uma referência introdutória útil, e não um primitivo nem um modelo de conversa.
No original, 15% das posições de são escolhidas para o objetivo mascarado. Dessas, 80% viram [MASK], 10% viram um aleatório e 10% ficam como estão. A é calculada nos alvos escolhidos.
As barras de probabilidade usam um corpus minúsculo baseado em contagem. O modo próximo usa a palavra anterior; o modo mascarado usa as palavras vizinhas à esquerda e à direita quando um contexto casa, e contagens de unigrama caso contrário. Suavização aditiva e convertem contagens em probabilidades. Isto não é do .
A tokenização de texto aqui separa palavras; o de verdade usa subpalavras WordPiece. Na geração autorregressiva, a muda a distribuição de saída e a amostragem escolhe o próximo . Isso é , não atualização de .