Posição
O estudo de escala que tornou os modelos de linguagem de proteínas mascarados um componente padrão. Trabalhos posteriores inicializam outros modelos a partir dos pesos do ESM-2 e usam seus embeddings como atributos.
Um transformer bidirecional treinado para reconstruir aminoácidos mascarados a partir de sequências não alinhadas. Produz representações contextuais por resíduo e logits de aminoácido. Transformar essas representações em coordenadas exige o ESMFold, que é um modelo separado.
Um modelo treinado escondendo aminoácidos e adivinhando de volta. Fazer isso bem obriga a aprender para que serve cada posição de uma proteína, e esses números internos acabam servindo para quase qualquer tarefa com proteínas.
Preencha as lacunas, dez bilhões de vezes, até não conseguir evitar entender a gramática. Ninguém ensinou química a ele. Ele aprendeu quais resíduos combinam por ser obrigado a adivinhá-los.
Ele não prevê estrutura. Ele produz vetores. O ESMFold é o modelo que transforma esses vetores em coordenadas, e é um download separado.
import torch
from transformers import AutoTokenizer, AutoModel
name = "facebook/esm2_t33_650M_UR50D"
tok = AutoTokenizer.from_pretrained(name)
model = AutoModel.from_pretrained(name).eval()
seq = "MALWMRLLPLLALLALWGPDPAAA"
batch = tok(seq, return_tensors="pt")
with torch.no_grad():
out = model(**batch).last_hidden_state
# drop the start and end tokens, then average over residues
per_residue = out[0, 1:-1]
sequence_vector = per_residue.mean(0)
print(per_residue.shape, sequence_vector.shape)Estes trechos não foram executados aqui. Versões mudam: confira o cartão do modelo antes de confiar em qualquer linha.
O estudo de escala que tornou os modelos de linguagem de proteínas mascarados um componente padrão. Trabalhos posteriores inicializam outros modelos a partir dos pesos do ESM-2 e usam seus embeddings como atributos.
É um codificador. Não gera estruturas, e os logits por resíduo são um substituto ruim para aptidão quando a função depende de mais do que a verossimilhança da sequência.
| Repositório | Tamanho | Licença | Observação |
|---|---|---|---|
| facebook/esm2_t33_650M_UR50D | 650M | MIT | The default choice for embeddings |
| facebook/esm2_t12_35M_UR50D | 35M | MIT | Small enough for a laptop |
| facebook/esm2_t36_3B_UR50D | 3B | MIT | — |
| facebook/esm2_t48_15B_UR50D | 15B | MIT | Rarely worth the memory over 3B |
Sequência, estrutura e função como uma predição mascarada só.
Um modelo mascarado generativo sobre três trilhas paralelas.
Ver a arquitetura Modelo de linguagem de proteínas2026A linha de representação, levada mais longe.
Um codificador transformer com pre-layer-norm, embeddings rotativos e ativações SwiGLU, treinado em sequências do UniRef, do MGnify e do Joint Genome Institute agrupadas a 70 por cento de identidade.
Ler a entrada Modelo de linguagem de proteínas2022Os codificadores que chegaram antes.
Uma família de transformers treinados em UniRef e BFD com os objetivos de seus equivalentes em texto.
Ler a entrada