Posição
Posicionado como a família de representação ao lado da linha generativa ESM3. O checkpoint de 6B é o codificador que o ESMFold2 lê.
Um codificador transformer com pre-layer-norm, embeddings rotativos e ativações SwiGLU, treinado em sequências do UniRef, do MGnify e do Joint Genome Institute agrupadas a 70 por cento de identidade. O contexto chega a 2048 tokens depois de um segundo estágio de treino.
O codificador mais novo da mesma família do ESM-2, treinado por mais tempo, em mais sequências, com janela maior. Serve para a mesma coisa: transformar uma sequência em números que um modelo menor consegue aprender.
Mesmo trabalho, vocabulário maior e memória melhor. Ele lê o dobro da cadeia antes de precisar parar.
Não é preditor de estrutura nem modelo generativo. É o codificador que o ESMFold2 lê.
from esm.models.esmc import ESMC
from esm.sdk.api import ESMProtein, LogitsConfig
model = ESMC.from_pretrained("esmc_300m")
protein = ESMProtein(sequence="MALWMRLLPLLALLALWGPDPAAA")
encoded = model.encode(protein)
out = model.logits(encoded, LogitsConfig(sequence=True, return_embeddings=True))
print(out.embeddings.shape)Estes trechos não foram executados aqui. Versões mudam: confira o cartão do modelo antes de confiar em qualquer linha.
Posicionado como a família de representação ao lado da linha generativa ESM3. O checkpoint de 6B é o codificador que o ESMFold2 lê.
É um codificador, então produz embeddings e logits de token mascarado, não estruturas. Comparações com o ESM-2 vêm dos autores e do preprint deles, não de avaliação independente.
| Repositório | Tamanho | Licença | Observação |
|---|---|---|---|
| biohub/ESMC-300M | 300M, 30 layers | MIT and other terms | — |
| biohub/ESMC-600M | 600M, 36 layers | MIT and other terms | — |
| biohub/ESMC-6B | 6B, 80 layers | MIT and other terms | — |
Leia proteínas o bastante e a estrutura cai da leitura.
Um transformer bidirecional treinado para reconstruir aminoácidos mascarados a partir de sequências não alinhadas.
Ver a arquitetura Modelo de linguagem de proteínas2025Sequência, estrutura e função como uma predição mascarada só.
Um modelo mascarado generativo sobre três trilhas paralelas.
Ver a arquitetura Modelo de linguagem de proteínas2022Os codificadores que chegaram antes.
Uma família de transformers treinados em UniRef e BFD com os objetivos de seus equivalentes em texto.
Ler a entrada