Em linguagem simples
Uma sequência de proteína é uma cadeia de , em geral escrita com um alfabeto de 20 letras. Um aprende regularidades estatísticas em muitas sequências assim.
Troque palavras por . Explore como aprender de sequências de proteína produz representações úteis para a biologia.
Aprende representações contextuais de resíduo com modelagem mascarada de sequências de proteína. Os embeddings alimentam cabeças específicas de tarefa. O maior ESM-2 do trabalho de 2023 tem 15 bilhões de parâmetros.
Uma sequência de proteína é uma cadeia de , em geral escrita com um alfabeto de 20 letras. Um aprende regularidades estatísticas em muitas sequências assim.
mascarados como o aprendem contextuais por . Uma representação pode ser agregada em um por sequência, ou entregue a uma cabeça de predição por . O faz parte da família ProtTrans.
Tarefas possíveis adiante incluem localização, estrutura secundária, estabilidade e predição de função. Representações de sequência são boas entradas, mas a tarefa ainda precisa de adequados, avaliação e interpretação biológica.
Lmask = −Σᵢ∈M log p(aᵢ | a_visible)
Escolha um para mascará-lo. O inspetor informa a identidade dele e o agrupamento químico simples; ele não prevê qual cabe na posição mascarada. A fração hidrofóbica é um descritor, não uma probabilidade de solubilidade.
O é um . O ESMFold combina representações do com uma arquitetura de enovelamento para prever estrutura. O modelo de linguagem sozinho não é o preditor de estrutura completo. O ProtTrans reúne vários modelos, entre eles o e o .
O de um é um aprendido, não uma lista nomeada de propriedades físicas. A calcula a média dos dos válidos, excluindo preenchimento e especiais, e perde parte da informação posicional. Para tarefas por , guarde as representações posição a posição.
O aprende de grandes coleções de sequências sem , por alvos autossupervisionados. Correlações evolutivas ajudam as representações a capturar estrutura e função, mas redundância de sequência, de conjunto e sequências fora da distribuição limitam a generalização.
| Modelo | Treino / papel | Distinção útil |
|---|---|---|
| ESM-2 | Modelagem mascarada de linguagem de proteínas | Embeddings contextuais de resíduo |
| ESMFold | Predição de estrutura usando o ESM-2 | Inclui uma arquitetura de enovelamento |
| ProtBERT | Modelagem mascarada de proteína no estilo BERT | Codificador de proteínas dentro do ProtTrans |
| ProtT5 | Pré-treino de proteínas baseado em T5 | O codificador dele é o usado para embeddings |