A língua da vida
06 / Modelos de linguagem de proteínas

Alfabeto novo. Ideias conhecidas.

Troque palavras por . Explore como aprender de sequências de proteína produz representações úteis para a biologia.

Uma sequência vira uma representação

Escolha um resíduo e mascare-o
Sequência primária
Tokens de resíduo
Codificador de proteínas
Embeddings de resíduo
Um vetor por resíduomean poolUm vetor de sequênciaCores apenas esquemáticas; nenhum embedding aprendido é calculado aqui.
Modelagem de linguagem mascarada → embeddings contextuaisIdentidade dos resíduos · descritores reais

Conheça os modelos

Ideias próximas. Papéis diferentes.

ESM-2: um codificador de proteínas mascarado

Aprende representações contextuais de resíduo com modelagem mascarada de sequências de proteína. Os embeddings alimentam cabeças específicas de tarefa. O maior ESM-2 do trabalho de 2023 tem 15 bilhões de parâmetros.

01 / A intuição

Em linguagem simples

Uma sequência de proteína é uma cadeia de , em geral escrita com um alfabeto de 20 letras. Um aprende regularidades estatísticas em muitas sequências assim.

02 / Por dentro

A ideia técnica

mascarados como o aprendem contextuais por . Uma representação pode ser agregada em um por sequência, ou entregue a uma cabeça de predição por . O faz parte da família ProtTrans.

03 / A ligação com a biologia

Dos dados às proteínas

Tarefas possíveis adiante incluem localização, estrutura secundária, estabilidade e predição de função. Representações de sequência são boas entradas, mas a tarefa ainda precisa de adequados, avaliação e interpretação biológica.

Olhar mais fundo: matemática, métodos e limites

Lmask = −Σᵢ∈M log p(aᵢ | a_visible)

Escolha um para mascará-lo. O inspetor informa a identidade dele e o agrupamento químico simples; ele não prevê qual cabe na posição mascarada. A fração hidrofóbica é um descritor, não uma probabilidade de solubilidade.

O é um . O ESMFold combina representações do com uma arquitetura de enovelamento para prever estrutura. O modelo de linguagem sozinho não é o preditor de estrutura completo. O ProtTrans reúne vários modelos, entre eles o e o .

O de um é um aprendido, não uma lista nomeada de propriedades físicas. A calcula a média dos dos válidos, excluindo preenchimento e especiais, e perde parte da informação posicional. Para tarefas por , guarde as representações posição a posição.

O aprende de grandes coleções de sequências sem , por alvos autossupervisionados. Correlações evolutivas ajudam as representações a capturar estrutura e função, mas redundância de sequência, de conjunto e sequências fora da distribuição limitam a generalização.

ModeloTreino / papelDistinção útil
ESM-2Modelagem mascarada de linguagem de proteínasEmbeddings contextuais de resíduo
ESMFoldPredição de estrutura usando o ESM-2Inclui uma arquitetura de enovelamento
ProtBERTModelagem mascarada de proteína no estilo BERTCodificador de proteínas dentro do ProtTrans
ProtT5Pré-treino de proteínas baseado em T5O codificador dele é o usado para embeddings

Ir à pesquisa original

Um instante para juntar as pontas

O ESM-2 sozinho é igual ao ESMFold?