ProtT5 and ProtBERT
Modelo de linguagem de proteínas · Rostlab · 2022

ProtT5 and ProtBERT

Uma família de transformers treinados em UniRef e BFD com os objetivos de seus equivalentes em texto. O codificador do T5 é a parte normalmente usada, e seus embeddings por resíduo alimentam cabeças supervisionadas pequenas.

Em linguagem simples

A primeira geração de modelos de linguagem de proteínas que funcionou. Ainda é uma linha de base justa, e ainda rápida o bastante para tentar antes de recorrer a algo maior.

Uma forma de imaginar

A lente antiga confiável. Existe vidro mais nítido hoje, e esta ainda tira a foto.

O engano mais comum

Carregue a metade codificadora do ProtT5 e ignore o decodificador. Quase ninguém usa o modelo sequência a sequência completo.

01 / Por que está aqui

Posição

Estabeleceu que modelos de linguagem treinados em sequências de proteína produzem atributos com informação estrutural, e que os embeddings transferem para predição de estrutura secundária e de localização sem alinhamentos.

02 / O que o distingue

Distinções

  • Embeddings do ProtT5 continuam uma linha de base forte para conjuntos rotulados pequenos.
  • O codificador é usado sozinho; a metade decodificadora normalmente é descartada.
  • Codificadores de tamanho médio muitas vezes empatam com os bem maiores quando o conjunto seguinte é pequeno.
03 / Onde para

Limites

Tokenização e dados de treino mais antigos que os da linha ESM. Para trabalho novo, estes são linhas de base, não a escolha padrão.

Pesos e código

Conferido no registro, não de memória
RepositórioTamanhoLicençaObservação
Rostlab/prot_t5_xl_uniref503B, encoder used aloneSee model card
Rostlab/prot_bert420MSee model card

Fontes

Cada número acima vem de uma destas

Mesma tarefa, outras respostas

Modelo de linguagem de proteínas