SaProt
Modelo de linguagem de proteínas · Westlake · 2024

SaProt

Um modelo de linguagem mascarado sobre um vocabulário com ciência de estrutura. Cada posição carrega um aminoácido combinado a um símbolo do alfabeto estrutural do Foldseek, então sequência e geometria local dividem um token.

Em linguagem simples

Um modelo de linguagem cujo alfabeto guarda duas coisas por posição: qual aminoácido é, e mais ou menos que forma o esqueleto assume ali.

Uma forma de imaginar

Escrever cada letra com um acento que diz como a cadeia se curva naquele ponto.

O engano mais comum

Ele precisa de uma estrutura na entrada. Se essa estrutura for prevista, os erros dela vão direto para os tokens.

01 / Por que está aqui

Posição

Um codificador com ciência de estrutura bastante baixado, treinado em estruturas previstas do banco AlphaFold além das experimentais.

02 / O que o distingue

Distinções

  • O alfabeto estrutural vem do Foldseek, então o modelo precisa de uma estrutura na entrada.
  • Fica entre um codificador só de sequência e um modelo generativo multimodal.
  • Existem duas linhas de checkpoint, uma treinada em estruturas previstas e outra no Protein Data Bank.
03 / Onde para

Limites

Exige uma estrutura, prevista ou experimental, o que é uma entrada mais pesada que a do ESM-2. Erros numa estrutura prevista entram direto nos tokens.

Pesos e código

Conferido no registro, não de memória
RepositórioTamanhoLicençaObservação
westlake-repl/SaProt_650M_AF2650MMIT
westlake-repl/SaProt_650M_PDB650MMIT

Fontes

Cada número acima vem de uma destas

Mesma tarefa, outras respostas

Modelo de linguagem de proteínas