Quando as camadas aprendem
03 / Aprendizado profundo

Partes simples. Padrões complexos.

Conecte neurônios em camadas e treine seus . Veja uma rede curvar a fronteira de decisão em torno de um problema não linear.

Ver uma rede aprender

Rode, pause e inspecione cada época
0época
perda de treino
acurácia de validação
Superfície de decisão−1+1Atributo x₁Atributo x₂+1−110

Inspecione um ponto. Cor = probabilidade prevista; forma = classe observada.

A superfície inicial não foi treinada. Rode o experimento para calcular a trajetória inteira.

Classe 0Classe 1 / perda de treinoPerda de validação
Pronto para treinar
Inspecionar as camadas e a passagem reversa
x₁, x₂tanh(W₁x + b₁)sigmoid(W₂h + b₂)

Cada unidade oculta aprende uma combinação ponderada diferente e aplica tanh. A retropropagação multiplica a derivada que vem de cima por 1 − tanh(z)².

Direto: x → h → p → perda
Reverso: ∂L/∂p → ∂L/∂h → ∂L/∂W
The optimizer subtracts learning rate × gradient from each trainable parameter.

01 / A intuição

Em linguagem simples

Uma camada transforma as entradas; a seguinte trabalha com os transformados. Ativações não lineares permitem que essas composições representem padrões mais complexos.

02 / Por dentro

A ideia técnica

Este laboratório treina um 2 → 6 → 1, com ativações tanh na camada oculta e na saída. É uma demonstração pequena; modelos profundos atuais têm muito mais camadas.

03 / A ligação com a biologia

Dos dados às proteínas

Um modelo profundo de proteína aprende representações de sequência em vez de depender só de descritores desenhados à mão. A arquitetura e o objetivo de treino decidem que informação essas representações guardam.

Olhar mais fundo: matemática, métodos e limites

h = tanh(W₁x + b₁); p = σ(W₂h + b₂)

Passagem direta: calcule ativações ocultas e predições. : compare as predições com os . : propague as derivadas da até todos os treináveis. Atualização: θ ← θ − η∇θL.

Sem ativações não lineares, uma pilha de camadas afins continua sendo um mapeamento afim. Profundidade sozinha não produz fronteira não linear. Este experimento usa tanh justamente para evitar esse colapso.

As curvas vêm de otimização de verdade, no seu navegador. Treino e validação usam exemplos sintéticos diferentes. baixa no treino não estabelece utilidade biológica nem desempenho em famílias de proteína nunca vistas.

Ir à pesquisa original

Um instante para juntar as pontas

O que acontece se todas as ativações ocultas forem lineares?