Gravit

Como um Transformer aprende a prever

Anatomia de uma previsão

Prólogo

Tudo começa com texto

Milhões de frases dão ao modelo uma tarefa simples: adivinhar o que vem a seguir.

01 / 19

A animação não carregou. O texto completo das 19 cenas está logo abaixo; para tentar de novo, recarregue a página.

00:00 / 04:44

Explicação animada · 19 cenas · 4 min 44 s

Um Transformer não aprende com regras escritas por alguém. Ele aprende com uma única tarefa, repetida sobre trilhões de tokens de texto: prever o próximo token. Esta animação mostra esse ciclo — do texto aos tokens, da atenção à previsão, do erro ao ajuste dos pesos — e o que nasce dele: uma representação interna do mundo, da próxima palavra à próxima jogada.

Em resumo

  • Um Transformer é treinado em uma única tarefa: prever o próximo token de um texto.
  • O texto é dividido em tokens; cada token vira um vetor (embedding), e o mecanismo de atenção decide quais partes do contexto importam para cada token.
  • No treinamento, a previsão é comparada com o token verdadeiro; o erro (loss) é propagado para trás (backpropagation) e cada peso é ajustado um pouco.
  • Repetido sobre trilhões de tokens, esse ciclo faz emergir representações internas de conceitos e relações — até do estado de um tabuleiro de xadrez.
  • No uso, o modelo não vê mais a resposta: escreve o texto um token por vez, a partir do contexto.

As 19 cenas, uma a uma

Cada cena mostra o momento em que começa na animação; clique em “Ver cena” para pular para ela. Os números que a animação mostra (probabilidades, erro, pesos) são ilustrativos, não medições de um modelo real.

  1. Prólogo ·

    Tudo começa com texto

    Milhões de frases dão ao modelo uma tarefa simples: adivinhar o que vem a seguir.

    Um modelo de linguagem é treinado para uma única tarefa: dado um trecho de texto, prever o que vem a seguir. Não há regras escritas à mão nem um objetivo escondido — tudo o que o modelo vier a saber fazer nasce dessa tarefa, repetida em escala enorme.

    Ver cena
  2. 01 · Dados ·

    Uma frase de cada vez

    O modelo não recebe regras. Recebe exemplos de linguagem do jeito que ela é usada.

    O material de treinamento é texto real: livros, artigos, código, conversas. Cada frase é ao mesmo tempo pergunta e resposta — as primeiras palavras são o contexto, e a palavra seguinte é o que o modelo precisa acertar.

    Ver cena
  3. 02 · Tokenização ·

    Texto vira peças

    Palavras e fragmentos são convertidos em tokens — pequenas unidades numeradas.

    Antes de qualquer cálculo, o texto é dividido em tokens — palavras inteiras, pedaços de palavras ou sinais de pontuação —, cada um com um número em um vocabulário fixo, geralmente com dezenas de milhares de entradas. Palavras frequentes costumam virar um único token; as raras se dividem em vários. Os números da animação são ilustrativos.

    Ver cena
  4. 03 · Embeddings ·

    Cada token ganha posição

    Um número se transforma em um ponto num espaço com milhares de dimensões.

    Cada token é convertido em um vetor — uma lista de centenas ou milhares de números. Com o treinamento, tokens usados em contextos parecidos ficam com vetores próximos. A posição de cada token na frase também é codificada, para que a ordem das palavras conte.

    Ver cena
  5. 04 · Atenção ·

    Cada palavra olha para as outras

    A atenção mede quais partes do contexto são importantes para compreender cada token.

    A atenção é o coração do Transformer: ela permite que cada token colete informação dos outros tokens do contexto, com pesos aprendidos. Em “O gato dorme ao sol”, é assim que “sol” busca informação em “dorme” e em “gato”. Em um modelo que gera texto, cada token só olha para os que vieram antes dele.

    Ver cena
  6. 05 · Camadas ·

    A ideia é refinada

    Camada após camada, relações simples se tornam padrões cada vez mais abstratos.

    Um Transformer empilha dezenas de blocos iguais — atenção seguida de uma pequena rede — e cada bloco reescreve as representações do anterior. As primeiras camadas captam relações próximas, como a gramática; as últimas, padrões mais abstratos.

    Ver cena
  7. 06 · Previsão ·

    Qual será o próximo token?

    No fim, o modelo atribui uma probabilidade a cada continuação possível.

    No topo da pilha, o modelo dá uma pontuação a cada token do vocabulário, e uma função chamada softmax transforma essas pontuações em probabilidades que somam 100%. “sol” fica com 62%, mas “lado”, “fim” e “som” também são continuações possíveis.

    Ver cena
  8. 07 · Realidade ·

    A resposta certa já era conhecida

    Durante o treinamento, comparamos a previsão com o token que realmente vinha a seguir.

    No treinamento, o texto já existe, então o próximo token verdadeiro é conhecido. Ninguém precisa rotular os dados: o próprio texto dá a resposta. Isso se chama aprendizado autossupervisionado.

    Ver cena
  9. 08 · Loss ·

    Medir o erro

    Um número resume a distância entre a previsão do modelo e a continuação correta.

    A distância entre a distribuição prevista e a resposta certa se resume a um número, a loss — geralmente a entropia cruzada. Quanto menos probabilidade o modelo tiver dado ao token correto, maior o erro.

    Ver cena
  10. 09 · Backpropagation ·

    O erro viaja para trás

    O sistema calcula quanto cada conexão contribuiu para aquele erro.

    A retropropagação (backpropagation) percorre a rede do fim para o começo e calcula, para cada peso, o gradiente: em que direção, e com que intensidade, mexer nesse peso reduziria o erro.

    Ver cena
  11. 10 · Pesos ·

    Milhões de ajustes minúsculos

    Cada peso muda um pouco, deixando a próxima previsão ligeiramente melhor.

    Um otimizador — uma variante do gradiente descendente, como o Adam — muda cada peso em uma quantidade minúscula, no sentido que reduz o erro. Um modelo grande tem milhões, muitas vezes bilhões, de pesos, e todos são ajustados a cada passo.

    Ver cena
  12. 11 · Escala ·

    Repetir. E repetir.

    Esse ciclo acontece com enormes quantidades de texto, muitas vezes e em paralelo.

    O ciclo prever → medir → ajustar se repete sobre trilhões de tokens, em milhares de processadores trabalhando em paralelo. As chamadas leis de escala mostram que o erro cai de forma previsível quando crescem os dados, o tamanho do modelo e a capacidade de computação.

    Ver cena
  13. 12 · Aprendizado ·

    O erro começa a cair

    Sem memorizar uma lista de regras, o modelo aprende regularidades profundas.

    A curva da loss cai rápido no início e depois cada vez mais devagar. O modelo não guarda uma lista de frases: ele comprime regularidades — gramática, fatos, estilos — que permitem prever bem textos que nunca viu.

    Ver cena
  14. 13 · Interior ·

    Nasce um mapa invisível

    Conceitos, relações, estilos e estruturas se organizam em representações internas.

    Dentro da rede, conceitos e relações se organizam em representações internas: direções e regiões do espaço de vetores que correspondem a ideias como “animal”, “movimento” ou “luz”. Ninguém as programou; elas emergem porque ajudam a prever.

    Ver cena
  15. 14 · Modelo de mundo ·

    Prever exige compreender estrutura

    Para continuar bem uma frase, o modelo precisa capturar algo sobre como o mundo funciona.

    Para continuar bem frases sobre causas, tempos e distâncias, é útil para o modelo representar essas estruturas. Até onde vai essa “compreensão” é tema de debate, mas há evidência experimental de que modelos treinados apenas para prever sequências formam representações internas do mundo.

    Ver cena
  16. 15 · Novo contexto ·

    Agora, sem a resposta

    No uso real, o modelo vê apenas o contexto e calcula o próximo token.

    No uso — a inferência — já não há resposta certa para comparar nem pesos para ajustar. O modelo recebe um contexto novo, calcula a distribuição do próximo token, escolhe um, acrescenta ao texto e repete: é assim que uma resposta é escrita, token por token.

    Ver cena
  17. 16 · Xadrez ·

    Uma posição é mais do que peças

    O modelo representa ameaças, espaço, segurança do rei e planos possíveis ao mesmo tempo.

    O mesmo princípio vale fora da linguagem. Modelos treinados apenas para prever a próxima jogada em partidas de Othello ou de xadrez desenvolvem representações internas do tabuleiro — onde está cada peça e, no xadrez, até uma estimativa da força dos jogadores. A cena ilustra a ideia: ameaças, centro, rei e espaço vistos em conjunto.

    Ver cena
  18. 17 · Emergência ·

    A jogada emerge do estado

    “Cavalo para e5” não vem de uma regra isolada, mas de uma representação rica da posição.

    “Cavalo para e5” não sai de uma regra do tipo “se acontecer X, jogue Y”. Sai da representação da posição inteira, construída camada por camada — o mesmo mecanismo que escolhe a próxima palavra de uma frase.

    Ver cena
  19. Epílogo ·

    Aprender é ajustar previsões

    Da próxima palavra à próxima jogada: o conhecimento emerge de incontáveis pequenas correções.

    Contexto, representação, previsão. Tudo o que um Transformer sabe vem de incontáveis pequenas correções nesse ciclo — da próxima palavra à próxima jogada.

    Ver cena

Perguntas frequentes

O que é um Transformer?

É uma arquitetura de rede neural apresentada em 2017 no artigo “Attention Is All You Need” (Vaswani et al.). Ela processa sequências com mecanismos de atenção em vez de recorrência, o que permite treinar em paralelo com enormes quantidades de dados. É a base dos grandes modelos de linguagem atuais.

O que é um token?

É a unidade em que o texto é dividido antes de entrar no modelo: uma palavra, um pedaço de palavra ou um sinal de pontuação. Cada token corresponde a um número em um vocabulário fixo. Palavras frequentes costumam ser um único token; palavras raras se dividem em vários.

O que faz o mecanismo de atenção?

Para cada token, ele calcula pesos sobre os outros tokens do contexto e combina a informação deles de acordo com esses pesos. É assim que uma palavra como “ele” encontra o nome a que se refere. Em um modelo que gera texto, cada token só olha para os tokens anteriores.

O que são a loss e a backpropagation?

A loss é o número que mede o erro de uma previsão — geralmente a entropia cruzada, que aumenta quando o modelo dá pouca probabilidade ao token certo. A backpropagation calcula quanto cada peso contribuiu para esse erro, e o otimizador ajusta os pesos no sentido que o reduz.

Um modelo que só prevê a próxima palavra entende alguma coisa?

Prever bem obriga a capturar estrutura: gramática, fatos, relações de causa e efeito. Há evidência de que esses modelos formam representações internas do mundo — por exemplo, do estado de um tabuleiro de jogo. Mas isso não é compreensão humana: os modelos também erram com confiança e inventam fatos plausíveis.

Qual é a diferença entre treinamento e uso (inferência)?

No treinamento, o modelo vê a resposta certa, mede o erro e ajusta os pesos. No uso, os pesos ficam fixos: o modelo apenas calcula o próximo token a partir do contexto, acrescenta esse token e repete.

Para saber mais

Os artigos na origem de cada ideia da animação:

  1. Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS 2017.
  2. Sennrich, R., Haddow, B. & Birch, A. (2016). Neural Machine Translation of Rare Words with Subword Units. ACL 2016.
  3. Rumelhart, D. E., Hinton, G. E. & Williams, R. J. (1986). Learning representations by back-propagating errors. Nature 323, 533–536.
  4. Kingma, D. P. & Ba, J. (2015). Adam: A Method for Stochastic Optimization. ICLR 2015.
  5. Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv.
  6. Li, K. et al. (2023). Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task. ICLR 2023.
  7. Karvonen, A. (2024). Emergent World Models and Latent Variable Estimation in Chess-Playing Language Models. arXiv.