Gravit

Como um Transformer aprende a prever

Anatomia de uma previsão

Prólogo

Tudo começa com texto

Milhões de frases dão ao modelo uma tarefa simples: adivinhar o que vem a seguir.

01 / 24

A animação não carregou. O texto integral das 24 cenas está logo abaixo; para tentar de novo, recarregue a página.

00:00 / 13:16

Explicador animado com narração · 24 cenas · 13 min 16 s

Um Transformer não aprende com regras escritas por alguém. Aprende com uma única tarefa, repetida sobre biliões de tokens de texto: prever o token seguinte. Esta animação mostra esse ciclo — do texto aos tokens, da atenção multi-cabeça à previsão, do erro ao ajuste dos pesos — e responde à pergunta que mais importa: porque é que um objetivo tão simples dá origem a modelos que compreendem, constroem uma imagem do mundo e planeiam à frente, como um jogador de xadrez que faz um lance de cada vez com uma estratégia na cabeça.

Em resumo

  • Um Transformer é treinado numa única tarefa: prever o próximo token de um texto.
  • O texto é partido em tokens; cada token torna-se um vetor (embedding), e a atenção — com muitas cabeças em paralelo, cada uma a seguir uma relação diferente — decide que partes do contexto importam para cada token.
  • No treino, a previsão é comparada com o token verdadeiro; o erro (loss) é propagado para trás (backpropagation) e cada peso é ajustado um pouco, sobre biliões de tokens.
  • Prever bem obriga a compreender: para adivinhar a última palavra de um policial é preciso ter seguido o enredo. Por isso emergem representações internas do mundo — até de um tabuleiro de Othello que o modelo nunca viu, lido por dentro e editável.
  • O modelo escreve um token de cada vez, mas planeia à frente: escolhe a rima antes de escrever o verso, e passa por «Texas» antes de responder «Austin». Escrever os passos (uma cadeia de raciocínio) dá-lhe ainda mais espaço para pensar.
  • Como um jogador de xadrez: um lance de cada vez, com uma visão do tabuleiro e uma estratégia. Até onde isto vai ainda é uma pergunta em aberto — os modelos continuam a errar com confiança.

As 24 cenas, uma a uma

Cada cena mostra o momento em que começa na animação; carregue em «Ver cena» para saltar para ela. O texto longo de cada cena é exatamente o que a narração diz — serve de transcrição. Os números que a animação mostra (probabilidades, erro, pesos, lances) são ilustrativos, não medições de um modelo real.

  1. Prólogo ·

    Tudo começa com texto

    Milhões de frases dão ao modelo uma tarefa simples: adivinhar o que vem a seguir.

    Um modelo de linguagem é treinado para uma única tarefa: ler um pedaço de texto e adivinhar o que vem a seguir. Não há regras escritas à mão nem um objetivo escondido. Parece quase trivial, como o corretor automático do telemóvel. A pergunta a que esta animação responde é como é que um jogo tão simples dá origem a um sistema capaz de explicar, planear e raciocinar. A resposta curta: para jogar bem este jogo, o modelo tem de construir uma imagem do mundo por trás das palavras, e aprender a pensar à frente.

    Ver cena
  2. 01 · Dados ·

    Uma frase de cada vez

    O modelo não recebe regras. Recebe exemplos de linguagem tal como ela é usada.

    O material de treino é texto real: livros, artigos, código, conversas. Cada frase é, ao mesmo tempo, pergunta e resposta. As primeiras palavras são o contexto, e a palavra seguinte é o que o modelo tem de acertar. Ninguém lhe explica gramática, física ou xadrez. O que vier a saber sobre isso, tem de o descobrir pela maneira como as pessoas escrevem sobre isso.

    Ver cena
  3. 02 · Tokenização ·

    Texto torna-se peças

    Palavras e fragmentos são convertidos em tokens — pequenas unidades numeradas.

    Antes de qualquer cálculo, o texto é cortado em tokens: palavras inteiras, pedaços de palavras ou sinais de pontuação, cada um com um número num vocabulário fixo de dezenas de milhares de entradas. As palavras frequentes costumam ser um só token; as raras dividem-se em vários. A partir daqui, o modelo só vê sequências de números. Os números no ecrã são ilustrativos.

    Ver cena
  4. 03 · Embeddings ·

    Cada token ganha posição

    Um número transforma-se num ponto num espaço com milhares de dimensões.

    Cada token torna-se um vetor: uma lista de centenas ou milhares de números, um ponto num espaço com outras tantas dimensões. Com o treino, os tokens usados de maneira parecida ficam perto uns dos outros, e as direções desse espaço passam a querer dizer coisas, como singular e plural, ou passado e presente. A posição de cada token na frase também é codificada, para que a ordem das palavras conte.

    Ver cena
  5. 04 · Atenção ·

    Cada palavra olha para as outras

    A atenção mede que partes do contexto são importantes para compreender cada token.

    A atenção é o coração do Transformer. Cada token faz uma pergunta, a chamada query. Cada token anterior oferece uma chave, e onde a pergunta e a chave combinam, a informação desse token passa. Em «O gato dorme ao sol», é assim que «sol» vai buscar informação a «dorme» e a «gato». Para onde olhar não é uma regra fixa: é aprendido, e muda com o contexto.

    Ver cena
  6. 05 · Atenção multi-cabeça ·

    Muitos olhares ao mesmo tempo

    Cada cabeça aprende a seguir uma relação diferente: quem faz o quê, onde, o que veio mesmo antes.

    E a atenção não acontece uma vez só. Cada camada corre muitas cabeças de atenção em paralelo, dezenas nos modelos grandes, cada uma com as suas perguntas, chaves e valores. Uma cabeça aprende a ligar o verbo ao sujeito; outra liga uma palavra ao sítio onde a ação acontece; outra olha simplesmente para a palavra anterior; outra acompanha o tema. No fim, os resultados juntam-se. É como olhar para uma posição de xadrez com vários pares de olhos ao mesmo tempo: o material, as ameaças, a estrutura, a segurança do rei. Ninguém distribui estes papéis. Aparecem porque ajudam a prever.

    Ver cena
  7. 06 · Camadas ·

    A ideia é refinada

    Camada após camada, relações simples tornam-se padrões cada vez mais abstratos.

    Um Transformer empilha dezenas destes blocos: atenção, seguida de uma pequena rede que trabalha cada token por si. Cada bloco lê o que os anteriores deixaram e escreve informação nova por cima, numa corrente que atravessa o modelo inteiro. As primeiras camadas captam padrões próximos, como a gramática. As mais fundas constroem significados, relações e, como vamos ver, planos.

    Ver cena
  8. 07 · Previsão ·

    Qual será o próximo token?

    No fim, o modelo atribui uma probabilidade a cada continuação possível.

    No topo da pilha, o modelo transforma a representação final numa pontuação para cada token do vocabulário, e uma função chamada softmax transforma essas pontuações em probabilidades que somam cem por cento. «Sol» fica com sessenta e dois por cento, mas «lado», «fim» e «som» também são possíveis. O modelo não devolve uma palavra. Devolve uma paisagem inteira de possibilidades.

    Ver cena
  9. 08 · Realidade ·

    A resposta certa já era conhecida

    Durante o treino, comparamos a previsão com o token que realmente vinha a seguir.

    No treino, o texto já existe, por isso o token seguinte verdadeiro é conhecido. Ninguém tem de etiquetar nada: o próprio texto é a folha de respostas. Chama-se a isto aprendizagem auto-supervisionada, e é por isso que estes modelos conseguem aprender com quase tudo o que a humanidade já escreveu.

    Ver cena
  10. 09 · Loss ·

    Medir o erro

    Um número resume a distância entre a previsão do modelo e a continuação correta.

    A distância entre a previsão e a verdade torna-se um único número, a loss, normalmente a entropia cruzada. Se o modelo deu muita probabilidade ao token certo, a loss é pequena. Se errou com confiança, a loss é grande. Tudo o que o modelo vier a aprender nasce de tentar tornar este número mais pequeno.

    Ver cena
  11. 10 · Backpropagation ·

    O erro viaja para trás

    O sistema calcula quanto cada ligação contribuiu para aquele erro.

    A retropropagação, ou backpropagation, manda o erro para trás pela rede, da última camada para a primeira, e calcula, para cada um de milhares de milhões de pesos, em que sentido, e quanto, uma pequena mudança teria reduzido o erro. É a regra da cadeia do cálculo, aplicada a uma escala enorme.

    Ver cena
  12. 11 · Pesos ·

    Milhões de ajustes minúsculos

    Cada peso muda um pouco, tornando a próxima previsão ligeiramente melhor.

    Depois, um otimizador, como o Adam, empurra cada peso numa quantidade minúscula, no sentido que reduz o erro. Nenhum passo, sozinho, ensina alguma coisa que se possa apontar. O conhecimento acumula-se como se forma o leito de um rio: de incontáveis pequenas correções, todas a empurrar para o mesmo lado.

    Ver cena
  13. 12 · Escala ·

    Repetir. E repetir.

    Este ciclo acontece com enormes quantidades de texto, muitas vezes e em paralelo.

    Prever, medir, ajustar. O ciclo repete-se sobre biliões de tokens, em milhares de processadores a trabalhar em paralelo durante meses. As chamadas leis de escala mostram que o erro desce de forma previsível quando crescem os dados, o tamanho do modelo e o cálculo. E, com a escala, continuam a aparecer capacidades para as quais ninguém treinou diretamente.

    Ver cena
  14. 13 · Aprendizagem ·

    O erro começa a descer

    Sem memorizar uma lista de regras, o modelo aprende regularidades profundas.

    A loss desce depressa no início e depois cada vez mais devagar. Os padrões fáceis, como a ortografia, a gramática e as expressões feitas, aprendem-se cedo. O que sobra é mais difícil: factos, lógica, as intenções das pessoas, a maneira como as situações se desenrolam. É nessas últimas frações de erro que vive a compreensão.

    Ver cena
  15. 14 · Porque é difícil ·

    Para prever, é preciso compreender

    Para adivinhar a última palavra de um policial, é preciso ter seguido o enredo todo.

    É por isto que prever o token seguinte não é um truque superficial. Imagine um romance policial que acaba assim: «e o assassino era…». Para prever essa única palavra, não basta saber que nomes são frequentes. É preciso acompanhar as personagens, as pistas, os álibis e os motivos ao longo de centenas de páginas. É um exemplo que Ilya Sutskever, um dos fundadores da OpenAI, gosta de usar. O mesmo vale para uma demonstração, um programa ou um argumento jurídico. Quanto melhor a previsão, mais do mundo por trás do texto o modelo tem de captar. A previsão é o teste; a compreensão é o que é preciso para passar nele.

    Ver cena
  16. 15 · Interior ·

    Nasce um mapa invisível

    Conceitos, relações, estilos e estruturas organizam-se em representações internas.

    Dentro da rede, conceitos e relações organizam-se em representações internas: direções e regiões do espaço dos vetores que correspondem a ideias como «animal», «movimento» ou «luz». Os investigadores conseguem encontrá-las, e até ligá-las e desligá-las para mudar o que o modelo diz. Ninguém as programou. Apareceram porque ajudam a prever.

    Ver cena
  17. 16 · Modelo do mundo ·

    Prever exige compreender estrutura

    Para continuar bem uma frase, o modelo tem de capturar algo sobre como o mundo funciona.

    Algumas destas representações parecem um modelo do mundo. Investigadores descobriram que os modelos de linguagem codificam a latitude e a longitude dos lugares, e a época em que viveram figuras históricas, como linhas retas dentro do seu espaço de vetores, aprendidas só a partir de texto. Para continuar bem frases sobre causas, tempos e distâncias, compensa representar causas, tempos e distâncias.

    Ver cena
  18. 17 · Um tabuleiro por dentro ·

    Um tabuleiro que ninguém lhe mostrou

    Treinado só com listas de jogadas, o modelo constrói a sua própria imagem do tabuleiro.

    A prova mais clara vem dos jogos. Investigadores treinaram um Transformer só com listas de jogadas de Othello, como «d3, c5, f6»: sem imagens do tabuleiro, sem regras. Depois olharam lá para dentro. O estado do tabuleiro inteiro, que peça estava em que casa, podia ler-se diretamente nas suas ativações. E quando editaram esse tabuleiro interno, as jogadas seguintes do modelo mudaram para se ajustarem à posição editada. Não tinha decorado sequências. Tinha construído o tabuleiro. Um modelo treinado da mesma forma com partidas de xadrez faz o mesmo, e até estima a força dos jogadores.

    Ver cena
  19. 18 · Planear ·

    Uma palavra de cada vez, com um plano

    Antes de escrever o verso, o modelo já escolheu a palavra com que vai rimar.

    Escrever um token de cada vez não quer dizer pensar um token de cada vez. Quando um modelo escreve dois versos que rimam, os investigadores descobriram que ele escolhe a palavra da rima antes de começar o segundo verso, e depois constrói o verso para lá chegar. Mude-se essa escolha interna, e o verso inteiro muda. Quando lhe perguntam pela capital do estado onde fica Dallas, primeiro representa internamente «Texas», e só depois diz «Austin». Como um jogador de xadrez, faz um lance de cada vez, com um plano já na cabeça.

    Ver cena
  20. 19 · Novo contexto ·

    Agora, sem a resposta

    Na utilização real, o modelo vê apenas o contexto e calcula o token seguinte.

    Na utilização, a chamada inferência, já não há resposta certa para comparar nem pesos para ajustar. O modelo recebe um contexto novo, calcula a distribuição do token seguinte, escolhe um, acrescenta-o ao texto e repete. Cada palavra de uma resposta é uma nova previsão, feita com tudo o que já foi escrito à vista.

    Ver cena
  21. 20 · Raciocínio ·

    Pensar em voz alta

    Cada token que escreve volta a ser contexto: escrever os passos dá-lhe espaço para raciocinar.

    Falta uma peça. Uma passagem pela rede tem uma quantidade fixa de cálculo. Mas cada token que o modelo escreve volta a entrar como contexto. Por isso, quando escreve os passos intermédios, uma cadeia de raciocínio, dá a si próprio um rascunho e mais cálculo, como um jogador de xadrez que calcula variantes antes de tocar numa peça. Os modelos de raciocínio atuais são treinados, com aprendizagem por reforço, para pensar assim durante mais tempo antes de responder, e por isso resolvem problemas muito mais difíceis.

    Ver cena
  22. 21 · Xadrez ·

    Uma posição é mais do que peças

    O modelo representa ameaças, espaço, segurança do rei e planos possíveis ao mesmo tempo.

    Voltemos ao xadrez. Um jogador forte não vê trinta e duas peças. Vê ameaças, casas fracas, um rei exposto, um plano. Modelos de linguagem treinados só a prever a jogada seguinte na notação do xadrez desenvolvem representações internas do mesmo tipo: onde está cada peça, e até uma estimativa da força dos jogadores. E um Transformer treinado para prever boas jogadas, sem qualquer pesquisa, chegou ao nível de grande mestre em blitz.

    Ver cena
  23. 22 · Emergência ·

    A jogada emerge do estado

    «Cavalo para e5» não vem de uma regra isolada, mas de uma representação rica da posição.

    Por isso, «cavalo para e5» não sai de uma regra do tipo «se acontecer isto, joga aquilo». Sai de uma imagem da posição inteira, construída camada a camada, e daquilo a que essa posição pode levar. É a mesma maquinaria que escolhe a palavra seguinte de uma frase: um lance de cada vez, cada lance informado por uma visão do tabuleiro inteiro.

    Ver cena
  24. Epílogo ·

    Aprender é ajustar previsões

    Da próxima palavra à próxima jogada: o conhecimento emerge de incontáveis correções pequenas.

    Contexto, representação, previsão. Tudo o que um Transformer sabe vem de incontáveis pequenas correções a este ciclo. Prever o token seguinte é o objetivo, não o limite: para prever bem, o modelo tem de representar o mundo por trás das palavras e planear para onde elas vão. Até onde isto vai ainda é uma pergunta em aberto. Estes modelos ainda erram com confiança, e a imagem que têm do mundo pode ter buracos. Mas a palavra seguinte é só o lance que se vê. A estratégia está por baixo.

    Ver cena

Perguntas frequentes

O que é um Transformer?

É uma arquitetura de rede neuronal apresentada em 2017 no artigo «Attention Is All You Need» (Vaswani et al.). Processa sequências com mecanismos de atenção em vez de recorrência, o que permite treinar em paralelo com enormes quantidades de dados. É a base dos grandes modelos de linguagem atuais.

O que é um token?

É a unidade em que o texto é partido antes de entrar no modelo: uma palavra, um pedaço de palavra ou um sinal de pontuação. Cada token corresponde a um número num vocabulário fixo. Palavras frequentes costumam ser um só token; palavras raras dividem-se em vários.

O que faz o mecanismo de atenção?

Para cada token, compara a sua pergunta (query) com as chaves (keys) dos tokens anteriores e combina a informação deles (values) de acordo com essa semelhança. É assim que uma palavra como «ele» vai buscar o nome a que se refere. Num modelo que gera texto, cada token só olha para os tokens anteriores.

O que é a atenção multi-cabeça?

Em cada camada, a atenção corre várias vezes em paralelo — dezenas de «cabeças» nos modelos grandes —, cada uma com as suas próprias perguntas, chaves e valores. Cada cabeça aprende a seguir uma relação diferente: o sujeito de um verbo, a palavra anterior, aquilo a que um pronome se refere, o tema. Os resultados de todas são depois combinados. Ninguém atribui os papéis: especializam-se durante o treino, porque isso ajuda a prever.

O que são a loss e a backpropagation?

A loss é o número que mede o erro de uma previsão — normalmente a entropia cruzada, que aumenta quando o modelo dá pouca probabilidade ao token certo. A backpropagation calcula quanto cada peso contribuiu para esse erro, e o otimizador ajusta os pesos no sentido que o reduz.

Como é que prever a palavra seguinte pode dar raciocínio?

Porque prever bem é difícil: para adivinhar o nome do assassino na última página de um policial, é preciso ter seguido o enredo inteiro. Para baixar o erro, o modelo tem de representar o que está por trás do texto. Há evidência experimental disso: um Transformer treinado só com lances de Othello forma uma imagem interna do tabuleiro, que se lê e se edita por dentro; e em modelos de linguagem vê-se o modelo a escolher a rima antes de escrever o verso e a passar por «Texas» antes de responder «Austin». Como um jogador de xadrez, joga um lance de cada vez, mas cada lance sai de uma visão do tabuleiro e de um plano.

Então estes modelos compreendem como nós?

Não da mesma maneira, e até onde vai essa compreensão é uma pergunta em aberto. As representações internas podem ser parciais ou incoerentes, e os modelos continuam a errar com confiança e a inventar factos plausíveis. O que a evidência mostra é que prever o token seguinte não é só estatística de superfície: força o modelo a construir estrutura.

Qual é a diferença entre treino e utilização (inferência)?

No treino, o modelo vê a resposta certa, mede o erro e ajusta os pesos. Na utilização, os pesos ficam fixos: o modelo apenas calcula o token seguinte a partir do contexto, acrescenta-o e repete. Quando escreve os passos intermédios antes da resposta (uma cadeia de raciocínio), cada passo volta a entrar como contexto e dá-lhe mais espaço para pensar.

Para saber mais

Os artigos que estão na origem de cada ideia da animação:

  1. Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS 2017.
  2. Sennrich, R., Haddow, B. & Birch, A. (2016). Neural Machine Translation of Rare Words with Subword Units. ACL 2016.
  3. Clark, K., Khandelwal, U., Levy, O. & Manning, C. D. (2019). What Does BERT Look At? An Analysis of BERT’s Attention. BlackboxNLP 2019.
  4. Voita, E. et al. (2019). Analyzing Multi-Head Self-Attention: Specialized Heads Do the Heavy Lifting, the Rest Can Be Pruned. ACL 2019.
  5. Rumelhart, D. E., Hinton, G. E. & Williams, R. J. (1986). Learning representations by back-propagating errors. Nature 323, 533–536.
  6. Kingma, D. P. & Ba, J. (2015). Adam: A Method for Stochastic Optimization. ICLR 2015.
  7. Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv.
  8. Gurnee, W. & Tegmark, M. (2024). Language Models Represent Space and Time. ICLR 2024.
  9. Li, K. et al. (2023). Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task. ICLR 2023.
  10. Nanda, N., Lee, A. & Wattenberg, M. (2023). Emergent Linear Representations in World Models of Self-Supervised Sequence Models. BlackboxNLP 2023.
  11. Karvonen, A. (2024). Emergent World Models and Latent Variable Estimation in Chess-Playing Language Models. arXiv.
  12. Lindsey, J. et al. (2025). On the Biology of a Large Language Model. Transformer Circuits.
  13. Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.
  14. DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv.
  15. Ruoss, A. et al. (2024). Grandmaster-Level Chess Without Search. arXiv.