

Knowledge distillation: 40% menor, 97% da capacidade
Treinar um modelo pequeno para imitar um grande. O DistilBERT ficou 40% menor e 60% mais rápido retendo 97% da capacidade — mas destilar não é grátis.


Treinar um modelo pequeno para imitar um grande. O DistilBERT ficou 40% menor e 60% mais rápido retendo 97% da capacidade — mas destilar não é grátis.


Mistura de especialistas ativa só parte do modelo por token. O Kimi K3 tem 2,8T de totais e 104B de ativos — e a memória se dimensiona pelos totais.


Treinado sobre dados amplos e adaptável a muitas tarefas. Quem cunhou o termo alertou: os defeitos da fundação passam para tudo o que se constrói nela.


Processa sequências um elemento por vez. Foi substituída pelo Transformer e voltou reformulada, com 5× mais throughput de inferência.


Rede convolucional processa imagens detectando padrões locais. Venceu o ImageNet 2012 por quase 11 pontos — e não saiu de cena.


Mecanismo que pesa a relevância de cada parte do texto. Ler os pesos como explicação do modelo é contestado na literatura desde 2019.


Introduz a não-linearidade que torna a rede capaz de representar relações complexas. A escolha dominante venceu por teste, não por teoria.


Parâmetro é aprendido no treino; hiperparâmetro é decidido antes. Só alguns hiperparâmetros importam — e quais mudam de problema para problema.


Sequência finita de passos precisamente definidos, na definição de Knuth. Dizer que o algoritmo decidiu transfere responsabilidade de quem escolheu.


RLHF usa preferência humana para alinhar modelos. Em 2026 o DPO substituiu o reforço clássico — por ser mais estável e mais barato.