MoE: dimensione pelos totais, não pelos ativos

Mistura de especialistas ativa só parte do modelo por token. O Kimi K3 tem 2,8T de totais e 104B de ativos — e a memória se dimensiona pelos totais.

**MoE** — sigla de *Mixture of Experts*, ou mistura de especialistas — é a arquitetura em que o modelo se divide em muitos blocos especializados e, a cada token processado, **um roteador ativa apenas alguns deles**. O resultado é um modelo com capacidade enorme e custo de processamento de um modelo bem menor. É a arquitetura dominante entre os modelos abertos de topo em 2026, e a razão técnica de existirem modelos na casa dos trilhões de parâmetros. Os números oficiais mostram a dimensão da economia: o **[DeepSeek](https://clubmartech.com.br/blog/deepseek-marketing-[ia](https://clubmartech.com.br/blog/ia-marketing-vendas-inteligentes/)-[roi](https://clubmartech.com.br/blog/roi-redes-sociais-acao/)/)-V3 tem 671 bilhões de parâmetros totais e ativa 37 bilhões** por token; o **Kimi K3 declara 2,8 trilhões de totais e 104 bilhões de ativos**. Ativa-se algo entre 4% e 6% do modelo a cada passo — e é justamente essa diferença entre “total” e “ativo” que produz o erro de dimensionamento mais caro da categoria.## Totais e ativos nos modelos abertosTodos os valores abaixo vêm de documentação oficial dos fabricantes:

ModeloParâmetros totaisAtivos por token
**Kimi K3**2,8 T104 B
[DeepSeek](https://clubmartech.com.br/blog/deepseek-marketing-[ia](https://clubmartech.com.br/blog/ia-marketing-vendas-inteligentes/)-roi/)-V3671 B37 B
Llama 4 Maverick400 B17 B
Qwen3-235B235 B22 B
Mixtral 8x22B141 B39 B
gpt-oss-120b117 B5,1 B

A ideia não é nova: o trabalho que a estabeleceu em [redes neurais](https://clubmartech.com.br/blog/redes-neurais-artificiais-praticas/) modernas é de **2017**, e já relatava ganho de **mais de mil vezes em capacidade** com perda pequena de eficiência computacional.## ⚠️ O erro que faz comprar hardware insuficienteVer “104 bilhões de ativos” e concluir que o modelo cabe numa máquina dimensionada para 104 bilhões de parâmetros é o erro clássico. **Não cabe.**A razão é simples: o roteador escolhe quais especialistas usar **a cada token**, e a escolha muda de token para token. Isso significa que **todos os especialistas precisam estar carregados em memória**, prontos para serem convocados. A documentação de um servidor de inferência amplamente usado é explícita sobre a distribuição: os pesos de atenção são replicados entre as placas, enquanto **os pesos dos especialistas são divididos entre elas** — divididos, nunca omitidos.Uma precisão que vale fazer: isso **não** significa que tudo precise caber numa única GPU. A técnica de paralelismo de especialistas existe exatamente para distribuí-los entre várias placas. O que se dimensiona pelos totais é **a memória agregada do conjunto** — por isso um modelo como o DeepSeek-V3 é implantado em nós de oito placas, e não numa só.A regra prática: **os totais determinam quanta memória você precisa ter; os ativos determinam a velocidade**.## O que isso muda na práticaPara quem consome IA por API, a arquitetura é invisível — e o efeito é positivo: **MoE é parte da razão de modelos muito capazes terem preço acessível por token**, já que o fornecedor paga processamento proporcional aos ativos.Para quem cogita rodar modelo próprio, duas consequências diretas:

  • **Orce pela memória total, sempre.** Um modelo de 671 bilhões não roda em [infraestrutura](https://clubmartech.com.br/blog/infraestrutura-[dados](https://clubmartech.com.br/blog/dados-transformar-volume-acionavel/)-ia-meses/) de 37 bilhões, por mais que o material de divulgação destaque o número menor.
  • **Modelo aberto grande não significa acessível.** “Pesos abertos” e “rodável na sua empresa” são coisas diferentes — a conta está em GPU e TPU e no guia de self-host.

A técnica que reduz o tamanho desses pesos está em

quantização

.## Fontes

*Leitura das fontes em 17/08/2026.*

Compartilhe:

Outros termos do universo martech que você precisa conhecer!

Sumário

Receba o melhor conteúdo sobre Marketing e Tecnologia

comunidade gratuita

Cadastre-se para o participar da primeira comunidade sobre Martech do brasil!