**MoE** — sigla de *Mixture of Experts*, ou mistura de especialistas — é a arquitetura em que o modelo se divide em muitos blocos especializados e, a cada token processado, **um roteador ativa apenas alguns deles**. O resultado é um modelo com capacidade enorme e custo de processamento de um modelo bem menor. É a arquitetura dominante entre os modelos abertos de topo em 2026, e a razão técnica de existirem modelos na casa dos trilhões de parâmetros. Os números oficiais mostram a dimensão da economia: o **[DeepSeek](https://clubmartech.com.br/blog/deepseek-marketing-[ia](https://clubmartech.com.br/blog/ia-marketing-vendas-inteligentes/)-[roi](https://clubmartech.com.br/blog/roi-redes-sociais-acao/)/)-V3 tem 671 bilhões de parâmetros totais e ativa 37 bilhões** por token; o **Kimi K3 declara 2,8 trilhões de totais e 104 bilhões de ativos**. Ativa-se algo entre 4% e 6% do modelo a cada passo — e é justamente essa diferença entre “total” e “ativo” que produz o erro de dimensionamento mais caro da categoria.## Totais e ativos nos modelos abertosTodos os valores abaixo vêm de documentação oficial dos fabricantes:
| Modelo | Parâmetros totais | Ativos por token |
|---|---|---|
| **Kimi K3** | 2,8 T | 104 B |
| [DeepSeek](https://clubmartech.com.br/blog/deepseek-marketing-[ia](https://clubmartech.com.br/blog/ia-marketing-vendas-inteligentes/)-roi/)-V3 | 671 B | 37 B |
| Llama 4 Maverick | 400 B | 17 B |
| Qwen3-235B | 235 B | 22 B |
| Mixtral 8x22B | 141 B | 39 B |
| gpt-oss-120b | 117 B | 5,1 B |
A ideia não é nova: o trabalho que a estabeleceu em [redes neurais](https://clubmartech.com.br/blog/redes-neurais-artificiais-praticas/) modernas é de **2017**, e já relatava ganho de **mais de mil vezes em capacidade** com perda pequena de eficiência computacional.## ⚠️ O erro que faz comprar hardware insuficienteVer “104 bilhões de ativos” e concluir que o modelo cabe numa máquina dimensionada para 104 bilhões de parâmetros é o erro clássico. **Não cabe.**A razão é simples: o roteador escolhe quais especialistas usar **a cada token**, e a escolha muda de token para token. Isso significa que **todos os especialistas precisam estar carregados em memória**, prontos para serem convocados. A documentação de um servidor de inferência amplamente usado é explícita sobre a distribuição: os pesos de atenção são replicados entre as placas, enquanto **os pesos dos especialistas são divididos entre elas** — divididos, nunca omitidos.Uma precisão que vale fazer: isso **não** significa que tudo precise caber numa única GPU. A técnica de paralelismo de especialistas existe exatamente para distribuí-los entre várias placas. O que se dimensiona pelos totais é **a memória agregada do conjunto** — por isso um modelo como o DeepSeek-V3 é implantado em nós de oito placas, e não numa só.A regra prática: **os totais determinam quanta memória você precisa ter; os ativos determinam a velocidade**.## O que isso muda na práticaPara quem consome IA por API, a arquitetura é invisível — e o efeito é positivo: **MoE é parte da razão de modelos muito capazes terem preço acessível por token**, já que o fornecedor paga processamento proporcional aos ativos.Para quem cogita rodar modelo próprio, duas consequências diretas:
- **Orce pela memória total, sempre.** Um modelo de 671 bilhões não roda em [infraestrutura](https://clubmartech.com.br/blog/infraestrutura-[dados](https://clubmartech.com.br/blog/dados-transformar-volume-acionavel/)-ia-meses/) de 37 bilhões, por mais que o material de divulgação destaque o número menor.
- **Modelo aberto grande não significa acessível.** “Pesos abertos” e “rodável na sua empresa” são coisas diferentes — a conta está em GPU e TPU e no guia de self-host.
A técnica que reduz o tamanho desses pesos está em
quantização.## Fontes
- Card do Kimi K3 · DeepSeek-V3 · Qwen3-235B · gpt-oss-120b
- Outrageously Large Neural Networks — Shazeer et al., 2017, o trabalho fundador
- Expert parallel deployment — vLLM, distribuição dos pesos de especialistas
*Leitura das fontes em 17/08/2026.*