

Inferência: o custo que decide o projeto de IA
Inferência é usar o modelo treinado para responder. O preço por token cai, mas a conta sobe: um agente com 8 chamadas encadeadas custa 8 vezes um assistente de turno único.


Inferência é usar o modelo treinado para responder. O preço por token cai, mas a conta sobe: um agente com 8 chamadas encadeadas custa 8 vezes um assistente de turno único.


Banco vetorial armazena embeddings e busca por similaridade. Até cerca de 10 milhões de vetores, a extensão do Postgres que você já opera costuma resolver — e elimina um sistema do stack.


Alucinação é quando a IA afirma algo sem lastro. Num teste que recompensa dizer não sei, apenas 3 modelos pontuaram acima de zero — a maioria erra mais do que acerta.


Fine-tuning ensina formato e tom de voz, não fatos. Estudo da EMNLP 2024 mostra que tentar ensinar conhecimento novo por essa via aumenta linearmente a alucinação.


Embedding representa texto como números para permitir busca por significado. Mais dimensões não é melhor: a técnica Matryoshka entrega vetores 14× menores com a mesma acurácia.


Transformer é a arquitetura que viabilizou a IA generativa, com mais de 189 mil citações. Seu custo quadrático explica por que contexto longo é caro — e por que já estão removendo partes dela.


LLM é o modelo de linguagem por trás do ChatGPT e do Claude. A regra de que mais parâmetros significa mais capacidade foi refutada em replicação — e um modelo de 32B lidera o ranking de alucinação.


Token é a unidade de cobrança das APIs de IA. Estudo com 25 idiomas mostra que o português consome de 25% a 40% mais tokens que o inglês para dizer a mesma coisa.


H100 de 80 GB entre US$ 2,89 e 3,29 por hora; RTX 4090 por US$ 0,74. A conta que decide o projeto não é o preço da placa, é o tempo que ela fica ociosa.


Quantização reduz a precisão dos pesos para o modelo caber em hardware menor. FP8 sai praticamente sem perda; INT8 custa de 1% a 3% de acurácia.