Quantização: Fazendo a IA Caber no Seu Bolso
Um modelo em FP32 (32 bits por número) é preciso, mas enorme. Quantizar é reduzir a precisão dos pesos — como comprimir uma imagem. Você perde um pouco de qualidade, mas ganha MUITO em velocidade e tamanho.
📦 GGUF (llama.cpp)
Formato do projeto llama.cpp. Permite rodar LLMs em CPU, celular, Raspberry Pi. Quantizações Q4_K_M, Q5_K_S, etc.
⚡ AWQ
Activation-aware Weight Quantization. Preserva pesos importantes. Muito rápido em GPU NVIDIA.
🎯 GPTQ
Quantização baseada em aproximação de GPT. Clássico para INT4 em GPU.
🔥 ExLlamaV2 / EXL2
Quantização mista por camada. Otimizado para velocidade extrema em GPU.
Exemplo prático: Llama 3 8B em FP16 = 16 GB. Em Q4 = 4.5 GB. Cabe no seu notebook.
Hardware: Onde a IA Acontece
Cada tipo de processador é otimizado para tarefas diferentes. Entender isso explica por que alguns modelos rodam no seu celular e outros precisam de datacenters inteiros.
CPU
Central Processing Unit. Poucos núcleos poderosos. Ótima para tarefas gerais, lógica complexa, sistemas operacionais. Lenta para IA, mas universal. Ex: Intel Core, AMD Ryzen, Apple M-series (parte CPU).
GPU
Graphics Processing Unit. Milhares de núcleos pequenos. Feita para fazer muitas contas simples ao mesmo tempo — exatamente o que redes neurais fazem. Ex: NVIDIA H100, RTX 4090, AMD MI300. É o coração da IA moderna.
NPU
Neural Processing Unit. Chip dedicado a inferência de IA. Baixo consumo. Presente em celulares modernos (Snapdragon 8 Gen 3, Apple Neural Engine, Intel Core Ultra). Roda modelos quantizados localmente.
TPU
Tensor Processing Unit. Chip do Google, feito sob medida para TensorFlow. Usado em datacenters para treinar e servir Gemini. Gerações: TPU v4, v5p, v6 (Trillium). Extremamente eficiente em matrizes.
🔥 ASIC
Circuitos de aplicação específica. Groq LPU, Cerebras, Graphcore IPU — cada um com uma arquitetura única para IA.
💡 Regra prática
Treinar modelo gigante → GPU/TPU cluster. Rodar no celular → NPU com modelo quantizado. Servir API → GPU datacenter.
🌍 A corrida dos chips
NVIDIA domina o mercado. AMD, Intel, Google, Amazon (Trainium), Microsoft (Maia) e China (Huawei Ascend) correm atrás.